DeepSeek「降本增效」衝擊全解
終於我要寫DeepSeek。講到DeepSeek,我覺得我應該是所有關注AI最晚寫的人,那也給我一個有趣的小小優勢。
業界熱議》
DeepSeek三大貢獻 改變AI市場生態
首先,我覺得DeepSeek關於很多的細節與事實,是很晚才被釋放出來。其次,AI極為瘋狂的競爭環境,導致DeepSeek不可能是釋出後就沒有對手的反饋,一定會有對手的反應,才會有對應的釋出。所以基本上就是,我覺得關於DeepSeek的所有細節與對手的反應,是一直到最近,具體就是現在,才整體被釋出,比方說非常值得討論的GPT(生成式預訓練轉換器模型)深度研究這個王牌,現在才被逼出來。
大概就是這樣的情況,這是我目前覺得比較晚寫的好處。
關於DeepSeek的工作細節與文章和邏輯,汗牛充棟,但是我認為比較早出來的文件不是很可靠,因為它通常有幾個問題。
首先,外界不是很清楚或理解,相關的技術整合在過去其實沒有那麼罕見,主要因為DeepSeek是用更高的效能與非常好的成本,把這個邏輯做出來。但這些技術並不是他們發明,他們卻有滿好的強化技術;不管是模型蒸餾或是MOE(混合專家模型),都不是從天上掉下來的技術。事實上,MOE一直是法國Mistral AI的強項,所以這次受到重大衝擊的就有Mistral。
再來是成本部分。雖然宣稱只花600萬美元,但DeepSeek沒有把很多前置的訓練成本計算進來,只算最後的訓練成本。
在宣傳上這是可以理解的,這是一種宣傳的邏輯。如果是你說只有花600萬美元,但實際上的部署費可能在5億美元到10億美元之間,還是用了5萬張GPU,算力可能等同至少有兩萬張較高效能的卡。600萬美元的說法就類似那個老笑話:小資族存錢10年就買到房子,沒說的是自己存錢10年是付了5%的頭期款買了房子,但爸媽卻出了95%房貸啊。
扣除這些過度宣傳事情,然後DeepSeek最大的貢獻有3個:
第1是它因為開源(這一點當然市場也有人在爭議),所以相對可以自行部署,也有釋出對應的開發邏輯。本身對應的論文有把它的食譜一定程度的公開,所以這對於整個AI領域是有極大幫助的。
第2是它證明在這幾個大廠之外,是有可能做出一些新的空間。本來因為GPU問題,很多都放棄了基礎模型的小型科技公司,有機會重新殺入戰局。大家對於工程上的解決方案感覺多了很多可能性,這對整個市場的投資是好事。
第3個貢獻是產生漣漪效應,讓這些大廠願意比較競爭,或是釋出更多的作法。如果不是DeepSeek,我們用上超便宜的谷歌Gemini API與GPU的深度研究恐怕還要很多時間。
DeepSeek對我們最大的幫助,是讓我們了解到對於整體的工程解構還有很大的可能性,現在可以做到很多有趣的可能性,所以不一定只能仰賴大廠,這是一個我覺得滿好的邏輯。雖然5億美元還是很多,但拿得出來的人也是很多。
另外的作法本身也是工程優化,所以成本降了一到兩個數量級,DeepSeek公開後,很多人用類似的工程手段做出類似的模型,AI數據教母李飛飛的團隊,只花了20美元的算力就又蒸餾出一個類似的模型。
盤點商機》
降本增效可能性增加 半導體長線看好
這個有改變AI目前大廠壟斷的態勢嗎?我覺得目前這樣講還是略微樂觀,但在很多領域大廠的壟斷的確會受到嚴重挑戰,尤其是邊緣運算或者堪用就好的場景。
從最近的行動可以看出,大廠的領先優勢依然存在,而且他們可以迅速把API(應用程式開發介面)的價錢降到比DeepSeek還要低(至少暫時是這樣),比如Google Gemini 2。所以這點我認為是稍嫌樂觀,我不覺得大廠的技術水平或費用效能比有那麼差。
由於這次DeepSeek它釋出的時間點是在下一個大廠的釋出更新節點的中間,所以會有立刻追上的感覺,但是從大廠立刻應對的手段可以看出,下一代產品是大家都有所準備的。
那回到這點,既然降本增效的路徑有被找出來,輝達、台積電等公司後續如何?首先本來就不可能讓輝達用如此高的毛利率壟斷,但降本增效可能性增加,一定會增加長期半導體需求,這應該是一個共識,但短期震盪不可免。