導讀:8月13日晚,深度求索正式發布了其旗艦模型DeepSeek-V4-Pro的正式版,距離預覽版上線整整過去了111天。 與此相對,被視爲直接競爭者的Kimi K3已於上月發布。這場發生在“粵籍雙雄”之間的較量,不僅是技術能力的比拼,更折射出全球AI競爭格局的深刻變化。
01 正式版DeepSeek-V4-Pro:補齊了最大短板
DeepSeek-V4-Pro正式版的硬參數與預覽版保持一致:1.6T總參數、49B激活參數的MoE結構,支持1M上下文、384K最大輸出。和預覽版相比,後訓練方面的升級非常明顯,讓性能有了質的飛躍。
最誇張的數位來自Agent相關評測。DeepSWE(DeepSeek自家的軟件工程基準)從預覽版的12.8飆到62.7,漲了近50分;Cybergym從52.7到83.3;Terminal Bench從72.1到87.9;DSBench-Hard翻了一倍多達到67.2。
這些測試的共同特點是——涉及長鏈路的代碼修改、環境操作和工具調用,恰好是預覽版最容易翻車的地方。從V4 Flash正式版的更新日志可以推斷,這輪升級的核心就是面向代碼Agent場景的大規模後訓練。Flash版已經用同樣的方法把Agent能力做到了“遠超預覽版”的程度,Pro版只是補上了同一課。
在真實任務測試中,V4-Pro-0813表現亮眼。實測中,它能完整閉環遊戲開發邏輯,碰撞、計分、結算功能全部正常,頁面配色、交互反饋也擺脫了模板化AI風格。對模糊需求的“產品化補全”能力,相比預覽版有明顯進步。
02 Kimi K3:全球最大開源模型,編程能力登頂
Kimi K3發布於7月16日,擁有2.8萬億總參數,896個專家中每次激活16個,是全球首個開源的3萬億級別模型。
在Artificial Analysis智慧指數上,K3得分57,排名全球第三,僅次於Anthropic的Fable 5(60分)和OpenAI的GPT-5.6 Sol(59分),超過了Claude Opus 4.8。在Frontend Code Arena榜單上,K3以1679分超越Claude Fable 5,登頂全球第一。
在Agent能力上,K3優勢明顯——獨立評測顯示其Agent任務得分89.5,遠超DeepSeek V4 Pro的59.1。在長程軟件工程和連續任務執行方面,K3更具優勢。
但K3也有短板:速度是最大痛點。實測顯示,同一場景生成時間約爲GPT-5.6 Sol的兩到三倍,復雜任務耗時更長。代碼質量雖高,但Token消耗量也更大。
03 各有千秋:一場沒有“碾壓”的對決
根據官方基準測試和第三方測評,兩款模型呈現出“各有千秋”的局面,並未出現一方完全碾壓的情況:
| 維度 | Kimi K3 | DeepSeek-V4-Pro正式版 |
|---|---|---|
| 參數規模 | 2.8T總參數 | 1.6T總參數 |
| Agent能力 | 較強,長程任務優勢明顯 | 大幅提升,已追至接近 |
| 編程能力 | 代碼質量高,Frontend Code Arena登頂 | 成本極低,LiveCodeBench全球第一 |
| 速度 | 偏慢,穩定性待提升 | 國內速度王者,極其穩定 |
| API輸入價格 | 20元/百萬token | 3元/百萬token |
| API輸出價格 | 100元/百萬token | 6元/百萬token |
在SuperCLUE-Terminal中文智慧體終端編程測評中,DeepSeek-V4-Pro-0813拿到51.52分,在所有參測模型裏排名第二,僅次於Kimi-K3。最亮眼的是它的成本控制——單題調用僅1.42元,大概是Kimi-K3的十四分之一。
正如一位資深開發者總結的:Kimi K3是“能幹活”——復雜工程任務更可靠;DeepSeek V4 Pro是“幹完要返工”的風險更低,但部分場景下穩定性和Java適配性仍待提升。
04 價格博弈:DeepSeek引入峯谷定價
值得注意的是,DeepSeek-V4-Pro發布後,API定價策略也進行了調整。根據官方公告,將於8月17日起採用峯谷定價,高峯時段價格有所上漲。
目前DeepSeek-V4-Pro-0813的API價格尚未調整,仍保持輸入3元/百萬token、輸出6元/百萬token的定價,與預覽版持平。但8月6日DeepSeek已預告“計劃近期整體上調API定價,預計漲幅較大”,窗口期能撐多久尚不確定。
Kimi K3的API價格則爲輸入20元/百萬token、輸出100元/百萬token。
05 雙雄對決的背後:中國AI加速形成“系統性優勢”
從DeepSeek到Kimi,中國AI廠商正通過開源策略,將自身的技術特點轉化爲系統性優勢,並加速基礎模型的商品化進程。
中國開放權重AI模型在全球範圍內的採用,正悄然重塑全球AI技術領域的競爭格局。澳大利亞新南威爾士大學計算機科學家託比·沃爾什評價說:“這證明人工智慧不會成爲一個贏家通吃的市場。”
《自然》雜志也刊文指出,中國開放權重模型正在改變投資者和用戶對美國前沿模型價值的看法。
從DeepSeek-R1震動全球投資界,到Kimi K3引發硅谷關於開源模型擴散效應的討論,中國AI力量正從“追趕者”轉變爲“領跑者”之一。這場“粵籍雙雄”的較量,不僅關乎技術能力的比拼,更折射出全球AI競爭格局與投資邏輯的深刻變化。
免責聲明:凡注明來源中國制造網的所有作品,均爲中國制造網合法擁有版權或有權使用的作品,歡迎轉載並注明出處。非本網站作品均來自互聯網,僅代表作者本人的觀點,中國制造網轉載目的在於傳遞信息,並不代表本網贊同其觀點或對其真實性負責。因作者信息不明等原因,中國制造網使用的部分作品報酬未及時支付,相關權利人可與本網聯系。
