Mistral 在 10 月 6 日開放 Large 4 的公開預覽。它是一顆約一萬億參數、每次回答只啟用約 490 億參數的多模態模型,現在可以在 Mistral Studio 試用;公司網誌寫明,權重要到本月底才公開。
同一輪還有兩則可以核對的消息。Google DeepMind 放出可以在手機上跑的嵌入模型 EmbeddingGemma 2,權重已經能下載。OpenAI 則在香港時間 10 月 7 日清晨,把一個尚未對外開放的內部模型做出的數學結果放到 GitHub。
現在開的是預覽接口
Mistral 的網誌把這顆模型叫作 Mistral Large 4,非正式簡稱 ML4,正式暱稱是 le Chonk。現在開的不是權重下載,而是預覽接口:預覽在 Mistral Studio,權重「本月底」才落下來。
規格以這篇網誌為準。總參數約一萬億,每一次回答啟用約 490 億,原生處理文字和圖像。訓練在歐洲的自有數據中心完成,用了 3,800 顆 NVIDIA Grace Blackwell GPU,由零開始訓練,公開預覽也跑在同一套機器上。訓練資料涵蓋超過 160 種語言,包括歐盟每一種官方語言。
路透社同一天引述公司,把全面公開的日子寫成 10 月 27 日。網誌本身只寫「本月底」。兩句可以同時成立,也可以有一天之差。現在能確定的只有一半:預覽已經開,權重檔還沒有給人下載。在權重落地之前,不能把它當成已經可以放進自己機房的模型。
公司把差異放在網絡安全
Mistral 在同一篇公告裡,把 Large 4 說成開放權重陣營裡、中國以外目前最強的一檔,並稱它在 Artificial Analysis 的網絡安全指數排進全球前五。其中一項測試要求模型重現開源軟件裡的真實漏洞,再把漏洞修補;公司說 Large 4 得分 82%,是該項最高。公司又說,Claude Opus 5.5 和 GPT-6 Astra 在同一項接近零分,因為它們拒絕作答。
這些數字出自公司自己的成績單。公告同時寫了一個使用上的理由:防守一方往往要先證明漏洞確實存在,封閉模型的拒絕機制會把這一步擋住。預覽期內,網絡安全人員、受邀夥伴和政府機構會拿到同一顆模型,審核較寬,網絡安全能力也開得較大。一般用戶走的仍是 Mistral Studio 上的預覽接口。
編碼方面,公司列出 DeepSWE v1.1 的 61.7%,同時承認模型仍在快速修正。路透社引述科學副總裁的說法是:它在編碼等領域仍然落後前沿。網絡安全分數,和寫程式有沒有追上最前面,要分開看。
EmbeddingGemma 2 把搜尋留在裝置上
DeepMind 研究工程師 Sahil Dua 和 Henrique Schechter Vera 在 10 月 6 日的 Google 網誌發布 EmbeddingGemma 2。它負責搜尋和檢索:把文字、程式、圖像、影片和聲音,映射進同一個嵌入空間。
網誌給的規模是 7.4 億參數,架構來自 Gemma 4,授權是可以商用的 Apache 2.0。設計是模組化的:文字和程式的核心約 2.7 億參數,視覺編碼器約 1.7 億,聲音編碼器約 3 億,用不到的部分可以不載入。上下文窗口是 8,000 個 token,公司說是上一代的四倍,大約放得下 5.5 分鐘聲音、29 張圖片或 58 個影片幀。
和 Large 4 相反,這顆的權重已經公開,Hugging Face 和 Kaggle 都有。公司舉的用法很具體:用一段語音備忘,在手機裡找回影片的某一刻,資料不必先上傳。量化之後,他們在 Pixel 11 Pro 上量到純文字權重約 191MB 活動記憶體,完整多模態約 567MB。程式檢索的 MTEB Code 分數,由上一代的 68.76 升到 78.68。這組數字同樣出自發布網誌。
OpenAI 交出數學手稿,模型仍未放出
OpenAI 的網誌日期寫 10 月 6 日。公司帳號在協調世界時 10 月 6 日 22 時 19 分發出連結,換算香港時間是 10 月 7 日清晨 6 時 19 分。網誌說,他們公開一批由內部前沿模型做出的數學結果,並已諮詢普林斯頓高等研究院的「數學與人工智能諮詢小組」,按對方的公開建議決定怎樣發布。
公眾拿到的是一個 GitHub 程式庫,裡面有論文、修訂和引用規則,以及許多證明的 Lean 形式化。Lean 是一種可以由電腦檢查證明是否成立的語言。網誌寫的是許多證明,範圍停在這裡。另外有 10 份推理過程的摘要,以及用 ChatGPT Pro 思考時間估算的計算量:平均每項結果大約相當於 3 小時 Pro 思考。
網誌正文沒有寫手稿總數。程式庫的總覽頁寫着 722 份手稿、分成 372 組相關結果。模型本身仍未對公眾開放。網誌寫明,他們正在準備以負責任的方式放出做出這些結果的模型。這一次放上架的,是數學結果和部分可以由電腦檢查的證明。
這星期開得到的是哪一項
三則消息的門檻不一樣。Large 4 現在走 Mistral Studio 的預覽接口,權重檔還在後面。EmbeddingGemma 2 的權重已經可以下載,適合放在自己的電腦或手機上做搜尋,它不負責長篇回答。OpenAI 這一次給的是數學手稿和 Lean 證明,那個內部模型還沒有名字可以在產品裡點選。
如果這星期要在工作裡試一件具體的事:想對話、看圖、處理長文件,去 Large 4 的預覽;想在裝置上搜自己的影片、聲音和程式,去 EmbeddingGemma 2 的權重;想看數學證明能不能被電腦檢查,去那個程式庫。三條路各自打開不同的東西。
總結
這輪仍然是 Large 4 最值得先看清楚。預覽已經開放,權重尚未公開,公司把網絡安全成績放在最前面,編碼是否追上前沿則是另一個問題。EmbeddingGemma 2 小得多,但權重已經在。OpenAI 交出的是數學結果,模型還在門後。
相關討論:Mistral 公告、路透社、Google 網誌、OpenAI 網誌。
