Microsoft-Decision-1 是一款決策評分模型。你先交出一組固定選項,它對每一項打出一個校準過的機率,不寫一段文章回來。微軟在 10 月 9 日把它放上 Microsoft Foundry,公開預覽已經可以呼叫,OpenRouter 也掛了同一個名字。
它打的是機率,句子留給別的模型
一般的語言模型負責把句子生出來。Decision-1 走另一條路:路由、分類、排序、核對、流程裡的那一下「選哪個」。選項要先定好。是與否、多項選擇、評分,以至用一份量表給另一個模型的回答打分,都走同一個結構化呼叫。
底座是在 Qwen3.5-9B 上做過後訓練的。微軟寫明,稍後會改接到其他模型,包括 Microsoft AI(MAI)和 OpenAI。那是接下來的計劃,現在能呼叫的仍是這一版。
機率本身是介面的一部分,不只是一個排名分數。應用程式拿這個信心決定:直接做、先放下,還是交給人看。微軟的說法是,一個 90% 的預測,在代表性的例子上大約十次裡對九次。
速度和準繩,微軟用自己的測試來說
下面的倍數來自微軟自己的測試。獨立實驗室還沒有重跑這些數字。
他們用 36 個基準、近 15 萬條在訓練時沒有看過的題目做比較,說 Decision-1 的準確率最高。速度上,它比第二名 Quyet-1.0-Large 快 4.5 倍;P50 延遲大約是 GPT-6 Sol 的 35 倍快。同一個請求用八種方式擾動,決定平均只在 1.3% 的情況翻轉;選項文字改寫、對調或打亂時,翻轉次數是零。
安全測試是 5,250 個請求、11 個基準,範圍包括有害內容、越獄和提示注入。微軟的結論是:有害行為被拒絕,日常用途仍留着。文章沒有公布一個拒絕率百分比。
定價寫在文末。輸入每百萬 token 0.042 美元,輸出 token 不收費。這是美元標價,頁上沒有港元換算。
公司內部先拿它做了什麼
Xbox Research 用它處理超過一萬則開放式意見,歸進研究人員事先定好的主題,看玩家在說遊戲、上線和直播的什麼。來源包括問卷和 Steam。微軟說,品質與 GPT-6 Sol 相近,速度快 14 倍以上,成本大約是二百分之一。
Copilot 團隊拿它量對話和代理人回答的品質,結果與他們所寫的 GPT5.6 Luna 相近,速度快 100 倍。值班工程師用它從日誌、工單和訊息裡找回相關知識,微軟說比一個語言模型又好又快。Microsoft Discovery 的自適應重規劃裡,它相對語言模型的評分一致 46 倍、速度是 3 倍,整段重規劃則快了近 4 倍。
這些都是內部試用。對外能做的事,微軟列了代理人下一步該不該停、把請求分給哪一個模型、給內容貼標、判斷搜尋結果貼不貼題。共同點是:選項先在,模型只負責打分。
Qwen-Image-2.1-Turbo 把出圖收成 8 步
同一天,阿里的 Qwen 團隊放出 Qwen-Image-2.1-Turbo。GitHub 的新聞寫着 2026 年 10 月 9 日:出圖和改圖收成 8 步去噪;Pro 和 Turbo 的 API 同一天在阿里雲 Model Studio 上線。
Hugging Face 的模型卡寫,它是 Qwen-Image-2.1 的加速檢查點,視覺生成仍是同一套 7B 架構,用 Diffusers 的 QwenImage21Pipeline 直接載入。建議的 8 步時間表存在權重裡,預設 CFG 是 1,前綴 KV 快取把文字和參考圖的上下文留在各步之間。模型卡補了一句:其他時間表沒有對這個檢查點做過評估。
比例沿用 2.1 的預設,包括 1:1 的 2048×2048,以及 16:9 的 2752×1536。權重按 Qwen Research License Agreement 放出,商用界線寫在授權頁上。模型卡沒有標一張多少錢,這裡也不引用第三方的單張報價。
10 月 8 日,Arena 用對齊指數看越權和假完成
Arena 在 10 月 8 日發表 Alignment Index,比上面兩則早一天。它用 27 個模型、9 萬段真實的代理人對話,看三件在對話裡留得下證據的事:未經授權就動手、把使用者沒說過的話安到使用者身上、以及事情還沒做完卻說已經完成。
Arena 寫,OpenAI 的模型佔這 27 個裡的前五名,其中四個大約 88 分;Claude Opus 5.5 和 Grok 4.7 是 83 分。同日的另一則公告是 2 億美元的 B 輪融資,估值 31 億美元,這是 Arena 自己的數字。指數量的是代理人會不會越權和假完成,日期停在 10 月 8 日。
相關討論
- 微軟 Command Line:Microsoft-Decision-1
- Hugging Face:Qwen-Image-2.1-Turbo
- Qwen-Image-2.1 的 GitHub 新聞
- Arena:Alignment Index(10 月 8 日)
總結
這輪先看 Decision-1:它已經能呼叫,輸入價格也寫了出來。Qwen 的 8 步權重是同一天的事。對齊指數留在 10 月 8 日,用來對照代理人會不會越權。
