- 阿里發表Qwen3.8-Max旗艦模型,總參數2.4兆
- 在Arena榜單僅次於Claude,居全球第一梯隊
- API已上線,模型權重預計下周開源
- 程式設計測試中自主運行16天完成265次程式碼提交
- 專業辦公可在1小時內從數百份文件找出1284項條款
(綜合ETtoday新聞雲、聯合報報導)
阿里巴巴8月3日正式發表新一代基座大模型Qwen3.8-Max,為千問系列尺寸最大、性能最強的旗艦模型,總參數量達2.4兆(2.4T),啟用參數為950億(95B)。該模型支援視覺理解,上下文長度達1M Tokens,主要提升程式設計(Coding)、專業辦公(Cowork)、科研、長周期任務及多模態智能體能力。
在模型架構上,Qwen3.8透過稀疏MoE架構與混合注意力機制的聯合優化,獲得更高推理效率與速度。在第三方模型評測榜單Arena中,阿里Qwen模型僅次於Anthropic的Claude系列,整體性能位居全球大模型第一梯隊。
Qwen3.8的API已上線千問AI平台,並接入阿里同日推出的Agent產品「千問辦公」。Qwen3.8-Max預計下周開源,同時也將開源Qwen3.8-27B模型。API服務在中國大陸每百萬Tokens輸入12元、輸出36元,隱式緩存命中1.5元;海外輸入、輸出價格分別為2美元及6美元,約為能力相近前沿模型Opus5的40%與24%。
在程式設計能力方面,阿里公布的測試顯示,Qwen3.8-Max可在較少人工介入下連續執行長時間複雜開發任務。一項自動程式設計測試中,模型自主運行約16天,累計完成265次程式碼提交、127個合併請求及151個問題單。阿里也讓模型嘗試重現一篇大型語言模型推理研究論文,模型連續工作約125小時,前37小時從零建立訓練及評測流程,重現論文6項主要結論,其後自行提出並測試18項改進方向,最終在數學基準AIME24上較原方法提高2.7分。
在專業辦公測試中,模型可在1小時內從數百份文件中找出1284項相關條款,也能依據圖紙建立30層辦公大樓的抗震結構模型。針對長周期任務,阿里以模擬365天電商經營的E-Commerce Bench測試,模型使用10萬元啟動資金,最終持有現金約41.6萬元,較排名第2的GLM 5.2高出38%。
Qwen3.8-Max也強調多模態能力,可處理超過200頁財報、百小時影片、圖片、文件及介面操作,並執行影片剪輯、3D建模、網頁還原及應用開發等任務,可在操作過程中持續觀察成果,發現錯誤後自行修正。
本事件已沉寂,相關脈絡見「相關事件」