Qwen3.8 Max重測後追平Opus 4.8

來源 Jinse_news
8月7日消息,評測機構 Artificial Analysis 重測 Qwen3.8 Max 後,將其 Intelligence Index 從 53 分上調到 56 分。此前測試接口出現間歇性異常,這次改用阿里雲官方 API 重跑。新成績追平 Claude Opus 4.8,但仍比 Kimi K3 低 1 分。 千問進步最明顯的是 Agent 任務。GDPval-AA 得分達到 1739,超過 Kimi K3 的 1685 和 GPT-5.6 Sol 的 1730,僅落後 Claude Opus 5。終端操作、科學推理和編程評測也普遍上漲。 代價是更費 Token。Qwen3.8 Max 的 Token 單價比上一代更低,但完成一道綜合評測任務的平均成本,仍從 0.53 美元漲到 1.14 美元,高於 Kimi K3 的 0.86 美元。主要原因是它在 Agent 任務中調用更多輪次,生成的內容也更多。 它的知識可靠性還出現倒退。AA-Omniscience 準確率基本沒變,幻覺率卻從上一代的 23% 升到 40%。
免責聲明:僅供參考。 過去的表現並不預示未來的結果。
goTop
quote