《神鬼寓言 5.1》剛剛在一項廣受關注的獨立人工智慧指數中名列第一,但真正的決定比「第一」更複雜。在這個比較中,我們透過三個不同的視角來審視 Claude Fable 5.1、GPT-5.6 Sol 和 Grok 4.6:供應商聲明、獨立結果以及完成測試任務的測量成本。截至 9 月 1 日的關鍵結果: • Fable 5.1 Max + 回退:66 • GPT-5.6 Sol Max:61 • Grok 4.6 High:61 但 Fable 的分數因工作量設定而發生顯著變化,並且測試的最高配置具有更高的測量索引任務成本。這些數字不是訂閱價格或通用帳單,而是評估者的任務成本衡量標準。接下來我們應該測試哪種模型——我們應該給它什麼真正的工作?如果您想了解快速發展的人工智慧新聞而不是炒作,請喜歡該視頻並訂閱“AI For Every Now”。您的支持有助於這個不斷發展的頻道不斷檢查來源。章節 00:00 《神鬼寓言 5.1》獲得 #1——真正的問題 00:47 Anthropic 的案例 01:31 Grok 和 Sol 的回答 02:10 獨立記分板 02:57 測量的成本捕獲 03:45 訪問很重要 04:20 實用世界的三個測試車道發佈: https://www.anthropic.com/claude-fable-and-mythos-5-1 神鬼寓言 5.1 模型概述:https://platform.claude.com/docs/en/models/fable-5-1/overview 克勞德計劃訪問:https://support.claude.com/moden/4-1/194-99096-9000m.com神鬼寓言 5.1 人工分析: https://artificialanalysis.ai/articles/claude-fable-5-1/ Grok 4.6 發布:https://x.ai/news/grok-4-6 GPT-5.6:https://openai.com/index/gpt-5-6/ 製作說明:本集使用 DJ 製作說明的樣式和工具 認可 認可。 DJ 選擇並批准故事、形成比較、審查來源、批准最終編輯並控制出版。以人為本,人工智慧輔助。
免責聲明:info@kdj.com
所提供的資訊並非交易建議。 kDJ.com對任何基於本文提供的資訊進行的投資不承擔任何責任。加密貨幣波動性較大,建議您充分研究後謹慎投資!
如果您認為本網站使用的內容侵犯了您的版權,請立即聯絡我們(info@kdj.com),我們將及時刪除。