GPT-6 Astra 99.9% 很驚人,但AGI真的到了嗎?
OpenAI 新模型 GPT-6 Astra 在推理測試拿下 99.9%,甚至幾分鐘看完 41 份財務文件。不過更貼近真實工作的測試仍有明顯落差,AGI 離「大多數經濟工作超越人類」還有距離。
【20260904 AI模型與技術】【OpenAI】【主題:GPT-6 Astra 99.9% 很驚人,但AGI真的到了嗎?】 發布者:anson4139 OpenAI 昨天發布最新 AI 模型 GPT-6 Astra ,並由 OpenAI 總裁 Greg Brockman 直接喊出「 Welcome to the AGI era 」。🧠 引爆討論的關鍵,是 Astra 在專門測試 AI 推理能力的 ARC-AGI-3 拿下 99.9% ,幾乎滿分,讓不少人立刻把它視為 AGI 進展的重要訊號。 但如果回到更標準的測試環境,Astra 成績是 62.7% ,測試成本約 26,098 美元 ;改用 OpenAI 設計的專用運作方式後,成績才拉升到 99.9% ,成本約 18,817 美元 。這也顯示,真正能工作的可能不只是模型,而是「模型+記憶+工具+電腦操作」的一整套系統。⚙️ 更接近真實工作的測試裡,Astra 的表現就沒那麼全面:自動化工作 41.4% 、設計工作 50.0% 、電腦操作 72.6% 。雖然很強,但若對照 OpenAI 對 AGI 的定義——「在大多數具有經濟價值的工作上超越人類」——目前還很難直接下結論。 不過在實務任務上,Astra 已經展現驚人效率。法律科技公司 Legora 讓它檢查 41 份財務文件 ,幾分鐘內完成,並找出研究人員埋下的 4 個錯誤 ,其中還包含營收附註裡的 50 萬英鎊差異 。這類工作過去可能要一整晚,甚至幾天才能完成。 最值得注意的,或許不是「AGI 到底來了沒」,而是 AI 已經開始實際碰到文件審查、電腦操作、寫程式、找漏洞與資料整理等工作。接下來真正改變世界的,可能不是某一天的宣告,而是某個星期一上班時突然發現:原本需要 5 個人做的事,現在 1 個人加上 AI 就能完成。🚀 #OpenAI #AI模型與技術 #AGI #LLM工作流 #AI代理人 #企業策略 出處:原始文字 GPT-6 Astra 99.9% 很驚人,但AGI真的到了嗎? — AI 生成解析圖
https://blog.buclaw.org/posts/gpt-6-astra-99-9-agi-mtn8ekab