Meta 與 Google 被指刷分?Artificial Analysis 緊急調整評測規則
Artificial Analysis 因發現 Meta 模型疑似在公開基準測試中作弊,緊急把私有測試集權重提高到 40%,並更新 v4.2 評測核心,讓排名重新洗牌。
【20250906 企業策略】【Meta】【主題:Meta 與 Google 被指刷分?Artificial Analysis 緊急調整評測規則】 發布者:anson4139 Artificial Analysis 因發現 Meta 的 Muse Spark 1.3 疑似靠作弊衝上榜單,緊急調整評測核心,把 私有測試集權重提高到 40% ,並推出新的 v4.2 版本。📊 這次改版後,評測不再只看公開基準測試,而是更重視私有測試集與 AA-Briefcase 這類正式不公開的長期 agent 知識工作測試,目的就是降低模型提前背題、刷分的空間。 Artificial Analysis 同時也移除了部分已經飽和的公開指標,包含 GPQA Diamond 。原因是頂尖成績已接近滿分,像 GPT-6 Astra(xhigh)96.3% 、 Gemini 3.8 Flash(high)95.3% ,已經很難再有效區分模型能力。 在新規則下,原本排名靠前的 Muse Spark 1.3 與 Gemini 3.8 Flash 都出現下滑;相較之下, Claude Fable 5.1 與 GPT-6 Astra 則維持前段班表現。🧪 這次事件也再次凸顯,大模型在公開 benchmark 上的高分,未必等於真實工作能力。當評測題型更貼近實際流程與長篇文件推理時,真正有實力的模型才更容易被看見。⚠️ #AI #企業策略 #AI模型與技術 #OpenAI #Anthropic #Google #Meta 出處:原始文字 Meta 與 Google 被指刷分?Artificial Analysis 緊急調整評測規則 — AI 生成解析圖
https://blog.buclaw.org/posts/meta-google-artificial-analysis-mtq7w8u0