首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
同一模型 99.9% 和 62.7%:GPT-6 Astra 跑分之争,工程上该怎么读
📅 2026/9/6 1:31:39
✍️ 爱科研究院
👁 阅读 3,247
这几天所有人都在争论一个问题OpenAI 说 GPT-6 Astra 在 ARC-AGI-3 上拿了 99.9%为什么 ARC Prize 说只有 62.7%两个数字都是真的测的也都是同一个模型。分歧不在模型在怎么测。一、两个分数差在哪ARC-AGI-3 是一个交互式基准让模型面对从没见过的、没有指令的小游戏自己摸索规则、自己定目标、自己规划动作。ARC Prize这个基准的官方组织用两套 harness 各测了一遍结论是标准 harness 下模型只能携带它自己选择保留的可见笔记继续推理得分 62.7%。OpenAI 的 Provider Adapter harness 下模型不透明的隐藏推理状态被完整保留下来长对话还会被自动压缩得分 99.9%。差别在低推理档更夸张标准条件 17.5%Adapter 条件 98.0%差了 80.5 分。换句话说99.9% 测的不是模型单跑而是模型 记忆机制 上下文压缩 调度这一整套系统。打个比方它相当于允许考生带一台专门定制的计算器进考场——而厂商在宣传页上把带计算器的分数放在最显眼的位置。ARC Prize 的表态很客气也很关键它说两个分数都算 SOTA但从今以后榜单会同时标注两种测试条件。二、三个词工程人必须懂第一harness测试框架。同一模型换一套输入输出封装分数就能差三十七个百分点。看到分数先问这是谁家的 harness第二Adapter厂商适配器。厂商为了让模型在自家 API 上表现好会做一套保留隐藏状态、自动压缩上下文的适配层。它让模型跑分变成产品跑分。产品跑分没有错但宣传时要说明白——这不只是模型的能力是模型加服务的整体能力。第三contamination基准污染。官方给的 ExploitBench 是 100% 满分但有人用抗污染的改写版去测只有 39%。翻译成人话模型很可能见过原始考题。看到满分两个字先找有没有改写版复测过。还有一个被大多数人忽略的成本问题这次 ARC-AGI-3 的跑分单次就要花两万多美元标准条件约 2.6 万美元、Adapter 条件约 1.88 万美元。这个量级的成本意味着普通团队根本无力自己复现——所以独立验证方的价值比任何时候都高。三、以后读任何 AI 跑分用这三问第一问谁出的分数、用什么条件测的。官方自测默认打折先去找 ARC Prize、Artificial Analysis 这类独立方的同模型同基准对照。第二问低推理档还成立吗。厂商只报高配不报低配本身就是信号。Astra 在标准条件低推理档只有 17.5%这个数字比 99.9% 更能说明它的真实下限。第三问有没有抗污染版本复核过。满分最可疑先查改写版。四、落到选型上回到工程场景我的建议就一句评估 Astra 或者任何一个新旗舰别引用发布会上的单项分数。正确做法是拿 3 到 5 个自己业务里的真实任务跑一个版本对照新模型、老模型同样任务各自记完成任务用了多少 token、单价多少、质量分多少。比的是我的任务账单不是别人的基准分数。顺带一提这次事件也说明基准正在饱和。ARC Prize 自己的判断是ARC-AGI-3 高分不等于 AGI环境有界、确定和开放世界是两回事。而 OpenAI 自己几天前 CEO 刚说过 AGI 是营销术语几天后总裁就在发布会上宣布进入 AGI 时代。立场摇摆之下第三方可复现的验证比任何一句口号都值钱。
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/6 1:31:39
终端AI编程Agent实测:Kit如何精简Claude Code体验并降低Token消耗
2026/9/6 1:31:39
87.Vivado2020.1 可直接编译!FPGA DDR3 完整读写测试工程(含仿真 + 避坑)
2026/9/6 1:31:39
随身WiFi怎么选?格行、中兴、华为三大品牌实测对比与避坑指南
2026/9/6 3:06:45
用DeepSeek做数据治理:元数据、质量规则与安全分级的实战指南
2026/9/6 3:06:45
YOLOv5目标检测学习路径:从入门到部署的完整指南
2026/9/6 3:06:45
读机器学习论文半年无成果,非科班的我靠这5个习惯复现了第一个模型
2026/9/6 3:06:45
AI真人短剧批量生产:从脚本结构化到角色一致性的完整流水线
2026/9/6 3:06:45
碳纤维在地铁车辆中的应用:轻量化技术优势与实践案例
2026/9/6 3:01:45
模型评估与优化实战:从混淆矩阵到交叉验证的完整指南
2026/9/6 0:01:31
超人会飞不算本事:系统稳定依赖清晰规则与边界设计
2026/9/6 0:01:31
超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论
2026/9/6 0:01:31
基于CNN的调制信号识别:MATLAB实现时频图分类实战
2026/9/6 0:01:31
超人会飞不算本事:系统稳定依赖清晰规则与边界设计
2026/9/6 0:01:31
超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论
2026/9/6 0:01:31
基于CNN的调制信号识别:MATLAB实现时频图分类实战