新闻详情

新闻详情

首页 / 资讯中心 / 详情

GPT-6 Astra跑分反复被改,大模型评测还能信吗

发布时间:2026/9/10 21:44:16来源:尧图网络
GPT-6 Astra跑分反复被改,大模型评测还能信吗
上周四9月3日OpenAI 发布了新旗舰模型 GPT-6 Astra。发布还没到三天据 Fortune 报道它官方公告里的多项评测数据被修改过不止一次Astra 的幻觉率一度从 4.2% 降到 2%后来又改回 4.2%。这事对普通开发者最大的意义不是看 OpenAI 的热闹而是提醒所有人拿跑分数字选模型得多留个心眼。发布过程本身很折腾原定美东时间 9 月 3 日下午 2 点发的公告先撤下又重发官方先说是内容管理系统故障后改口称网络中断并强调与评测成绩无关。但网页存档显示重新上线后里面的数字确实变了之后还在变。据网页快照逐项对照主要变化有幻觉率Astra 从 4.2% 一度降到 2%接近砍半后又回到 4.2%前代 GPT-5.6 Sol 也从 12.2% 降到 9.4%再改回 12.2%FrontierMath Tier 4Astra 一直是 97.6%竞品 Fable 5.1 却一度从 87.8% 被调到 78% 再回到 83%Sol 也在 83% 与 80.5% 之间来回ARC-AGI-3预发布草稿里 Astra 是 98.6%公开版变成 99.99%据评测方 Arc Prize Foundation 独立复测配很强的工具框架能到 99.9%用标准框架则是 63%也有反向改动医疗评测 HealthBench 上Anthropic 模型的分数反而被调高了OpenAI 发言人解释模型检查点、评测框架、运行方式不同多数评测本就有几个百分点的正常波动改数字是为了代表对可用性能的最佳估计对草稿和最终版的出入官方称发布前验证评测属正常流程。公告还声明这些分数是在任何计算资源投入下能够达到的最高成绩——并不是普通用户默认配置下能拿到的体验。技术本质是跑分不是模型有多聪明的直接度量而是一组测量设置的输出。同一道题给不给工具、用哪个检查点、采几次样、跑在什么推理等级上结果都不同。几个百分点的出入确实算正常波动但4.2 砍到 2这种量级已经不是误差能解释的了。斯坦福的研究者把这类操作称为 Benchmaxxing即反复调整测试条件刷高分还指出 Astra 的系统卡几乎没写幻觉率评测的方法细节也有工程师认为发布前几小时调数字不罕见但行业应形成规范——改分时说明评测条件变了什么。往前看2025 年 Meta 的 Llama 4 也闹过类似成绩对不上实物的争议官方先否认后来 LeCun 承认做过修饰。变了的是模型发布节奏快到评测成了营销素材和厂商间的记分牌有报道提到 OpenAI 可能在 2027 年 IPO宣传数字的分量更重了。没变的是跑分从来不能直接等于你业务里的真实表现。那普通开发者怎么选、怎么用我的建议是三条官网数字只当线索别当结论。重点看第三方独立评测和社区真实用例的反馈拿自己的业务数据压测比看任何榜单都实在。挑 5~10 个高频场景固定参数多跑几次importosfromopenaiimportOpenAI clientOpenAI(api_keyos.getenv(OPENAI_API_KEY))defprobe(model:str,prompt:str,times:int10)-None:同问题同参数跑多次看稳定性胜过单个跑分。foriinrange(times):respclient.chat.completions.create(modelmodel,# 替换成要对比的实际模型名messages[{role:user,content:prompt}],temperature0,)print(f[{i1}],resp.choices[0].message.content[:80])3.**留意评测条件脚注**给没给工具、什么推理等级、哪个日期快照。采购或立项汇报时别把厂商最好成绩写成承诺注明某评测、某条件下取得坑也有几个把某榜单第一名直接当业务最优解不读评测方法就引用分数只测它能答对什么不测它在你的脏数据上会怎么错。跑分是体检报告不是疗效保证书——指标再好也得拿自己的病历说话。 发布会上的跑分你会直接采信吗你怎么看评论区聊聊。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

2026年AI降本增效工具实测与选型指南 2026/9/10 21:42:12

2026年AI降本增效工具实测与选型指南

1. 2026年AI降本增效工具全景扫描 当AI技术渗透到每个工作环节,工具选择反而成了新难题。我最近实测了37款宣称能提升效率的AI工具,发现真正经得起复杂场景考验的不足三分之一。以下是经过三个月真实项目验证的8款工具,它们分别在代码生成、设…

阅读更多 →
基于Qwen AI大模型+微信小程序的肌肤养护管理系统设计与实现 2026/9/10 21:42:12

基于Qwen AI大模型+微信小程序的肌肤养护管理系统设计与实现

一、课题研究背景与意义 随着智能美妆与个性化康养理念的普及,大众对肌肤护理的需求逐渐从传统通用护肤转向智能化、定制化、精细化管理。传统肌肤养护方式存在明显短板,用户多依靠主观经验判断肤质、选择护肤品,缺乏科学的肌肤数据分析支撑&…

阅读更多 →
AI辅助学术PPT制作:从内容生成到设计优化全解析 2026/9/10 21:42:12

AI辅助学术PPT制作:从内容生成到设计优化全解析

1. 为什么我们需要AI辅助PPT制作? 作为一名经历过无数次深夜赶PPT的科研狗,我清楚地记得那些对着空白幻灯片发呆到凌晨三点的日子。每次开题报告、中期答辩、毕业答辩前,总有一周时间要泡在咖啡和PPT里。直到去年,我发现了AI辅助P…

阅读更多 →
FastAPI 生产级项目脚手架模板指南:async 模式、依赖注入与分层架构实践 2026/9/10 21:42:12

FastAPI 生产级项目脚手架模板指南:async 模式、依赖注入与分层架构实践

FastAPI 生产级项目脚手架模板指南:async 模式、依赖注入与分层架构实践 【免费下载链接】agents Multi-harness agentic plugin marketplace for Claude Code, Codex, Cursor, OpenCode, GitHub Copilot, and Google Antigravity 项目地址: https://gitcode.com/…

阅读更多 →
AIRI Capacitor 应用确定性截图实战:用 Vishot 捕获 WebView 与界定原生证据边界 2026/9/10 21:42:12

AIRI Capacitor 应用确定性截图实战:用 Vishot 捕获 WebView 与界定原生证据边界

AIRI Capacitor 应用确定性截图实战:用 Vishot 捕获 WebView 与界定原生证据边界 【免费下载链接】airi 💖🧸 Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishin…

阅读更多 →
RustFS 发版发布全流程实战:从版本确认、Preview 预发布验证到最终 Tag 发布的完整指南 2026/9/10 21:39:12

RustFS 发版发布全流程实战:从版本确认、Preview 预发布验证到最终 Tag 发布的完整指南

RustFS 发版发布全流程实战:从版本确认、Preview 预发布验证到最终 Tag 发布的完整指南 【免费下载链接】rustfs 🚀2.3x faster than MinIO for 4KB object payloads. RustFS is an open-source, S3-compatible high-performance object storage system …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞