概念解读
我们怎么知道 AGI 到来了?
最后更新:2026年7月11日 · 随判定变化更新
检验不是基准分数,而是可靠的自主性。 当一个系统能无监督地端到端完成 AI 研究员/工程师的工作时——而不是再刷过一个评测——我们才知道 AGI 到了。正是这道门槛,让“2027 年 AGI”在 GDPval 约 83%、SWE-Bench Pro 约 80% 的情况下仍被评为悬而未决:能力到了,自主性没到。
三种被提出的检验——哪一个才算数
| 被提出的检验 | 问题 / 状态 |
|---|---|
| 击败某个基准(GDPval、SWE-Bench…) | 大体通过——但分数 ≠ 自主性 |
| 通过“即插即用远程员工” | 真正的门槛——未达:可靠性落后 |
| 自主开展 AI 研究 | 最严格的门槛——未被证明 |
第一种是不断被刷过、世界却没怎么变的移动靶。严肃的检验是后两种:系统能否可靠地端到端负责一整份工作,并最终改进 AI 本身?这些是可观察、可证伪的事件,而不是感觉。
值得盯的具体信号
- 一个模型在无监督下跑完一个真实的、持续数周的项目,并对结果负责——而不只是辅助一个负责善后的人。
- 前沿实验室报告 AI 在实质性地自动化它们自己的研究工程(智能爆炸的扳机)。
- 采用从“辅助”转向“替代”整个岗位而非任务——正是就业问题背后的信号。
为什么我们用一个数字来追踪它
因为“AGI 到来了吗”会分解成八个具体、有日期的断言,诚实的观察方式是一张记分牌,再蒸馏成一个可审计的数字。AGI-2027 命题追踪指数只在其中某项判定变化时移动——所以自主性门槛真正被跨过的那天,数字会动,你不必从炒作里去辨认。头条断言将于 2028 年 1 月 1 日前见分晓。
常见问题
我们怎么知道 AGI 到来了?
当一个系统能无监督地端到端可靠完成 AI 研究员或工程师的工作时——而不是再刷过一个基准。截至 2026 年中这道自主性门槛未达,这正是“2027 年 AGI”判定为悬而未决的原因。
AGI 有检验标准吗?
严肃的检验不是单个基准,而是可靠、可问责、长程的自主性:无需人类善后地端到端负责一整份工作,并最终能开展 AI 研究。基准分数(GDPval 约 83%、SWE-Bench 约 80%)是必要但不充分条件。
为什么高基准分数不意味着 AGI 已到来?
因为在限定任务上得高分,不等于在无监督下可靠地负责整个岗位。基准能力与可问责自主性之间的差距,正是今天的模型与 AGI 之间的距离。
我们什么时候会知道“2027 年 AGI”对不对?
2028 年 1 月 1 日前。若届时证明了自主 AI 研究,预测即兑现;若期限过去仍未证明,则为落空。判定一变,命题追踪指数就会移动。
记分牌随模型发布与判定变化实时更新。
查看实时记分牌 →