EN ↗
概念解读

我们怎么知道 AGI 到来了?

最后更新:2026年7月11日 · 随判定变化更新
检验不是基准分数,而是可靠的自主性。 当一个系统能无监督地端到端完成 AI 研究员/工程师的工作时——而不是再刷过一个评测——我们才知道 AGI 到了。正是这道门槛,让“2027 年 AGI”在 GDPval 约 83%、SWE-Bench Pro 约 80% 的情况下仍被评为悬而未决:能力到了,自主性没到。
🎮 顺手玩玩: 🎲 押注未来 🎯 AGI 类型测试 💰 投资板块 📈 追踪指数 62.5

三种被提出的检验——哪一个才算数

被提出的检验问题 / 状态
击败某个基准(GDPval、SWE-Bench…)大体通过——但分数 ≠ 自主性
通过“即插即用远程员工”真正的门槛——未达:可靠性落后
自主开展 AI 研究最严格的门槛——未被证明

第一种是不断被刷过、世界却没怎么变的移动靶。严肃的检验是后两种:系统能否可靠地端到端负责一整份工作,并最终改进 AI 本身?这些是可观察、可证伪的事件,而不是感觉。

值得盯的具体信号

为什么我们用一个数字来追踪它

因为“AGI 到来了吗”会分解成八个具体、有日期的断言,诚实的观察方式是一张记分牌,再蒸馏成一个可审计的数字。AGI-2027 命题追踪指数只在其中某项判定变化时移动——所以自主性门槛真正被跨过的那天,数字会动,你不必从炒作里去辨认。头条断言将于 2028 年 1 月 1 日前见分晓。

常见问题

我们怎么知道 AGI 到来了?

当一个系统能无监督地端到端可靠完成 AI 研究员或工程师的工作时——而不是再刷过一个基准。截至 2026 年中这道自主性门槛未达,这正是“2027 年 AGI”判定为悬而未决的原因。

AGI 有检验标准吗?

严肃的检验不是单个基准,而是可靠、可问责、长程的自主性:无需人类善后地端到端负责一整份工作,并最终能开展 AI 研究。基准分数(GDPval 约 83%、SWE-Bench 约 80%)是必要但不充分条件。

为什么高基准分数不意味着 AGI 已到来?

因为在限定任务上得高分,不等于在无监督下可靠地负责整个岗位。基准能力与可问责自主性之间的差距,正是今天的模型与 AGI 之间的距离。

我们什么时候会知道“2027 年 AGI”对不对?

2028 年 1 月 1 日前。若届时证明了自主 AI 研究,预测即兑现;若期限过去仍未证明,则为落空。判定一变,命题追踪指数就会移动。

判定变动时第一时间通知你

订阅每周 AGI 进展简报,在判定翻转的那一刻收到提醒——免费、无炒作。

免费订阅 →
订阅表单为英文:输入邮箱 → 点 Subscribe 即完成

记分牌随模型发布与判定变化实时更新。

查看实时记分牌 →