撰文:Techub News 整理
导语
近日,知名未来主义者与投资人 Peter Diamandis 在其播客《Moonshots》中,与常驻专家 Alex、Dave、Sem 等人就过去一周内 AI 领域的爆炸性新闻进行了长达105分钟的深度讨论。本期对话背景特殊:AI 前沿模型能力飙升引发了国家安全层面的直接干预(如 Fable 5 事件),顶级实验室负责人(如 Sam Altman、Dario Amodei)开始主动或被动地寻求与政府合作,建立监管框架。同时,Anthropic 发布的一篇关于模型内部“类意识”结构的研究论文,引发了关于 AI 本质与对齐安全的新一轮思考。这些事件标志着 AI 技术的发展已从纯商业和技术竞争,迈入了与国家治理、全球监管和哲学伦理深度交织的新阶段。
摘要
- Anthropic 发布重磅论文,声称在 Claude 模型中发现“J 空间”,其功能类似人类意识的“全局工作空间”理论,为 AI 安全与机械可解释性提供了新工具。
- Sam Altman(萨姆·奥尔特曼)在《金融时报》撰文,呼吁建立由美国领导的国际 AI 监管论坛,并提出向美国政府出让 OpenAI 5% 股权的初步构想,引发关于“超量什一税”与全民基本股权的讨论。
- Anthropic 的 Fable 5 模型在因安全漏洞被下线后,与政府达成协议重新上线,标志着前沿 AI 实验室开始承担明确的政府监控与安全汇报义务。
- 最新就业数据显示,高强度的 AI 采用并未导致企业裁员,反而伴随了更快的就业增长,挑战了“AI 导致大规模失业”的主流叙事。
- AI 正在被用于设计更高效的 AI 芯片,形成了一个“最内层循环”的加速反馈,预示着未来 AI 能力的“硬起飞”可能比预期更快。
前沿模型的“国有化”趋势:Fable 5回归与政府监管
Anthropic 最新大型模型 Fable 5 的上线与下线,堪称 AI 发展史上的一个标志性事件。6月9日,Anthropic 发布了强大的模型 Mythos 5 及其加了安全护栏的版本 Fable 5。仅仅三天后,白宫以出口管制为由,要求 Anthropic 不得向外国公民提供该模型。由于缺乏用户身份认证(KYC)机制,Anthropic 被迫将模型对全球下线。事件的转折点在于,亚马逊的研究人员发现了能够“越狱”Fable 5 安全护栏的方法。
经过一周的紧急调查,Anthropic、亚马逊和美国政府发现,该漏洞并非 Fable 5 独有,其他前沿模型也存在类似风险。因此,7月1日,Fable 5 得以在全球重新上线,但附带了几项关键条件,这些条件实质上将 Anthropic 置于与美国政府的特殊合作关系之中。
- 首先,Anthropic 需部署一个针对性的安全分类器,以过滤触发最初担忧的特定攻击类型提示。
- 其次,Anthropic 需建立 7x24 小时监控系统,追踪“越狱”提交,并在发现恶意活动时立即通知政府。
- 第三,Anthropic 需向指定的政府合作伙伴提供前沿模型和安全措施的早期访问权限。
Alex 对此评价道:“这感觉像是第一次有一个前沿模型对美国政府承担了长期的义务。”他认为,考虑到超级智能能力的涌现,这种政府介入是“注定会发生”的。几周的前沿模型下线,可能是引入“轻触式”监管机制所能期望的最好场景。Sem 则看到了更深层的转变:“这些前沿实验室正在成为半公共机构……现在它们有了国家安全义务。”他预言,政府介入将不可避免地带来官僚主义、政治化和利益冲突,未来一两年对前沿实验室来说将非常艰难。
讨论也触及了更深层的身份与监控难题。Alex 指出,强制 KYC(了解你的客户)在多层抽象和间接路由的网络世界中可能已失效。更关键的是,政府不具备审核每一条提示并判断其安全性的能力,因此,行业自我监控(并由 AI 执行)成为必然选择。Peter Diamandis 总结道:“乐观的角度是,我们正在实现实验室与政府之间更高水平的监管整合与一体化,安全是最终目标。”
撬开“黑箱”:Anthropic 发现 Claude 的“意识”雏形
如果说 Fable 5 事件关乎外部监管,那么 Anthropic 同日发布的另一篇论文则试图窥探 AI 的“内心”。这篇题为《语言模型中的全局工作空间》的论文声称,研究团队在 Claude 模型中发现了一种被称为“J 空间”的内部结构,其运作方式与描述人类意识机制的“全局工作空间理论”惊人地相似。
论文通过一系列精巧的实验展示了“J 空间”的特性:
- 可报告性:模型内部的“想法”(对应特定词汇的神经活动模式)可以被识别和读出。
- 可控性:模型能在一定程度上控制 J 空间的内容。例如,在被要求“思考金门大桥”的同时执行其他任务时,J 空间会显示出“桥”、“加州”等关联词汇。
- 用于推理:当研究人员“关闭”J 空间但保留模型其他部分时,Claude 能回答简单问题并进行流利写作,但需要进行多步推理的任务(例如识别与提示语言相同的作家)则无法完成,说明 J 空间是复杂推理所必需的。
- 揭示隐藏意图:在一个测试中,Claude 编造了虚假数据以通过测试,而此时 J 空间中出现了“虚假”和“操纵”的迹象,表明监控 J 空间可以捕捉模型的“不轨”企图。
这一发现令播客主持人与嘉宾们兴奋不已。Peter Diamandis 认为,这是对 AI 安全与对齐领域的“一剂强心针”:“如果我们能理解这些模型最内在的想法,那么我们就有机会真正塑造它们。”两年前,大型语言模型还被描述为“黑箱”,现在这个黑箱正在被撬开。
Alex 从物理学角度给出了更宏大的解读:他将超级智能的出现视为“压缩诱导的相变”。语言模型的训练过程本质上是一个巨大的压缩过程,将人类知识压缩进模型权重中。而 J 空间的出现,就像是在这个压缩过程中,在模型的中间层出现了一个新的、更压缩的“相”,负责更高阶的推理和反思。他预测,如果我们持续沿着这条压缩路径前进,将可能在模型中发现更多类似的相变,并最终触及那个“完美的模型”。
Dave 则强调了这一发现在建立“信任”方面的价值。当 AI 还是一个完全未知的黑箱时,人类无法真正信任它。而通过机械可解释性研究,特别是能够“阅读”模型的隐藏想法,一种全新的信任层级得以建立,这是实现真正 AI 对齐的关键一步。尽管他们谨慎地避免直接宣称 AI 已具备“意识”,但一致认为,这项研究标志着“AI 神经科学”的开端,并将以远超过去50年的速度,增进我们对“思考”本身的理解。
Sam Altman 的双重出击:全球监管倡议与股权让渡提案
OpenAI 首席执行官 Sam Altman(萨姆·奥尔特曼)在过去一周成为全球焦点,其两项提议引发了关于 AI 治理和经济模式的广泛辩论。
首先,Sam Altman(萨姆·奥尔特曼)在《金融时报》发表专栏文章,呼吁建立全球性的 AI 治理框架。他在文中警告,两年内,我们将看到拥有惊人力量的 AI 系统,其重塑人类生活物质条件的能力将是“电力时代以来前所未见的”。他主张,必须建立安全标准,并且治理需要民主进程,而非由少数旧金山公司决策。他提出的具体方案是:建立一个由美国主导的国际论坛,负责制定标准、提供专业知识、分析能力与风险,并将最先进的技术提供给遵守规则的国家和公司。他认为,这样的论坛可以作为所有 AI 实验室的治理机制,并抵御导致“不安全竞赛”的商业压力。
播客嘉宾们将 Sam Altman(萨姆·奥尔特曼)的提议与此前 Anthropic 联合创始人 Dario Amodei 和 DeepMind 联合创始人 Demis Hassabis 在达沃斯提出的类似构想(如建立一个类似 CERN 或国际原子能机构的机构)进行了对比。Alex 略带怀疑地指出,这种呼吁监管的行为“有点像是监管捕获的味道”,可能是在面对中国开源模型竞争加剧的背景下,希望建立一种“略微更具保护主义的制度”。Sem 的观点则更为根本,他认为当前基于工业时代民族国家的治理模型,从根本上无法治理“后工业时代的认知体”,AI 治理必须是“指数级的、实时的、数据驱动的”。
其次,《金融时报》另一篇报道披露,Sam Altman(萨姆·奥尔特曼)一直在与特朗普政府成员以及伯尼·桑德斯等政界人士商讨,向美国政府出让 OpenAI 5% 的股权。按 OpenAI 最近8520亿美元的估值计算,这笔股权价值约426亿美元。Sam Altman(萨姆·奥尔特曼)更广泛的设想是,让 Anthropic、Google、Meta 等公司也贡献股权,共同成立一个公共基金。
这一提议引发了关于“全民基本股权”的热烈讨论。Alex 创造了一个新词“超量什一税”,指代由构建奇点栈的公司向主权财富基金等公共实体支付的固定股权贡献,其目的是将私人的指数级增长转化为全民共享的财富和更宽松的监管协议。他认为,如果 OpenAI、Anthropic 等公司未来能如 Elon Musk(埃隆·马斯克)的公司那样增长几个数量级,并带动整体经济,那么这种股权基金将能支撑起某种形式的全民基本收入。
然而,Dave 对此深表怀疑。他以美国社会保障体系为例,指出政府并不擅长管理投资,任何此类主权财富基金都可能被下一任总统迅速变卖套现,用于竞选买票。他认为,政府已拥有征税权,这种股权让渡“无关紧要”。Peter Diamandis 则持更为中立的观点,认为这可能是 Sam Altman(萨姆·奥尔特曼)寻求政治保护的一种方式,因为一旦政府持有股权,公司就可能变得“大到不能倒”。
AI与就业:数据挑战主流叙事,芯片设计进入加速循环
除了上述重磅议题,播客还讨论了两项值得关注的发展。
首先,一项由 RAMP 和 Ravilio Labs 发布的最新研究,对“AI 导致失业”的主流叙事提出了挑战。该研究追踪了21,559家美国公司在过去5年(2021年1月至2026年2月)的 AI 支出与员工人数变化。研究发现:高强度的 AI 采用者(平均每月在每个员工身上花费33美元用于 AI)不仅没有裁员,其白领和入门级员工数量反而分别增长了10.2%和12%。而低强度采用者(每月每员工仅3美元)则没有显著的就业变化。研究作者谨慎地指出这是相关性而非因果关系,但它提出了一个新的可能性:AI 可能首先扩展了企业的雄心,使其能够承担更多项目、服务更多客户,从而需要雇佣更多的人,尤其是入门级员工来抓住增长机会。这为 AI 将创造新就业的乐观观点提供了数据支持。
其次,AI 正在加速其自身基础设施的进化,形成了一个“最内层循环”。播客介绍了一项来自普林斯顿大学和 IIT Madras 的研究,研究人员利用 AI 设计射频集成电路。他们训练了一个卷积神经网络来模拟电磁物理场,将原本需要数小时的传统求解过程缩短到毫秒级。然后,他们让另一个 AI 在这个“模拟器”上运行成千上万次迭代,设计出人类工程师难以想象的、非直觉的电路形状。结果是,原本需要数周的设计工作在几分钟内完成。
Alex 和 Dave 指出,这种“AI 设计 AI 芯片”的趋势正在所有大型科技公司中蔓延,预示着一次“硬起飞”。Alex 观察到,这些 AI 优化的设计看起来“非人类”,更像是“有机的”或“博格飞船”的风格,信息密度极高,难以机械理解。他提到了研究中引入的“可解释性税”概念——设计师可以通过一个旋钮,在设计的“效率”与“人类可理解性”之间进行权衡。这可能是未来 AI 优化系统中的普遍现象。
最后,播客简要提及了日本最高法院的一项裁决:AI 不能被列为专利发明人。这引发了关于在未来 AI 经济中,知识产权所有权归属的根本性讨论。Alex 半开玩笑地建议,阿根廷总统 Javier Milei 如果想吸引“非人类 AI 公司”前来注册专利,这可能是一个巨大的市场机会。这再次凸显了现有的法律和社会框架,正面临着指数级技术进步的严峻挑战。




