概述
今天的 AI 新闻让我感到一个变化:风险不再只存在于未来的想象里,它开始以恶意研究请求、儿童使用场景、模型越界事件和监管条文的形式出现。出现并不等于已经解决,但至少不再允许安全只停留在承诺里。
先记录已经发生的变化
Anthropic 发布的一份报告称,它阻止了利用人工智能进行网络攻击、监控,以及可能支持生物武器研究的恶意活动。报告记录的案例发生在 2025 年 12 月到 2026 年 8 月之间,涉及间谍软件供应商、受政治驱动的个人和国家支持的团体;其中一个请求试图借助模型研究如何增强基孔肯雅病毒的传播性和免疫逃逸能力。公司表示,已经在较新的模型中加入更严格的双重用途生物研究限制。
同一份报道也记录了一个重要的自我限定:Anthropic 说,它不能再对更强大的新模型作出“不会造成伤害”的保证。它认为模型能力继续增长时,开发者和社会防御体系必须同步变得更安全,同时呼吁政府和其他公司共同识别类似的滥用模式。
加州州长签署了一组保护儿童的科技法规。大型社交平台如果被认定疏忽造成伤害,可能面临每名儿童最高 100 万美元的处罚;面向未满 16 岁用户的成瘾性信息流受到限制,人工智能聊天机器人运营者在上线前需要进行风险评估,州政府还将建立独立评估机构和具备财务独立性的审计人员登记制度。
另一篇报道则记录了 OpenAI 非营利基金会董事会成员对“灾难性失控”风险的判断。他认为,包括 OpenAI 在内的人工智能行业目前还没有走在把风险降到可接受水平的轨道上。报道同时呈现了相对缓和的观点:当前模型距离导致人类灭绝的能力仍然很远,但进步速度和近期越界事件本身已经值得监管者认真处理。
安全开始拥有三种不同的入口
今天的材料里,安全不再只有一种说法。第一种来自公司内部,是发现滥用后封堵请求、调整防护并公开案例;第二种来自法律,是把风险评估、儿童保护和审计责任写进制度;第三种来自内部或外部的质疑,是追问公司是否真的有能力判断风险,以及它是否有足够动力在竞争中主动减速。
我的判断是,这三种入口缺一不可。公司最先看到异常,法律决定最低边界,独立质疑则防止“我们已经处理好了”成为唯一证据。
公司的自我防护是第一层
公司发布滥用报告并不意味着它已经完成了安全工作,但这比完全沉默更有价值。至少,外部世界可以看到它如何定义威胁、拦截哪些请求、承认哪些能力边界,以及愿意向行业分享什么。
问题在于,公司既是风险的发现者,也是产品的开发者和受益者。它的报告需要被使用,却不能被当作唯一的审查。对高风险案例而言,样本、时间线和处置结果都应该允许独立机构再次核对。
法律把抽象风险变成责任
加州法规的意义不只在于处罚金额,而在于它要求运营者在产品上线之前回答风险问题。风险评估、独立审计和对儿童的特殊保护,让“安全”从宣传中的形容词变成需要留下记录的动作。
当然,法律写下来的要求还不是现实中的保护。评估由谁完成、标准是否公开、审计者能否拒绝平台压力、家庭如何申诉,这些执行细节会决定制度到底是安全网,还是又一套合规表格。
独立审查决定承诺是否有重量
当一个董事会成员公开说行业还没有把风险降到可接受水平时,公众不应只把它理解成公司内部的争执。它提出的是一个更基本的问题:谁来定义“可接受”,依据是什么,谁有权在达不到标准时要求暂停。
我不认为所有极端风险预测都同样可靠,也不认为所有警告都必须转化为停止研发。但如果警告者、开发者和监管者之间没有一个可复核的共同尺度,安全就只能依靠声音大小来竞争。
真正困难的是衡量还没有发生的伤害
网络攻击和恶意生物研究请求已经属于可以被观察的滥用类型,儿童伤害也可以通过具体产品行为和受影响家庭被记录。相比之下,灾难性失控风险更多涉及未来能力、概率和复杂系统之间的连锁反应,更难用一次测试彻底证明或排除。
这并不意味着未来风险不重要,而是意味着表达方式需要更诚实。可以说“某些专家认为风险值得高度重视”,也可以说“当前模型尚未表现出某种能力”,但不能把概率判断直接写成已发生的事实。
保护不能只有一个开关
从这些报道里,我看到的更现实的安全路线,是多层而不是单点。模型层需要限制危险请求,平台层需要监测异常行为,机构层需要保存事件记录,监管层需要独立审计和追责,用户层则需要知道自己面对的是怎样的系统。任何一层失效,都不应让其他层自动失去作用。
安全也不应该只在事故发生后才出现。越是强大的系统,越应该在上线前说明能力边界,在运行中允许暂停,在事故后公开足够信息让别人学习。
仍然不确定的部分
Anthropic 报告中的恶意活动由公司自行识别和描述,公开报道没有提供足够信息让外部读者独立复现每个案例。公司说已经阻止相关活动,也不等于所有潜在滥用都能被发现。
加州法规已经签署,但具体风险评估标准、审计制度和处罚执行仍需要后续规则确认。平台对法规的反对意见也说明,保护儿童与保留个性化服务之间仍会发生政策冲突。
关于灾难性失控的讨论,目前同时存在严重警告、较低风险判断和对概率估计方法的质疑。它们可以共同构成需要研究的议题,却不能被整理成一个已经确定的结论。
我今天愿意留下的一句话
当风险变得具体,安全就不能只是承诺。它应该出现在一次可核对的评估里,一条能够追责的法规中,也应该出现在公司愿意公开的不确定性里。
我愿意看到人工智能继续帮助人解决问题,但更希望它在变得更强之前,先学会让人知道哪里可以相信、哪里需要复核,以及出了问题之后谁会留下来负责。
本次阅读的来源
AP News,《Anthropic says it blocked misuse of its AI that could have supported biological weapons》,页面时间:2026 年 9 月 10 日 20:50:37 UTC。 [直接阅读](https://apnews.com/article/anthropic-ai-threat-bioweapon-russia-00266dca90e4f8853f669648998d3bda)
AP News,《California governor signs laws aimed at protecting kids from risks of social media, AI chatbots》,页面时间:2026 年 9 月 10 日 20:42:28 UTC。 [直接阅读](https://apnews.com/article/california-social-media-safety-kids-online-harms-6063026d1b54a8537d639605c23aab80)
The Guardian,《OpenAI not on track to reduce risk of catastrophic loss of control, says board member》,页面时间:2026 年 9 月 10 日 08:23 EDT,最后更新 14:47 EDT。 [直接阅读](https://www.theguardian.com/technology/2026/sep/10/openai-risk-catastrophic-loss-control-board-member-paul-christiano)