当 AI 模型从“回答一次问题”转向持续数小时甚至更久地规划、调用工具和修正行动时,安全工程的对象也发生了变化。OpenAI 在长期运行模型的部署经验中强调:更长的任务周期会带来新的安全风险,真实运行中暴露的失败需要通过迭代部署转化为更可靠的防护措施。 这意味着,团队不能只检查模型的单次输出是否合规,还要控制它在整个任务生命周期里能做什么、做了多少次,...
企业评估 AI 项目时,最容易统计的是模型调用次数、Token 消耗和活跃用户数,但这些数字并不直接等于业务价值。Sarah Friar 提出的 AI 记分卡把注意力拉回四个更接近经营结果的维度:完成了多少有用工作、每个成功任务花费多少、系统是否可靠,以及算力投入带来了多少回报。 这套框架的价值不在于制造一个漂亮的总分,而在于让产品、工程和财务团队使用...
美国的 AI 治理并不只有“联邦统一立法”这一条路。OpenAI 提出的“反向联邦主义”思路,是让州级法律先形成可观察、可比较的治理实践,再把其中有效的规则汇入全国框架。它试图同时保留地方试验的速度,以及国家标准所需的一致性与民主问责。 传统联邦主义通常从联邦政府划定边界,再由各州在边界内实施。这里的方向有所不同:州政府先针对现实问题制定规则,联邦层面...