标签

AI

Stripe 基准测试揭示 AI 编程代理的短板:能接通支付,不等于完成交付

来源: infoq.com 30
AI 编程代理已经能够跨越后端接口、前端页面和浏览器操作来搭建 Stripe 集成,但 Stripe 推出的基准测试把问题推进了一步:代理生成了代码之后,能否真正执行、测试并验证完整支付流程?在接近生产环境的约束下,“代码看起来正确”和“系统可以交付”之间仍有明显距离。 普通代码评测往往检查函数输出、单元测试通过率或补丁是否能编译。Stripe 的测试...

会调用 Stripe API 还不够:AI Agent 真正薄弱的是验证闭环

来源: infoq.com 39
Stripe 推出的基准套件,把 AI Agent 放进接近真实生产环境的支付集成任务中:它不仅要编写后端接口,还要连接前端与浏览器结账流程,并证明整个链路确实可用。研究传递出的关键信号很直接:Agent 往往能够产出集成代码,但在执行、测试和验证环节仍容易留下缺口。 一个 Stripe 集成至少横跨三层: 后端创建 Checkout Session,...

公开 Cloud Run 服务如何从一个输入漏洞演变为云项目失陷

来源: cloud.google.com 40
公开的无服务器服务并不天然不安全,但它把自研代码、第三方依赖、运行时身份和云 API 放在了同一条攻击链上。一次目录遍历或命令注入,可能不只暴露容器内的文件,还会让攻击者借助服务账号权限访问 Secret Manager、Cloud Storage,甚至控制整个 Google Cloud 项目。 真正有效的防护不能只依赖修复某一行代码。团队需要同时约束...

每天都能省时间的 PostgreSQL psql 元命令

来源: percona.com 35
很多开发者进入 PostgreSQL 后,先熟悉的是 、 和 。但在交互式终端 中,还有一组不属于 SQL、以反斜杠开头且通常不需要分号的元命令。它们由 客户端处理,可以快速查看数据库结构、调整输出格式、执行脚本和导入导出数据,是 DBA 与后端开发者日常排查问题的重要工具。 SQL 会被发送给 PostgreSQL 服务器执行;元命令则主要控制当前 ...

从州级试验到全国规则:用“反向联邦主义”推进 AI 安全治理

来源: openai.com 34
美国的 AI 治理并不只有“联邦统一立法”这一条路。OpenAI 提出的“反向联邦主义”思路,是让州级法律先形成可观察、可比较的治理实践,再把其中有效的规则汇入全国框架。它试图同时保留地方试验的速度,以及国家标准所需的一致性与民主问责。 传统联邦主义通常从联邦政府划定边界,再由各州在边界内实施。这里的方向有所不同:州政府先针对现实问题制定规则,联邦层面...

GPT-Red:用自博弈把自动化红队变成持续改进回路

来源: openai.com 20
传统红队测试往往依赖人工编写攻击提示词:测试人员找到一个越狱或提示注入样本,模型团队修复,再开始下一轮。GPT-Red 展示了另一条路线:让自动化攻击者通过自博弈持续探索失败案例,并把测试结果反馈到后续攻击与防御中。这种机制关注的不只是单次攻击成功率,更重要的是能否形成可重复、可扩展的安全改进闭环。 人工红队的价值很高,尤其擅长发现依赖语境、社会工程和...

用 Solon ReActAgent 构建可审计的发票识别与智能报销流程

来源: oschina.net 36
发票报销看似只是“识别图片并填写表单”,真正落地时却同时涉及 OCR、真伪校验、抬头核对、重复报销检测、审批规则和人工复核。某中型企业财务团队面对大量月度报销单,手工录入占用大量时间,抽检又难以稳定发现连号票、重复票等风险。 ReActAgent 适合承担这里的流程编排工作:模型负责理解票面信息和决定下一步动作,确定性的业务工具负责查询、校验和落库。这...