2026-07-15
来源: infoq.com
30
AI 编程代理已经能够跨越后端接口、前端页面和浏览器操作来搭建 Stripe 集成,但 Stripe 推出的基准测试把问题推进了一步:代理生成了代码之后,能否真正执行、测试并验证完整支付流程?在接近生产环境的约束下,“代码看起来正确”和“系统可以交付”之间仍有明显距离。 普通代码评测往往检查函数输出、单元测试通过率或补丁是否能编译。Stripe 的测试...
2026-07-15
来源: infoq.com
39
Stripe 推出的基准套件,把 AI Agent 放进接近真实生产环境的支付集成任务中:它不仅要编写后端接口,还要连接前端与浏览器结账流程,并证明整个链路确实可用。研究传递出的关键信号很直接:Agent 往往能够产出集成代码,但在执行、测试和验证环节仍容易留下缺口。 一个 Stripe 集成至少横跨三层: 后端创建 Checkout Session,...
2026-07-15
来源: cloud.google.com
40
公开的无服务器服务并不天然不安全,但它把自研代码、第三方依赖、运行时身份和云 API 放在了同一条攻击链上。一次目录遍历或命令注入,可能不只暴露容器内的文件,还会让攻击者借助服务账号权限访问 Secret Manager、Cloud Storage,甚至控制整个 Google Cloud 项目。 真正有效的防护不能只依赖修复某一行代码。团队需要同时约束...
2026-07-15
来源: percona.com
35
很多开发者进入 PostgreSQL 后,先熟悉的是 、 和 。但在交互式终端 中,还有一组不属于 SQL、以反斜杠开头且通常不需要分号的元命令。它们由 客户端处理,可以快速查看数据库结构、调整输出格式、执行脚本和导入导出数据,是 DBA 与后端开发者日常排查问题的重要工具。 SQL 会被发送给 PostgreSQL 服务器执行;元命令则主要控制当前 ...
2026-07-15
来源: openai.com
34
美国的 AI 治理并不只有“联邦统一立法”这一条路。OpenAI 提出的“反向联邦主义”思路,是让州级法律先形成可观察、可比较的治理实践,再把其中有效的规则汇入全国框架。它试图同时保留地方试验的速度,以及国家标准所需的一致性与民主问责。 传统联邦主义通常从联邦政府划定边界,再由各州在边界内实施。这里的方向有所不同:州政府先针对现实问题制定规则,联邦层面...
2026-07-15
来源: infoq.com
35
AWS 与 Anthropic 发布了面向 AWS 的 Claude apps gateway。它把 Claude Code 和 Claude Desktop 的身份认证、策略、遥测、模型路由与费用上限集中到一个自托管控制平面中,并可将推理请求转发至 Amazon Bedrock 或 AWS 上的 Claude Platform。 这项变化解决的不是“...
2026-07-15
来源: infoq.com
28
AWS 与 Anthropic 发布了面向 AWS 的 Claude Apps Gateway。它不是新的大模型,而是部署在企业环境中的自托管控制平面:Claude Code 和 Claude Desktop 的请求先进入网关,再由网关统一处理身份、策略、遥测、路由与支出上限,并将推理请求转发到 Amazon Bedrock 或 AWS 上的 Clau...
2026-07-15
来源: djangoproject.com
25
Django Steering Council 以 Django Software Foundation 技术治理机构的身份,为 Triptych Project 的资金申请提供了合作支持。这个项目试图把 HTMX、Unpoly、Turbo 等库验证过的部分模式带入 HTML 标准,让浏览器原生支持更完整的 HTTP 方法、独立按钮操作和局部页面替换。...
2026-07-15
来源: openai.com
20
传统红队测试往往依赖人工编写攻击提示词:测试人员找到一个越狱或提示注入样本,模型团队修复,再开始下一轮。GPT-Red 展示了另一条路线:让自动化攻击者通过自博弈持续探索失败案例,并把测试结果反馈到后续攻击与防御中。这种机制关注的不只是单次攻击成功率,更重要的是能否形成可重复、可扩展的安全改进闭环。 人工红队的价值很高,尤其擅长发现依赖语境、社会工程和...
2026-07-15
来源: oschina.net
36
发票报销看似只是“识别图片并填写表单”,真正落地时却同时涉及 OCR、真伪校验、抬头核对、重复报销检测、审批规则和人工复核。某中型企业财务团队面对大量月度报销单,手工录入占用大量时间,抽检又难以稳定发现连号票、重复票等风险。 ReActAgent 适合承担这里的流程编排工作:模型负责理解票面信息和决定下一步动作,确定性的业务工具负责查询、校验和落库。这...