标签

InfoQ

Stripe 基准测试揭示 AI 编程代理的短板:能接通支付,不等于完成交付

来源: infoq.com 41
AI 编程代理已经能够跨越后端接口、前端页面和浏览器操作来搭建 Stripe 集成,但 Stripe 推出的基准测试把问题推进了一步:代理生成了代码之后,能否真正执行、测试并验证完整支付流程?在接近生产环境的约束下,“代码看起来正确”和“系统可以交付”之间仍有明显距离。 普通代码评测往往检查函数输出、单元测试通过率或补丁是否能编译。Stripe 的测试...

会调用 Stripe API 还不够:AI Agent 真正薄弱的是验证闭环

来源: infoq.com 52
Stripe 推出的基准套件,把 AI Agent 放进接近真实生产环境的支付集成任务中:它不仅要编写后端接口,还要连接前端与浏览器结账流程,并证明整个链路确实可用。研究传递出的关键信号很直接:Agent 往往能够产出集成代码,但在执行、测试和验证环节仍容易留下缺口。 一个 Stripe 集成至少横跨三层: 后端创建 Checkout Session,...

在本地 VS Code 中连接 Google Cloud 托管 Jupyter Notebook

来源: infoq.com 33
Google Cloud Workbench Notebooks 扩展把本地 VS Code 与 Google Cloud 上的托管 Jupyter Notebook 环境连接起来。它解决的核心问题很直接:开发者可以继续使用熟悉的本地编辑器,同时把 Notebook 代码放到云端托管环境中执行,不必在浏览器界面和本地工程之间频繁切换。 这类连接方式把 ...

ARD 规范:为 AI Agent 补上工具发现与可信验证层

来源: infoq.com 41
Google 与多家行业合作伙伴发布了 Agentic Resource Discovery(ARD)规范,试图解决 AI Agent 生态中的一个基础问题:当工具、API 和其他 Agent 持续变化时,Agent 如何动态找到可用能力,并判断这些能力是否可信、兼容且适合当前任务。 ARD 的定位不是替代 MCP、OpenAPI 等执行协议,而是在它...

ARD 规范:为 AI 智能体补上工具发现与可信验证层

来源: infoq.com 38
Google 与多家行业合作伙伴公布了 Agentic Resource Discovery(ARD)规范。这项开放标准关注的不是智能体如何调用工具,而是调用之前更棘手的几个问题:有哪些工具可用、去哪里找到它们、能力描述是否可信,以及不同平台能否理解同一份资源信息。 ARD 试图在 MCP、OpenAPI 等现有执行协议之上增加一个发现层。执行协议继续...

Brain2Qwerty v2 开源:非侵入式脑机接口如何把脑信号解码成句子

来源: infoq.com 47
Meta 近期开放了 Brain2Qwerty v2。这套非侵入式脑机接口可以从 EEG(脑电图)或 MEG(脑磁图)信号中解码句子,评估中的平均词准确率达到 61%,而其他非侵入式方法约为 8%。这个差距让系统值得研究,但 61% 也意味着它离可靠输入法仍有明显距离。 脑信号到文本不是普通的语音识别问题。EEG 和 MEG 记录的是混合后的神经活动,...

Genkit Agents API 预览:让 TypeScript 与 Go 智能体支持后台回合和人工审批

来源: infoq.com 45
Google 发布了面向 TypeScript 和 Go 的 Genkit Agents API 预览版。它试图把智能体应用里反复出现的基础设施问题收进统一的 接口:消息历史、工具调用循环、流式输出和状态持久化都由框架协调。更值得关注的是两个执行能力:客户端断开后仍可继续工作的 detached turns,以及能暂停工具、等待人工决定再恢复的 int...