标签

LLM

Agentic AI 从试点走向生产,网络为何成了关键控制面

来源: cloud.google.com 39
企业并不缺少 AI 试点,真正困难的是把试点变成可治理、可观测、可持续运行的生产系统。IDC 的 2026 AI in Networking Special Report Survey 指出,阻碍 AI 项目落地的核心问题越来越偏向基础设施:32.6% 的受访者提到安全顾虑,26.8% 提到自动化挑战,24.7% 则受限于人员时间和技能。 Agenti...

让 AI 原型安全失败:YouTube 如何跨过生产验证鸿沟

来源: cloud.google.com 36
LLM 和编码智能体把“从空目录到可用演示”的时间压缩到了几小时,但企业真正昂贵的环节并不是生成代码,而是验证代码:原型需要接触真实数据、嵌入真实界面,还不能污染数据库、拖垮核心服务或把未经审查的依赖带进主干。来源材料引用的数据称,只有 5% 的 AI 原型最终进入生产。YouTube 的应对方式不是简单加快代码评审,而是建立一套与生产主线解耦、又足够...

用 BigQuery 管理大规模 Gemini Enterprise:从日志汇聚到合规审计

来源: cloud.google.com 27
当 Gemini Enterprise 从小范围试用扩展到全公司时,管理难题会迅速变化:团队不再只关心“有多少人在用”,还需要回答哪些部门在创建自定义智能体、NotebookLM 是否真正进入工作流、企业数据被如何检索,以及某次安全拦截究竟由什么内容触发。 产品内置仪表板适合观察日常采用率和活跃用户,但组织级治理往往需要关联 HR、部门、成本中心和安全...

用 AlloyDB AI、Gemini 与 RUM 补上 PostgreSQL 中日韩全文检索的分词缺口

来源: cloud.google.com 36
PostgreSQL 全文检索擅长处理由空格分隔的文本,但面对中文、日文、韩文等连续书写语言时,默认解析器可能把整句话当成一个词元。AlloyDB AI 提供了一条数据库内解决路径:先用 Gemini 做上下文相关的分词,再用 和 RUM 建立全文索引,并可进一步叠加 ScaNN 向量检索,形成一条 SQL 内的混合搜索链路。 PostgreSQL 需...

Stripe 基准测试揭示 AI 编程代理的短板:能接通支付,不等于完成交付

来源: infoq.com 30
AI 编程代理已经能够跨越后端接口、前端页面和浏览器操作来搭建 Stripe 集成,但 Stripe 推出的基准测试把问题推进了一步:代理生成了代码之后,能否真正执行、测试并验证完整支付流程?在接近生产环境的约束下,“代码看起来正确”和“系统可以交付”之间仍有明显距离。 普通代码评测往往检查函数输出、单元测试通过率或补丁是否能编译。Stripe 的测试...

会调用 Stripe API 还不够:AI Agent 真正薄弱的是验证闭环

来源: infoq.com 39
Stripe 推出的基准套件,把 AI Agent 放进接近真实生产环境的支付集成任务中:它不仅要编写后端接口,还要连接前端与浏览器结账流程,并证明整个链路确实可用。研究传递出的关键信号很直接:Agent 往往能够产出集成代码,但在执行、测试和验证环节仍容易留下缺口。 一个 Stripe 集成至少横跨三层: 后端创建 Checkout Session,...

公开 Cloud Run 服务如何从一个输入漏洞演变为云项目失陷

来源: cloud.google.com 40
公开的无服务器服务并不天然不安全,但它把自研代码、第三方依赖、运行时身份和云 API 放在了同一条攻击链上。一次目录遍历或命令注入,可能不只暴露容器内的文件,还会让攻击者借助服务账号权限访问 Secret Manager、Cloud Storage,甚至控制整个 Google Cloud 项目。 真正有效的防护不能只依赖修复某一行代码。团队需要同时约束...

从州级试验到全国规则:用“反向联邦主义”推进 AI 安全治理

来源: openai.com 34
美国的 AI 治理并不只有“联邦统一立法”这一条路。OpenAI 提出的“反向联邦主义”思路,是让州级法律先形成可观察、可比较的治理实践,再把其中有效的规则汇入全国框架。它试图同时保留地方试验的速度,以及国家标准所需的一致性与民主问责。 传统联邦主义通常从联邦政府划定边界,再由各州在边界内实施。这里的方向有所不同:州政府先针对现实问题制定规则,联邦层面...

GPT-Red:用自博弈把自动化红队变成持续改进回路

来源: openai.com 20
传统红队测试往往依赖人工编写攻击提示词:测试人员找到一个越狱或提示注入样本,模型团队修复,再开始下一轮。GPT-Red 展示了另一条路线:让自动化攻击者通过自博弈持续探索失败案例,并把测试结果反馈到后续攻击与防御中。这种机制关注的不只是单次攻击成功率,更重要的是能否形成可重复、可扩展的安全改进闭环。 人工红队的价值很高,尤其擅长发现依赖语境、社会工程和...

用 Solon ReActAgent 构建可审计的发票识别与智能报销流程

来源: oschina.net 36
发票报销看似只是“识别图片并填写表单”,真正落地时却同时涉及 OCR、真伪校验、抬头核对、重复报销检测、审批规则和人工复核。某中型企业财务团队面对大量月度报销单,手工录入占用大量时间,抽检又难以稳定发现连号票、重复票等风险。 ReActAgent 适合承担这里的流程编排工作:模型负责理解票面信息和决定下一步动作,确定性的业务工具负责查询、校验和落库。这...