标签

LLM

用治理控制 AI Agent 成本,并把 ROI 变成可审计的经营指标

来源: azure.microsoft.com 20
当 AI Agent 从试验项目进入生产环境,问题就不再只是“模型能不能完成任务”,而是每一次调用花了多少钱、带来了多少业务价值,以及团队能否持续证明这笔投入值得。围绕 Microsoft Foundry 的 Agent 优化思路,可以把 AI 视为一种需要预算、监控、治理和复盘的受管投资系统。 这也是 Agent 经济学讨论的落点:成本优化不是单纯压...

把技能、文档与 MCP 打成一个包:Google Cloud AI 编码代理插件实战

来源: cloud.google.com 33
AI 编码代理接入云平台时,难点通常不是生成一条 命令,而是同时处理身份认证、IAM 权限、项目上下文、官方文档以及危险操作确认。Google Cloud 新发布的 插件试图把这些彼此关联的能力封装成一个可安装单元,让代理不必依赖零散技能和手工拼接的 MCP 配置。 单个 Agent Skill 适合描述边界明确的任务,例如检查 是否存在、解释某项 I...

用 Amazon Bedrock 构建与模型无关的 PII 检测器

来源: aws.amazon.com 26
PII 检测不应该被某个固定模型或写死的实体列表绑住。这个方案的核心思路很直接:把待识别的实体类型放进提示词,把 Amazon Bedrock 上的任意大型语言模型当作检测引擎。这样,新增“客户编号”“内部项目代号”或某类业务敏感字段时,主要修改配置和提示词,不需要重新训练检测模型。 传统 PII 检测器通常在代码、规则或模型标签中固定实体集合,例如姓...

用 Codex 和 ChatGPT 加速抗菌肽发现:从基因组搜索到实验候选

来源: openai.com 35
耐药性感染正在压缩现有抗生素的有效空间。César de la Fuente 的实验室把 Codex 和 ChatGPT 引入抗菌分子搜索流程,从现生与已灭绝物种的基因组中寻找候选序列。这里真正值得关注的并不是让语言模型直接“发明药物”,而是用它们加快代码编写、数据整理、候选排序和分析迭代,同时把生物学判断与实验验证牢牢留在研究人员手中。 从基因组到抗...

用 AEM 拆解多轮 Agent 失败:找到真正出错的那一轮

来源: aws.amazon.com 36
多轮 Agent 的失败通常不是“最后一轮突然答错”这么简单。一个早期决策如果写错了状态、误解了用户意图,或者调用了错误的工具,后续多轮可能只是沿着错误前提继续推理。只看最终结果,评估者很难判断问题究竟发生在哪里。 Agent Evaluation Metric(AEM)提供了一种更适合多轮对话的拆解方式:把 Agent 质量按轮次观察,并将“造成失败...

用 Amazon Bedrock AgentCore 把航班运行数据变成可执行的周转洞察

来源: aws.amazon.com 39
航班周转延误往往不是某一个环节单独失效,而是登机、行李、加油、清洁、机组和放行等多个事件在时间线上相互影响。AvioBook 是 Thales Group 旗下公司,其 Connected Analytics 原型展示了一种实用方向:基于 AvioBook Connect 的运行数据,通过 Amazon Bedrock AgentCore 生成面向航空...

让企业数据真正可用:从自然语言提问到交互式仪表盘

来源: openai.com 37
ChatGPT Work 中的 Data agent 把企业数据分析入口变成了自然语言:连接公司数据、发现洞察,并生成可交互的仪表盘。变化不只是少写几条 SQL,而是让业务人员能够围绕同一份数据持续追问,同时让分析结果更快进入决策流程。 传统的数据分析链路通常要经过需求沟通、SQL 开发、图表制作和结果解释。任何口径变化,都可能让流程重新走一遍。数据智...

从结果到轨迹:搭建一套可落地的 Agent 评测体系

来源: tech.meituan.com 30
Agent 不再只是“输入一句话、返回一段文本”的模型封装。它会规划任务、调用工具、读取外部数据,甚至根据中间结果修改行动路线。因此,只检查最终答案是否正确,已经无法回答几个关键问题:Agent 为什么成功、失败发生在哪一步、扩大流量后是否稳定,以及系统优化后是否真的变好。 《Agent 评测白皮书》系列围绕评测落地展开,规划为“评测全览、冷启动、扩量...

OpenAI 与 GSA 扩大政府 AI 使用优惠,落地关键仍是安全治理

来源: openai.com 32
OpenAI 与美国总务管理局(GSA)计划面向符合条件的联邦、州、地方及部落政府机构提供 AI 使用优惠:许可证费用降至 0 美元、使用费享受 50% 折扣,并获得更广泛的网络安全防护支持。对公共部门而言,这降低了启动 AI 项目的直接成本,但真正决定项目能否进入生产环境的,仍是数据分类、访问控制、审计和采购边界。 这项安排包含三个值得分别评估的部分...

ChatGPT 进入金融服务:把研究、建模与客户材料串成一条可审计工作流

来源: openai.com 37
OpenAI 宣布面向金融服务推出 ChatGPT for Financial Services,将内置金融数据与 GPT-6 Astra 结合,用于研究、建模和生成面向客户的材料。真正值得关注的不是多了一个聊天入口,而是金融团队能否把数据、计算、文字表达和审核控制放进同一条工作流,同时保留证据链。 典型金融分析往往横跨数据终端、电子表格、文档和演示工...