标签

LLM

Real World VoiceEQ:如何衡量语音 AI 的“真人感”

来源: huggingface.co 35
语音 AI 的评估正在从“能不能听清”转向“是否像一个合格的人类交流者”。仅看字错率、响应延迟或音频自然度,很难解释系统为什么在实验室里表现良好,进入电话客服、语音助手或实时陪练场景后却让用户频繁打断、重复问题,甚至直接退出对话。Real World VoiceEQ 关注的正是这个缺口:在真实交互条件下衡量语音 AI 的人类交流质量。 由于给定材料只有...

Thinking Machines 欢迎 Inkling:面对新 AI 项目,先验证能力边界再谈接入

来源: huggingface.co 35
Thinking Machines 以“Welcome Inkling”为题介绍 Inkling,但现有来源摘要没有披露它究竟是模型、产品、研究项目还是新加入的团队,也没有给出 API、性能或发布时间等细节。因此,对开发者最有价值的做法不是猜测具体功能,而是建立一套可复用的评估流程:等正式接口和文档公布后,用同一批任务快速验证能力、成本、延迟与安全边界...

从线索发现到个性化邮件:用 Strands Agents 与 Amazon Bedrock 构建多智能体销售流水线

来源: aws.amazon.com 51
多智能体系统真正进入生产环境后,难点不再只是“让几个 Agent 相互调用”,而是如何控制执行路径、稳定评估线索、限制成本,并确保生成的销售邮件有依据、可审计。Thrad.ai 的实践覆盖了从潜在客户发现到个性化邮件生成的完整流程,并对 Strands Agents 中的 Swarm 与 Graph 两种编排方式进行了延迟、成本和邮件质量的正面对比。 ...

从队列深度到自动扩缩容:为 Kubernetes 编写自定义指标 Exporter

来源: kubernetes.io 55
Kubernetes 原生理解 CPU 和内存,但真实业务压力往往来自另一组信号:消息队列里积压了多少任务、最近一次批处理耗时多久、每个 Pod 维持了多少 WebSocket 连接。自定义指标 Exporter 的作用,就是把这些应用状态转换成 Prometheus 能抓取的时间序列,为查询、告警以及后续的 HPA 自动扩缩容提供数据基础。 Expo...

从基础模型到可治理智能体:Google 企业 AI 一体化栈的关键价值

来源: cloud.google.com 45
Google 在 IDC MarketScape 2026 全球基础模型软件厂商评估中被列为领导者。比排名本身更值得开发团队关注的,是其背后的产品路线:将 Google DeepMind 的前沿模型、专用 AI 基础设施、智能体平台、企业入口和治理能力组合为一套生产系统。竞争焦点已经不只是“哪个模型回答得更好”,而是谁能让模型可靠、安全地执行真实业务流...

把 LLM 评测从数周压缩到一天:一条可持续迭代的工程路径

来源: medium.com 44
LLM 应用真正拖慢迭代的,往往不是模型调用本身,而是准备数据、批量执行、人工复核和汇总结果之间的等待。来源标题给出了一个鲜明结果:评测周期从数周缩短到一天。由于摘要没有披露具体实现,下面不推测原团队的技术栈,而是给出一套可以这样实践的工程方案:让评测集可版本化,让任务并发执行,让失败能够恢复,并把人工判断集中在最有价值的样本上。 一次完整评测通常由多...

用测试套件与 CLI 将 Amazon Nova Act 智能 QA 接入回归测试流水线

来源: aws.amazon.com 41
单个智能测试能够验证一条用户路径,但软件交付真正棘手的部分,是在每次合并、发布和环境变更后稳定地重跑整批回归用例。QA Studio 在 Amazon Nova Act 智能测试能力之上,引入测试套件与命令行接口:前者负责组织和并行执行测试,后者把这些测试带入 CI/CD 流水线。 回归测试不能只是把几十条命令顺序执行一遍。团队通常需要同时处理三类问题...

把 Claude 跑进企业生产环境:Google Cloud 上的端点、安全与成本设计

来源: cloud.google.com 36
把大模型接入原型只需要一次 API 调用,但把它稳定地服务给全球用户,还要处理算力调度、尾延迟、区域故障、数据驻留、访问控制和成本波动。Claude 在 Google Cloud Agent Platform 上以托管模型服务提供,把这些问题纳入企业已经使用的 IAM、VPC Service Controls、Cloud Logging 和 Cloud...

ARD 规范:为 AI Agent 补上工具发现与可信验证层

来源: infoq.com 41
Google 与多家行业合作伙伴发布了 Agentic Resource Discovery(ARD)规范,试图解决 AI Agent 生态中的一个基础问题:当工具、API 和其他 Agent 持续变化时,Agent 如何动态找到可用能力,并判断这些能力是否可信、兼容且适合当前任务。 ARD 的定位不是替代 MCP、OpenAPI 等执行协议,而是在它...

ARD 规范:为 AI 智能体补上工具发现与可信验证层

来源: infoq.com 39
Google 与多家行业合作伙伴公布了 Agentic Resource Discovery(ARD)规范。这项开放标准关注的不是智能体如何调用工具,而是调用之前更棘手的几个问题:有哪些工具可用、去哪里找到它们、能力描述是否可信,以及不同平台能否理解同一份资源信息。 ARD 试图在 MCP、OpenAPI 等现有执行协议之上增加一个发现层。执行协议继续...