标签

AI

把 LLM 评测从数周压缩到一天:一条可持续迭代的工程路径

来源: medium.com 30
LLM 应用真正拖慢迭代的,往往不是模型调用本身,而是准备数据、批量执行、人工复核和汇总结果之间的等待。来源标题给出了一个鲜明结果:评测周期从数周缩短到一天。由于摘要没有披露具体实现,下面不推测原团队的技术栈,而是给出一套可以这样实践的工程方案:让评测集可版本化,让任务并发执行,让失败能够恢复,并把人工判断集中在最有价值的样本上。 一次完整评测通常由多...

用测试套件与 CLI 将 Amazon Nova Act 智能 QA 接入回归测试流水线

来源: aws.amazon.com 28
单个智能测试能够验证一条用户路径,但软件交付真正棘手的部分,是在每次合并、发布和环境变更后稳定地重跑整批回归用例。QA Studio 在 Amazon Nova Act 智能测试能力之上,引入测试套件与命令行接口:前者负责组织和并行执行测试,后者把这些测试带入 CI/CD 流水线。 回归测试不能只是把几十条命令顺序执行一遍。团队通常需要同时处理三类问题...

用 Amazon Nova Act 扩展 UX 测试:从文档生成场景到并行执行用户流程

来源: aws.amazon.com 33
传统端到端测试擅长验证确定性的页面行为,却很难覆盖大量接近真实用户表达的操作路径。Amazon Nova Act 提供了另一种思路:让生成式 AI 从产品文档中提取测试意图,再利用智能导航能力执行用户流程,最后把运行轨迹转化为可定位、可排序的问题。真正重要的变化不只是“用自然语言操作浏览器”,而是让 UX 测试可以并行扩展。 一条传统 UI 自动化脚本...

从 PoC 到生产:用 Amazon Bedrock 扩展医疗内容审核系统

来源: aws.amazon.com 41
Flo Health 的工程团队将 AWS 生成式 AI 创新中心交付的概念验证,推进为基于 Amazon Bedrock 的生产级医疗内容审核与生成系统。真正困难的部分并不是让大模型“读懂一篇文章”,而是把模型接入可追踪、可评估、可降级,并且始终保留医学专家最终决定权的工程流程。 概念验证通常关注几个直接问题:模型能否发现内容中的医学风险,能否给出修...

在 AWS 上构建符合 HIPAA 要求的 AI 语音预约系统:Nova 2 Sonic、Bedrock Guardrails 与隐私边界

来源: aws.amazon.com 25
医疗预约看似只是“找一个空闲时间”,实际却涉及患者身份、就诊原因、医生排班和联系方式等受保护健康信息(PHI)。ScienceSoft 的方案把 Amazon Nova 2 Sonic 与 Amazon Bedrock Guardrails 结合起来,让语音代理能够处理预约对话,同时把隐私保护、负责任 AI 和 HIPAA 合规要求放进同一条工作流。 ...

把 Claude 跑进企业生产环境:Google Cloud 上的端点、安全与成本设计

来源: cloud.google.com 20
把大模型接入原型只需要一次 API 调用,但把它稳定地服务给全球用户,还要处理算力调度、尾延迟、区域故障、数据驻留、访问控制和成本波动。Claude 在 Google Cloud Agent Platform 上以托管模型服务提供,把这些问题纳入企业已经使用的 IAM、VPC Service Controls、Cloud Logging 和 Cloud...

ARD 规范:为 AI Agent 补上工具发现与可信验证层

来源: infoq.com 29
Google 与多家行业合作伙伴发布了 Agentic Resource Discovery(ARD)规范,试图解决 AI Agent 生态中的一个基础问题:当工具、API 和其他 Agent 持续变化时,Agent 如何动态找到可用能力,并判断这些能力是否可信、兼容且适合当前任务。 ARD 的定位不是替代 MCP、OpenAPI 等执行协议,而是在它...

ARD 规范:为 AI 智能体补上工具发现与可信验证层

来源: infoq.com 27
Google 与多家行业合作伙伴公布了 Agentic Resource Discovery(ARD)规范。这项开放标准关注的不是智能体如何调用工具,而是调用之前更棘手的几个问题:有哪些工具可用、去哪里找到它们、能力描述是否可信,以及不同平台能否理解同一份资源信息。 ARD 试图在 MCP、OpenAPI 等现有执行协议之上增加一个发现层。执行协议继续...

Agent 的信任不在提示词里,而在运行时里

来源: docker.com 27
AI Engineer World’s Fair 2026 的现场讨论指向一个很实际的判断:决定 Agent 能否进入生产环境的,不只是模型会不会规划和调用工具,更是运行时能否约束、观察并中止这些动作。提示词可以表达规则,但真正执行规则的地方必须是 Runtime。 来源摘要没有展开具体演讲内容,因此下面不推断某家公司发布了什么产品,而是沿着“信任在运...

Brain2Qwerty v2 开源:非侵入式脑机接口如何把脑信号解码成句子

来源: infoq.com 32
Meta 近期开放了 Brain2Qwerty v2。这套非侵入式脑机接口可以从 EEG(脑电图)或 MEG(脑磁图)信号中解码句子,评估中的平均词准确率达到 61%,而其他非侵入式方法约为 8%。这个差距让系统值得研究,但 61% 也意味着它离可靠输入法仍有明显距离。 脑信号到文本不是普通的语音识别问题。EEG 和 MEG 记录的是混合后的神经活动,...