标签

LLM

让 AI 接管量子实验循环:GPT-5.6 Sol、Codex 与量子比特校准

来源: openai.com 35
量子计算实验很少是“一次提交、直接成功”。研究人员通常需要反复修改脉冲参数、运行测量、分析结果,再根据偏差重新校准。来源案例展示了一位 MIT 研究人员如何结合 GPT-5.6 Sol 与 Codex,让系统自主执行这条实验闭环:运行实验、分析数据,并校准量子比特。 真正值得关注的不是让模型替代某一条实验命令,而是把语言模型、代码执行环境和实验设备组织...

把 AI Agent 回归测试接入 GitHub Actions:用 Amazon Bedrock AgentCore 自动拦截行为退化

来源: aws.amazon.com 28
传统服务可以靠单元测试验证确定性输出,AI Agent 却没有这么简单:同一个问题可能产生不同措辞,工具调用还会受到上下文、权限和模型版本影响。更可靠的办法,是把部署、真实提示词调用和语义评分串进 CI,让每个 Pull Request 都接受一次自动化行为检查。 Amazon Bedrock AgentCore Evaluations 与 GitHu...

SageMaker 上的 30B MoE 推理怎么选 GPU:G7、G6e、G6 与 G5 基准测试方法

来源: aws.amazon.com 38
部署实时大模型服务时,GPU 型号更新并不自动等于成本下降。真正需要比较的是:在目标并发、输入长度和输出长度下,每秒能生成多少 token,用户需要等待多久,以及这些 token 最终花了多少钱。 针对 Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B 这两个 30B Mixture-of-Experts(MoE...

把灾备排障带进客户机房:HPE Zerto 的 Amazon Bedrock 多智能体架构

来源: aws.amazon.com 29
灾难恢复系统的排障难点,不只是日志多,而是证据分散在复制任务、恢复点、网络、存储和基础设施状态中。HPE Zerto 基于 Amazon Bedrock 构建了一套智能体式排障系统,并把执行环境部署在客户本地。这个设计值得关注:大模型负责推理,但对实时灾备数据的采集、约束和治理留在客户环境内。 这类系统真正困难的部分,不是让模型“读懂一段日志”,而是让...

用 Antigravity SDK 搭建可观测、可管控的多智能体控制平面

来源: cloud.google.com 38
企业落地智能体并没有统一答案。需要快速部署、集中治理的团队,可以选择托管式商业平台;已经拥有专用工作流、自定义执行引擎或内部权限体系的团队,则往往更适合搭建轻量级 Agent Hub。 这类自建平台真正困难的部分并不是调用模型,而是让几十个后台智能体持续、可预测地运行:工具调用必须受限,执行过程必须可追踪,多轮状态必须能够恢复,运维人员还要在必要时阻止...

用 Data Agent Kit 在 IDE 里完成跨数据源根因分析

来源: cloud.google.com 23
“1 月平均订单金额下降了 7%,但总收入没有变化,为什么?”这类问题难的不是写出某一条 SQL,而是答案通常散落在多个系统里:订单历史位于 BigQuery,实时客户资料保存在 Cloud SQL for PostgreSQL,营销规则则以 JSON 文件存放在 Cloud Storage。 Data Agent Kit 试图把这段调查过程收回到 I...

KDDI 如何用自动评测与分层提示词,让 Buffmee 的 RAG 响应快 38%

来源: cloud.google.com 21
面向消费者的 RAG 应用很难只优化一个指标:回答要有依据、首字延迟要低,还要同时处理网页、EPUB、PDF、图片混排等内容。KDDI 在构建 Buffmee 时,把自动化质量评测与生产日志分析放进同一个优化闭环,最终将应用总响应延迟降低 38%,首字时间(TTFT)改善近 18%,groundedness 指标提升 25%。 Buffmee 汇集了超...

用 chdb 扩展加速 PostgreSQL 云端数据导入:能力、基准与落地方法

来源: postgr.es 34
PostgreSQL 从对象存储导入大批量数据时,瓶颈往往不只在网络。CSV、Parquet 等格式的解析、类型转换、解压缩,以及数据写入 PostgreSQL 的过程,都可能消耗大量 CPU 和内存。新发布的 PostgreSQL 扩展提供了另一种实现路径:在 PostgreSQL 侧利用 chDB——一个进程内运行的 ClickHouse 引擎——...

别把整个话题一刀切:让 AI 只拒绝真正危险的请求

来源: huggingface.co 32
安全系统最常见的失败,不只是“放过了危险内容”,还包括“把正常内容一起挡掉”。当一个请求同时包含合法目标、敏感背景和少量高风险操作时,简单地按主题拒绝,虽然实现方便,却会让医疗、网络安全、金融和心理健康等重要场景变得不可用。 更合理的目标不是判断“这个话题能不能谈”,而是识别请求中哪些部分会实质性提高伤害能力,只拒绝那一小部分,并继续回答其余内容。 传...

当 AI 更强也更便宜:把“做不起”的工作变成可运营流程

来源: openai.com 39
AI 能力提升与调用成本下降,带来的变化不只是“用机器替代一部分人工”。更值得关注的是:大量过去因为人力不足、处理速度太慢或单位成本过高而被放弃的工作,如今开始进入经济可行区间。 这意味着企业可以分析更多客户反馈、为长尾用户提供服务、持续整理内部知识,并缩短从信息出现到采取行动的时间。真正的机会不是简单减少人数,而是扩大组织能够完成的工作总量。 传统自...