2026-09-09
来源: aws.amazon.com
29
大语言模型通常把“思考过程”展开成一串 chain-of-thought(CoT)文本,而 Pathway 的 Baby Dragon Hatchling(BDH)选择了另一条路线:让推理发生在潜空间中,不必逐步输出推理 token。这种脑启发、后 Transformer 架构不仅改变了推理接口,也改变了训练、评测和基础设施优化的重点。Pathway ...
2026-09-09
来源: aws.amazon.com
20
大语言模型通常通过不断生成 token 来展开推理,而 Pathway 的 Baby Dragon Hatchling(BDH)选择了另一条路线:它是一种受大脑启发的后 Transformer 架构,在潜空间中进行推理,而不是把完整的思维链逐 token 输出。这个变化不仅影响模型结构,也会改变训练、扩展和成本评估的方式。 Pathway 在 Amaz...
2026-09-09
来源: aws.amazon.com
44
Amazon SageMaker Feature Store 新增了 API。应用现在可以在一次请求中更新一项或多项特征值,不必先读取整条记录,再把未修改的字段原样写回。 这项能力同时适用于两种在线存储层:基于 Amazon DynamoDB 的 Standard tier,以及基于 Amazon ElastiCache 的 In-Memory tie...
2026-09-09
来源: aws.amazon.com
34
自动把 MLflow 模型注册到 Amazon SageMaker AI Model Registry,只解决了“模型如何进入注册表”的问题。当开发、治理和生产环境分布在不同 AWS 账户后,真正棘手的是:谁拥有模型组、谁可以修改审批状态、推理制品放在哪里,以及账户被回收后模型是否仍可部署。 围绕跨账户治理,可以考虑两种拓扑:通过 AWS Resour...
2026-09-09
来源: aws.amazon.com
27
Amazon SageMaker AI 托管的 MLflow 现在可以把更完整的模型信息同步到 SageMaker AI Model Registry,包括训练指标、评估结果、推理规格和模型血缘,并让模型生命周期阶段的晋升进入统一治理流程。对团队而言,这意味着 MLflow 不再只是实验记录工具,Model Registry 也不必依赖人工补录上下文。...
2026-09-09
来源: aws.amazon.com
27
传统服务可以靠单元测试验证确定性输出,AI Agent 却没有这么简单:同一个问题可能产生不同措辞,工具调用还会受到上下文、权限和模型版本影响。更可靠的办法,是把部署、真实提示词调用和语义评分串进 CI,让每个 Pull Request 都接受一次自动化行为检查。 Amazon Bedrock AgentCore Evaluations 与 GitHu...
2026-09-09
来源: aws.amazon.com
38
部署实时大模型服务时,GPU 型号更新并不自动等于成本下降。真正需要比较的是:在目标并发、输入长度和输出长度下,每秒能生成多少 token,用户需要等待多久,以及这些 token 最终花了多少钱。 针对 Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B 这两个 30B Mixture-of-Experts(MoE...
2026-09-09
来源: aws.amazon.com
29
灾难恢复系统的排障难点,不只是日志多,而是证据分散在复制任务、恢复点、网络、存储和基础设施状态中。HPE Zerto 基于 Amazon Bedrock 构建了一套智能体式排障系统,并把执行环境部署在客户本地。这个设计值得关注:大模型负责推理,但对实时灾备数据的采集、约束和治理留在客户环境内。 这类系统真正困难的部分,不是让模型“读懂一段日志”,而是让...
2026-09-09
来源: aws.amazon.com
32
联络中心质检真正困难的地方,不只是让模型给出一个分数,而是要让运营团队知道:为什么扣分、证据来自哪句话、规则如何调整,以及换一种语言后结果是否仍然可信。 滴滴基于 Amazon Bedrock 建设了一套自有的智能质检系统,用来替换不透明的第三方工具。根据案例摘要,系统的意图验证准确率从 38% 提升到 86%,合规评分准确率超过 90%,西班牙语和葡...
2026-09-09
来源: cloud.google.com
38
企业落地智能体并没有统一答案。需要快速部署、集中治理的团队,可以选择托管式商业平台;已经拥有专用工作流、自定义执行引擎或内部权限体系的团队,则往往更适合搭建轻量级 Agent Hub。 这类自建平台真正困难的部分并不是调用模型,而是让几十个后台智能体持续、可预测地运行:工具调用必须受限,执行过程必须可追踪,多轮状态必须能够恢复,运维人员还要在必要时阻止...