标签

云平台

在 SageMaker HyperPod 上扩展潜空间推理:解读 Pathway 的 BDH 架构

来源: aws.amazon.com 29
大语言模型通常把“思考过程”展开成一串 chain-of-thought(CoT)文本,而 Pathway 的 Baby Dragon Hatchling(BDH)选择了另一条路线:让推理发生在潜空间中,不必逐步输出推理 token。这种脑启发、后 Transformer 架构不仅改变了推理接口,也改变了训练、评测和基础设施优化的重点。Pathway ...

让模型在潜空间里思考:Pathway 如何在 SageMaker HyperPod 上开发 BDH

来源: aws.amazon.com 20
大语言模型通常通过不断生成 token 来展开推理,而 Pathway 的 Baby Dragon Hatchling(BDH)选择了另一条路线:它是一种受大脑启发的后 Transformer 架构,在潜空间中进行推理,而不是把完整的思维链逐 token 输出。这个变化不仅影响模型结构,也会改变训练、扩展和成本评估的方式。 Pathway 在 Amaz...

跨账户管好模型:MLflow 与 SageMaker Model Registry 的两种治理拓扑

来源: aws.amazon.com 34
自动把 MLflow 模型注册到 Amazon SageMaker AI Model Registry,只解决了“模型如何进入注册表”的问题。当开发、治理和生产环境分布在不同 AWS 账户后,真正棘手的是:谁拥有模型组、谁可以修改审批状态、推理制品放在哪里,以及账户被回收后模型是否仍可部署。 围绕跨账户治理,可以考虑两种拓扑:通过 AWS Resour...

用 MLflow 与 SageMaker Model Registry 同步构建单账户模型治理闭环

来源: aws.amazon.com 27
Amazon SageMaker AI 托管的 MLflow 现在可以把更完整的模型信息同步到 SageMaker AI Model Registry,包括训练指标、评估结果、推理规格和模型血缘,并让模型生命周期阶段的晋升进入统一治理流程。对团队而言,这意味着 MLflow 不再只是实验记录工具,Model Registry 也不必依赖人工补录上下文。...

把 AI Agent 回归测试接入 GitHub Actions:用 Amazon Bedrock AgentCore 自动拦截行为退化

来源: aws.amazon.com 27
传统服务可以靠单元测试验证确定性输出,AI Agent 却没有这么简单:同一个问题可能产生不同措辞,工具调用还会受到上下文、权限和模型版本影响。更可靠的办法,是把部署、真实提示词调用和语义评分串进 CI,让每个 Pull Request 都接受一次自动化行为检查。 Amazon Bedrock AgentCore Evaluations 与 GitHu...

SageMaker 上的 30B MoE 推理怎么选 GPU:G7、G6e、G6 与 G5 基准测试方法

来源: aws.amazon.com 38
部署实时大模型服务时,GPU 型号更新并不自动等于成本下降。真正需要比较的是:在目标并发、输入长度和输出长度下,每秒能生成多少 token,用户需要等待多久,以及这些 token 最终花了多少钱。 针对 Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B 这两个 30B Mixture-of-Experts(MoE...

把灾备排障带进客户机房:HPE Zerto 的 Amazon Bedrock 多智能体架构

来源: aws.amazon.com 29
灾难恢复系统的排障难点,不只是日志多,而是证据分散在复制任务、恢复点、网络、存储和基础设施状态中。HPE Zerto 基于 Amazon Bedrock 构建了一套智能体式排障系统,并把执行环境部署在客户本地。这个设计值得关注:大模型负责推理,但对实时灾备数据的采集、约束和治理留在客户环境内。 这类系统真正困难的部分,不是让模型“读懂一段日志”,而是让...

滴滴如何用 Amazon Bedrock 重建透明、可控的联络中心质检

来源: aws.amazon.com 32
联络中心质检真正困难的地方,不只是让模型给出一个分数,而是要让运营团队知道:为什么扣分、证据来自哪句话、规则如何调整,以及换一种语言后结果是否仍然可信。 滴滴基于 Amazon Bedrock 建设了一套自有的智能质检系统,用来替换不透明的第三方工具。根据案例摘要,系统的意图验证准确率从 38% 提升到 86%,合规评分准确率超过 90%,西班牙语和葡...

用 Antigravity SDK 搭建可观测、可管控的多智能体控制平面

来源: cloud.google.com 38
企业落地智能体并没有统一答案。需要快速部署、集中治理的团队,可以选择托管式商业平台;已经拥有专用工作流、自定义执行引擎或内部权限体系的团队,则往往更适合搭建轻量级 Agent Hub。 这类自建平台真正困难的部分并不是调用模型,而是让几十个后台智能体持续、可预测地运行:工具调用必须受限,执行过程必须可追踪,多轮状态必须能够恢复,运维人员还要在必要时阻止...