标签

架构设计

从 PoC 到生产:用 Amazon Bedrock 扩展医疗内容审核系统

来源: aws.amazon.com 55
Flo Health 的工程团队将 AWS 生成式 AI 创新中心交付的概念验证,推进为基于 Amazon Bedrock 的生产级医疗内容审核与生成系统。真正困难的部分并不是让大模型“读懂一篇文章”,而是把模型接入可追踪、可评估、可降级,并且始终保留医学专家最终决定权的工程流程。 概念验证通常关注几个直接问题:模型能否发现内容中的医学风险,能否给出修...

在 AWS 上构建符合 HIPAA 要求的 AI 语音预约系统:Nova 2 Sonic、Bedrock Guardrails 与隐私边界

来源: aws.amazon.com 37
医疗预约看似只是“找一个空闲时间”,实际却涉及患者身份、就诊原因、医生排班和联系方式等受保护健康信息(PHI)。ScienceSoft 的方案把 Amazon Nova 2 Sonic 与 Amazon Bedrock Guardrails 结合起来,让语音代理能够处理预约对话,同时把隐私保护、负责任 AI 和 HIPAA 合规要求放进同一条工作流。 ...

把 Claude 跑进企业生产环境:Google Cloud 上的端点、安全与成本设计

来源: cloud.google.com 36
把大模型接入原型只需要一次 API 调用,但把它稳定地服务给全球用户,还要处理算力调度、尾延迟、区域故障、数据驻留、访问控制和成本波动。Claude 在 Google Cloud Agent Platform 上以托管模型服务提供,把这些问题纳入企业已经使用的 IAM、VPC Service Controls、Cloud Logging 和 Cloud...

AI Agent 应该独占一个 Kubernetes Pod 吗?

来源: cncf.io 51
在 kagent 的早期架构里,Agent 并没有各自占用一个 Pod、Service 和 ServiceAccount,而是直接运行在统一的 kagent runtime 中。这种设计实现快、资源开销小,但随着 Agent 的权限、资源需求和生命周期逐渐分化,一个关键问题就浮出水面:Pod 究竟是不是 Agent 合适的部署单元? 答案通常不是简单的...

智能体时代的 AI 投资管理:用“每美元有效工作量”衡量真实回报

来源: openai.com 41
企业进入智能体时代后,AI 成本不再只是一次模型调用的价格。一个智能体可能规划任务、查询系统、调用工具、反复重试,最后还需要人工审核。此时,只看 token 单价、调用次数或演示效果,很容易低估成本,也无法回答管理层真正关心的问题:每投入一美元,究竟完成了多少可用工作? 更合适的管理单位是“每美元有效工作量”。它把业务结果、质量门槛和全链路成本放在同一...

让 AI 写得快,也让团队看得懂:用 Context Store 守住演进式架构

来源: infoq.com 55
AI 可以迅速生成接口、测试和基础实现,让开发工作的前 80% 显得异常顺畅。真正危险的是剩下的 20%:隐含依赖、跨模块约束、历史决策和运行时边界往往要到集成阶段才暴露。此时,代码虽然增长很快,团队对系统的理解却没有同步增长。 解决方向不是单纯限制 AI 生成代码,而是把规格驱动开发(SDD)、测试驱动开发(TDD)和自动化架构适应度函数统一放进仓库...

大规模服务拓扑怎么建:从遥测数据到可查询的依赖图

来源: netflixtechblog.com 57
当微服务数量从几十个增长到数千个,服务拓扑就不再是一张手工维护的架构图。它需要持续接收遥测数据,识别服务之间的调用关系,聚合海量边记录,并在故障排查时快速回答“谁在调用谁”“影响会扩散到哪里”。 来源仅提供了标题,没有给出具体实现细节。下面不推断原系统使用的组件,而是围绕大规模服务拓扑通常面对的架构问题,给出一套可以这样实践的参考方案。 服务拓扑可以抽...

把 Kubeflow 故障现场带回 Kubernetes:用 Headlamp 插件直查 CRD 与 Pod

来源: kubernetes.io 47
Kubernetes 已经承载了越来越多的 AI/ML 工作负载:Notebook、分布式训练、超参数搜索、流水线和 Spark 作业最终都会落到 Pod、存储卷、调度器与自定义资源上。Kubeflow 用 CRD 描述这些能力,但面向数据科学家的专用控制台往往隐藏了底层 Kubernetes 状态。Headlamp Kubeflow 插件补上了这层视...

用 sched_ext 为广告服务定制 Linux 调度策略:从内核升级风险到毫秒级延迟治理

来源: engineering.fb.com 57
在大规模广告投放系统中,几毫秒并不是可以忽略的噪声。请求往往要经过召回、排序、预算控制和竞价等多个阶段,调度延迟一旦出现在高分位,就可能直接影响广告服务的吞吐、超时率和业务效果。Meta 面临 Linux 内核升级可能引入延迟回退的问题时,选择了上游 Linux 的 :一个基于 BPF 的可扩展调度框架,用它构建适合广告投放工作负载的调度策略。 广告服...

从车端服务发现到云端智能体:用 AAOS、Bigtable 与 Nexus SDV 构建 AI 定义汽车

来源: cloud.google.com 40
汽车软件架构正在从“每个 ECU 各管一摊”转向可发现、可组合、可持续演进的服务体系。AAOS SDV 负责把车内非安全关键能力抽象为服务,Nexus SDV 连接车辆与云端,Bigtable 承接高频遥测,Gemini 与 Agent Development Kit(ADK)则把数据分析推进到推理和行动阶段。真正的变化不只是车辆联网,而是让车辆成为能...