标签

架构设计

微软将 AI 治理从纸面政策推进到运行时强制执行

来源: infoq.com 47
AI 治理正在从“发布一份负责任 AI 政策”转向“在系统运行时持续证明策略确实生效”。微软近期提出了一套覆盖九个治理领域的 AI 治理架构,并将治理能力归纳为四项职能:政策、控制、可见性和证明。 这套思路的关键,不是增加一层静态审批流程,而是把治理要求接入 AI 应用和智能体的实际执行路径:身份验证、权限控制、安全检测、运行时策略、持续评估、可观测性...

WePush 5.1.3:批量推送新增四类运营商短信协议

来源: oschina.net 30
WePush 5.1.3 已发布。这个版本继续围绕批量推送这一核心场景演进,重点补齐运营商短信能力:新增 CMPP、SMGP、SGIP 和 SMPP 协议支持,同时完善短信发送链路与验收流程。 对于需要批量发送通知、验证码或运营消息的团队来说,这意味着 WePush 的接入范围从常见推送场景进一步延伸到运营商短信。项目仍然保持“小而美”的定位,功能集中...

让机器承担相关性:云原生事件响应中的多信号根因分析

来源: cncf.io 28
当微服务分布在多个区域、调用链彼此交织时,一次生产故障会同时产生日志、指标、追踪、部署事件和告警。真正困难的不是收集更多遥测数据,而是在告警洪流中判断:哪些信号只是一起出现,哪个因素可能改变了系统状态。 在这种规模下,人不应该充当“相关性引擎”。更有效的方向是让系统先完成多信号归并和排序,再由值班工程师验证因果假设。 单个告警通常只能描述症状。例如,某...

当 DRAM 控制器寄存器击穿 CPU 内存隔离:理解 skitter-creek-bath-salts 的风险

来源: infoq.com 37
CPU 的权限级别通常被视为内存安全边界:普通用户进程不能读取内核、虚拟机监控器或其他租户的数据。然而,安全研究员 Christopher Domas 开发的开源硬件安全工具 展示了一个更底层的问题:如果非特权软件能够操纵内存控制器中的地址翻译寄存器,CPU 建立的访问隔离可能被绕过。 这类问题的关键不在于某个操作系统 API 配置错误,而在于处理器、...

SafeChat:面向实时交易市场的规模化 AI 安全系统

来源: infoq.com 33
在实时交易市场中,聊天消息会随着订单、配送和客服协作持续产生。安全系统既要处理明显违规内容,也要识别依赖上下文的灰度风险;如果所有消息都交给大语言模型判断,成本、延迟和吞吐量很快会成为瓶颈。 DoorDash 分享的 SafeChat 架构提供了一条更务实的路径:用快速的内部模型过滤明显案例,用大语言模型完成多维度评分,再通过无代码工作流和回测机制持续...

用 DynamoDB 和 Bedrock 构建统一的 AI Agent 架构

来源: aws.amazon.com 28
AI Agent 往往同时需要两类数据:一类是订单、用户、库存等结构化业务数据,另一类是文档、知识库和历史记录中的语义信息。传统方案通常把业务数据放在 DynamoDB,把向量放在独立的向量数据库,再通过多个数据访问层拼接结果。这样虽然灵活,却增加了同步、权限和运维成本。 借助 Amazon DynamoDB 的原生向量搜索能力,可以把向量嵌入与业务字...

用 Amazon Bedrock 构建 Agentic Data Operations Platform:把数据工程从数周压缩到数小时

来源: aws.amazon.com 36
新增一个数据源,真正耗时的往往不是把文件放进对象存储,而是完成格式识别、质量检查、敏感字段处理、业务建模、血缘登记和上线验证。Agentic Data Operations Platform(ADOP)提供了一种参考架构:让多个职责明确的 AI Agent 协同完成 Bronze、Silver、Gold 数据流水线,同时把治理和合规控制放在流程内部。 ...

两个 Flink 自动扩缩容器的故事:如何选择适合你的弹性方案

来源: netflixtechblog.com 34
Flink 作业的自动扩缩容,表面上都是“指标高了就扩容,指标低了就缩容”,真正落地时却会遇到两个完全不同的问题:一类方案理解 Flink 内部的反压、处理速率和并行度,另一类方案只负责根据外部指标调整 Kubernetes 工作负载。它们都能改变副本或并行度,但决策依据、调整粒度和风险边界并不相同。 本文把这两类方案称为“两个 Flink autos...

AI 时代的云安全:别跳过 MFA、补丁和分层防御这些基本功

来源: cloud.google.com 34
AI 正在把攻击和防御同时推向更快的节奏:攻击者可以批量生成更贴合目标的钓鱼话术、动态混淆恶意代码,防守方则可以用模型发现漏洞、关联遥测并辅助修复。但速度并不会替代安全基本功。恰恰相反,身份控制、补丁治理、可观测性和分层防御,决定了组织能否承受 AI 放大的攻击强度。 Google Cloud CISO Chris Betz 的核心观点很直接:面对 A...

Cloudflare 如何用 AI Agent 将 Astro 的 GitHub Issue 减少 85%

来源: infoq.com 41
Cloudflare 在 Astro 项目中引入 AI Agent,围绕 GitHub Issue 分流、自动分析和持续验证构建了一套 agentic workflow,最终将需要人工处理的 Issue 数量减少了 85%。这个案例的重点并不是“让 AI 自己写完所有代码”,而是把重复性的维护工作拆成可审计、可回滚、有人把关的自动化步骤。 开源项目的 ...