标签

架构设计

流媒体广告请求的分布式工程:从实时决策到个性化投放

来源: infoq.com 48
在流媒体播放过程中,一次广告请求看起来只是“返回一条广告”,实际上要同时处理用户画像、广告候选、预算节奏、瀑布流优先级、实时竞价或内部决策,以及严格的播放时延约束。JioHotstar 对这类系统的实践说明,广告体验的核心并不只是更复杂的推荐模型,而是让多个分布式服务在极短时间内完成协调。 播放器在即将进入广告位时发起请求。请求通常携带内容、广告位、设...

为任务型 Agent 建立可持续验证的访问模型

来源: blog.cloudflare.com 50
当 Agent 不再只是回答问题,而是代表用户读取数据、调用 API、修改资源时,传统的“登录一次、授权一段时间”就不够用了。The Agent Access Model 提出了一种面向任务范围的安全架构:由严格的身份代理负责确认“谁在执行”,由持续中介负责确认“此刻是否允许”,再通过有状态的信任记录判断“这个任务是否仍然值得信任”。 这套思路的重点不...

Filestore 搭载 Colossus:为 GKE 与 AI Agent 集群重新定义共享存储

来源: cloud.google.com 48
企业存储正在从“预先买足容量”转向按工作负载动态匹配性能与规模。Google Cloud Filestore 近期将云原生后端存储层直接构建在 Colossus 之上,并通过 GKE 深度集成、独立 IOPS 配置和 multishares for GKE,为容器化应用、海量数据集以及 AI Agent 协作工作空间提供了新的共享存储基础。 Files...

一条“删库”命令跑了17小时:从89TB数据事故看算法工程师的权限与审计边界

来源: oschina.net 40
一条删除命令,可能不是几秒钟的误操作,而是持续十几个小时、最终影响数十TB核心数据的生产事故。最高人民检察院公布的这起案件中,北京一名90后算法工程师王某为了给自己承接的私活腾出服务器空间,删除了公司AI游戏部门的全部核心数据,数据量达到89TB,命令持续执行了17小时。 这起事件的技术教训并不只是“不要执行危险命令”。更值得工程团队关注的是:数据迁移...

把显存还给并发:拆解 Cloudflare 的 KV Cache 量化与权重压缩实践

来源: oschina.net 46
长上下文与 MoE 让 Kimi K 系列、GLM 等模型具备很强的推理能力,也把显存压力推到了工程团队面前。Cloudflare Workers AI 团队分享的实践表明,通过 KV cache 量化和权重压缩等手段,推理吞吐量可以提升 41%,成本降低 30%。这组数字背后的关键不是让 GPU 算得更快,而是减少每个请求占用的显存,从而把空出来的容...

从多结果集到游标集合:DMS 如何迁移 SQL Server 存储过程

来源: cloud.google.com 43
SQL Server 允许一次存储过程调用连续返回多个表格结果,应用通常只需依次调用 就能读取。PostgreSQL 的执行模型不同:多个数据集需要通过显式游标管理,而且游标只能在所属事务中使用。 这项差异会直接影响大型迁移。面对数百个包含条件分支、嵌套调用和标量返回值的存储过程,逐个手工重写既慢,也容易漏掉某条执行路径。Google Cloud Da...

德意志银行的 API 现代化:用 Apigee 统一治理、安全与 AI 接入

来源: cloud.google.com 43
银行数字化转型最容易被看到的是手机银行、开放银行和智能助手,真正决定这些服务能否稳定扩展的,却是背后的 API 基础设施。德意志银行在拆分单体系统时意识到,仅仅把功能改造成 API 并不够:如果文档、安全策略、版本管理和可观测性仍然分散,系统只会从一个大型单体变成一组难以管理的接口。 因此,德意志银行选择 Google Cloud Apigee 作为统...

Target 如何用 Spanner Graph 统一零售搜索、向量检索与交易数据

来源: cloud.google.com 51
零售商品发现正在从“输入关键词、返回商品列表”转向理解购物意图、商品语义和实体关系。Target 的 Gift Finder 聊天智能体就是一个典型场景:系统不仅要找到语义相近的商品,还要理解品类、品牌、适用年龄、兼容配件和顾客偏好,并在实时交易数据持续变化时保持结果一致。 Target 为此将原本分散在 Elasticsearch、NoSQL 数据库...

用隔离式 AI 子代理构建软件工厂:让 Astro 的 GitHub Issue 大幅归零

来源: blog.cloudflare.com 40
当一个开源项目积累了大量 GitHub Issue,真正消耗维护者时间的往往不是写补丁,而是确认问题能否复现、判断报告是否完整,以及验证修复是否真的有效。Astro 的维护实践给出了一个值得借鉴的方向:把人工 Issue 验证拆成多个运行在 GitHub Actions 中的隔离式 AI 子代理,让它们负责复现 Bug、检查补丁并生成预览版本。 根据文...