标签

架构设计

AI 需求增长下,如何提升基础设施效率

来源: dropbox.tech 35
随着 AI 应用持续扩大,支撑训练、推理、数据处理和模型服务的基础设施也在快速增长。真正的挑战不只是增加服务器数量,而是让计算、存储、网络和运维资源在需求变化时保持高利用率,同时控制成本、能耗与交付复杂度。 这意味着基础设施建设需要从“堆更多容量”转向“根据需求精确配置容量”。 AI 工作负载通常具有明显差异:模型训练可能持续数小时甚至数天,推理服务则...

用 Dataflow 构建高吞吐、低成本的生成式 AI 流式工作流

来源: cloud.google.com 48
实时流处理擅长稳定地执行固定 DAG,生成式 AI Agent 则擅长根据上下文临时规划、查询数据并调用工具。把两者直接拼在一起并不难,难的是控制成本、延迟和外部 API 配额:如果每条消息都进入大模型和多步 Agent,高吞吐数据流很快就会变成昂贵而缓慢的任务队列。 更实用的架构是设置一道“轻模型闸门”:所有事件先由 Dataflow 工作节点上的 ...

从文本 RAG 到多模态企业智能体:Box 与 Gemini Embeddings 2 的架构演进

来源: cloud.google.com 30
企业内容从来不只有文字。财务模型依赖表格的行列关系,临床报告同时包含照片和病理图像,工程文档用流程图表达系统逻辑,合同中的关键信息还可能藏在扫描页和批注框里。 Box 与 Google Cloud 正在把 Gemini Multimodal Embeddings 2 集成到 Box Agentic Platform。关键变化不是简单增加一种搜索模型,而...

从晶圆厂到 Token:AI 基础设施瓶颈如何重塑软件架构

来源: infoq.com 43
AI 市场的瓶颈已经不只是“模型够不够聪明”。从芯片制造、先进封装,到数据中心供电、网络互联,再到模型推理阶段的 Token 成本,每一层都会影响最终的软件架构。Jordan Nanos 在《From Fab To Token: The State Of The Market》中把这些环节放在同一张图上讨论:硬件供给决定了算力扩张速度,网络决定了 GP...

用多智能体代码审查抢在对手之前发现漏洞

来源: cloud.google.com 32
生成式 AI 正在把攻击者的代码分析和漏洞利用速度推向机器级别。面对被窃取的企业代码仓库,防守方如果仍依赖完全手工的源代码审查,往往很难在攻击者之前完成定位、验证和修复。 一种更可行的思路,是把大模型放进一个严格编排的安全分析流水线:让不同智能体分别负责代码侦察、威胁建模、入口发现、上下文补全、假设生成和结果验证,再由安全专家进行最终判断。Mandia...

从桌面推演到韧性智能:金融机构如何用智能体 AI 建设可审计的运营韧性

来源: cloud.google.com 43
金融机构的运营韧性不再只是定期填写一份演练报告。随着欧盟《数字运营韧性法案》(DORA)落地,银行需要更明确地证明:关键业务服务及其数字基础设施能够承受中断,团队可以协同响应,系统能够受控恢复,而且整个过程留下了可复核、可审计的证据。 德意志银行正在探索一种更适合复杂金融系统的路径:用智能体 AI 把架构、数据流、日志、历史事件、告警和运行遥测统一成企...

云原生平台主权:用多平面架构拆解控制权、数据与运营边界

来源: cncf.io 41
谈到云主权,很多团队会先问两个问题:工作负载运行在哪个区域,数据存储在哪个区域。这两个问题很重要,但它们只覆盖了主权的一部分。一个云原生平台还包含集群控制面、身份与密钥管理、镜像与软件供应链、日志审计、运维入口以及故障处理流程。只要其中一部分仍由区域之外的组织、服务或凭证控制,合规边界就可能并不完整。 多平面架构提供了一种更清晰的分析方法:把平台拆成不...

一致性才是新的延迟:AI Agent 如何选择数据层复制模型

来源: aws.amazon.com 37
当 AI Agent 还只是回答问题时,几百毫秒的复制延迟可能只是用户偶尔看到旧数据。但当 Agent 开始执行扣款、修改权限、创建工单或更新库存时,数据层的一致性会直接决定它是否可靠。 一个 Agent 的上下文并不只来自模型推理,还来自数据库查询、工具调用和前一步操作的结果。如果这些读取落后于写入,Agent 可能基于已经过期的事实继续行动。此时,...

DuckDB 异步 I/O:远程 Parquet 查询为什么能快 20 倍

来源: oschina.net 27
远程查询 Parquet 或 CSV 时,CPU 往往不是最先遇到的瓶颈。查询线程需要等待对象存储、HTTP 服务或网络文件系统返回数据,计算线程因此被大量空闲时间占据。DuckDB 从 v2.0 开始引入面向 Parquet 和 CSV 的异步读取架构,目标就是把等待 I/O 的时间交给专用线程处理,让计算线程持续进行解码、连接和聚合。 来源标题给出...