标签

InfoQ

Cloudflare 用缓存转码压缩磁盘内容,探索把缓存容量“变大”

来源: infoq.com 24
缓存系统的瓶颈不一定是命中率,也可能是磁盘空间。Cloudflare 最近介绍了一项名为 Cache Transcoding 的原型方案:对象进入磁盘缓存前,先对符合条件的内容进行压缩,读取时再解压返回。目标很直接,在不增加物理磁盘的情况下,让现有缓存承载更多有效内容。 这项技术主要面向原本没有压缩的文本内容,例如 HTML、JSON、CSS 和 Ja...

HydraFusion:让 Copilot 在运行时组合多模型,而不是押注单一模型

来源: infoq.com 33
GitHub Project HydraFusion 是 GitHub Copilot 的研究预览项目,核心思路不是固定使用某一个模型,而是在任务执行过程中动态编排来自不同提供商的模型。系统会根据任务复杂度组装执行计划,在代码理解、方案生成、验证和修复之间分配工作。 这类设计改变了编码助手的优化目标:模型能力不再只由单次回答质量决定,还要同时考虑路由策...

HydraFusion:让 Copilot 用运行时模型编排换取更高编码质量与更低成本

来源: infoq.com 29
GitHub 的 Project HydraFusion 是 GitHub Copilot 的研究预览项目,核心变化不是简单地把某个模型换成更大的模型,而是在任务执行过程中动态组织多个模型。系统会根据任务复杂度生成执行计划,从不同提供商选择合适的模型,并在质量与运行成本之间做平衡。 这类架构值得工程团队关注:编码助手面对的任务差异很大。补全一行代码、解...

在 Apple Silicon 上虚拟化完整 iOS 27:vphone-cli 的技术意义与实践边界

来源: infoq.com 37
开源项目 vphone-cli 将完整的 iOS 27 系统带到了 Apple Silicon Mac 的虚拟机环境中。它依赖 Apple 自己的 ,而不是传统意义上的指令集模拟,因此重点不只是“能启动 iOS”,还包括更接近真实设备的系统隔离、调试和自动化测试能力。 传统 iOS Simulator 通常运行经过调整的系统组件,并不等同于一台完整的 ...

从检索到推理:用知识图谱构建可投入生产的 Agentic AI 系统

来源: infoq.com 35
基础 RAG 解决了“把相关文档找出来”的问题,但生产级 Agentic AI 还需要回答几个更难的问题:上下文为什么这样组合?系统依据了哪些事实?决策能否追溯?工程师能否看见代理正在做什么?Cassie Shum 的分享把知识图谱放在这些问题的交汇处,并总结了四种实用架构模式:上下文打包、决策溯源、代码即事实,以及代理可见性。 传统 RAG 通常围绕...

Lambda SnapStart 支持容器镜像:依赖空间与冷启动不必再二选一

来源: infoq.com 44
AWS 将 Lambda SnapStart 扩展到了容器镜像函数。这个变化解决了一个长期存在的打包取舍:Zip 部署包的体积上限更小,而容器镜像可以容纳更多依赖;但团队过去往往要在依赖空间和亚秒级启动之间做选择。 现在,使用容器镜像的 Lambda 函数也可以采用 SnapStart。对于依赖较多、又对启动延迟敏感的函数,这意味着不必仅为了满足 Zi...

Rustls 十年演进:从草根项目到面向未来的 TLS 基础设施

来源: infoq.com 27
Rustls 走过了十年发展历程:它从一个由社区推动的 Rust TLS 库,逐渐成长为获得组织资金支持的开源项目。持续的维护投入让 Rustls 不再只是“用 Rust 重写 TLS”的实验,而成为许多系统可以认真评估的安全基础设施。 这段演进的价值不只体现在性能基准上。Rustls 同时关注密码学能力、API 架构、会话处理和长期维护模型。后量子密...

NVIDIA PAIR:把局域网里的多台电脑变成个人 AI 推理池

来源: infoq.com 33
NVIDIA Personal AI Router(PAIR)现已进入 Beta 阶段。它的目标不是让某一张 GPU 突然拥有更多显存,而是把局域网中多台电脑的推理能力组织起来,自动将 AI 请求分发到合适的节点。对于会同时触发多个模型调用的本地多智能体系统,这种调度方式尤其有价值:规划、检索、编码和审查任务不必再排队挤占同一张 GPU。 理解 PAI...

NVIDIA PAIR:把局域网里的多台电脑变成 AI 推理资源池

来源: infoq.com 28
本地 AI 的瓶颈不总是模型太大,也可能是请求太多。单个智能体运行顺畅,并不代表研究、编码、检索等多个智能体同时工作时,一张 GPU 还能稳定响应。处于 Beta 阶段的 NVIDIA Personal AI Router(PAIR)试图解决这个问题:汇集局域网内多台计算机的推理能力,并自动把 AI 请求分配给它们。 PAIR 最适合多个相互独立的模型...

Netflix 如何让 Conductor 承载 4.2 亿次月度工作流执行

来源: infoq.com 43
当工作流从几百个任务增长到数万个任务时,瓶颈通常不在某一台机器的 CPU,而在元数据读写、调度评估和并发控制之间的耦合。Netflix 对 Conductor 4.0 的重构,正是围绕这个问题展开:支持的工作流规模从约 2,500 个任务提升到 30,000 个任务,同时将工作流评估的 p99 延迟降低了约 40%,以支撑每月约 4.2 亿次工作流执行...