标签

架构设计

从代码补全到任务执行:Dropbox 如何重构 AI 时代的工程生产力

来源: dropbox.tech 52
代码补全、智能搜索、自然语言查错——这些 AI 辅助工具已经渗透进大多数工程师的日常。但 Dropbox 的工程团队正在推进一个更激进的转向:不再把 AI 当作"帮人写代码的助手",而是构建能够独立执行有边界任务的 agentic 系统,并为此搭建支撑平台。这意味着工程生产力的定义本身正在被重写。 辅助工具的交互模型是"人提问,AI 回答"。工程师写一...

Slack AI 的多云之路:在企业级规模下可靠地服务大模型

来源: slack.engineering 59
2023 年初,Slack 面对一个底层问题:如何在企业级规模上服务大语言模型,同时满足客户对安全、可靠性和性能的预期。三年间,他们从最基础的基础设施起步,逐步演进到一套成熟的多云编排架构。这不是追逐新模型的炫技,而是要构建一个能抵御区域级故障、在云厂商之间灵活调度的系统。 LLM 推理的负载特征和传统 Web 服务截然不同——单次请求耗 GPU 算力...

扇出架构的慢请求不是故障:自适应 Hedged Request 如何把 p99 延迟砍掉 74%

来源: infoq.com 50
你监控每个服务的 p99 都在 200ms 以内,但网关层的 p99 却飙到 800ms——这不是监控出了问题,而是扇出架构里"慢但没挂"的请求在层层叠加。Prathamesh Bhope 在这篇文章里提出了一套自适应对冲请求(adaptive hedged request)方案:用 DDSketch 实时估算分位数决定何时发对冲请求,用滑动窗口应对分...

别再纠结架构风格还是架构模式了——双驱动架构的务实选择

来源: my.oschina.net 62
每次架构评审会上,总有人抛出这个问题:"我们用的是架构风格还是架构模式?"争论一轮下来,设计图没画完,术语倒是厘清了。但系统还是那个系统,代码还是那些代码。 原文的核心观点很直接:过度区分架构风格和架构模式没有实际意义。风格也好,模式也罢,最终都是在回答同一个问题——如何从高层次指导系统构建,同时满足更多质量属性。与其在概念上划界,不如把注意力放回驱动...

qKnow 3.0:插件化中台如何让企业智能体从"拼凑"走向"组装"

来源: oschina.net 46
企业做 AI 应用,最怕的不是模型不够强,而是平台撑不住。架构臃肿耦合、配置流程繁琐、AI 能力碎片散落、数据运营体系缺失——这些老问题让不少团队在智能体落地时反复踩坑。qKnow 3.0 把整个中台架构推倒重来,核心思路只有一个:插件化。能力按需挂载,业务按场景组装,部署按规模弹性伸缩。 传统智能体平台通常把知识检索、对话引擎、任务编排、数据统计全部...

SamWaf v1.3.20:轻量私有 WAF 的实用升级,隧道 SSL 与压缩终于到位

来源: oschina.net 61
对小团队和独立开发者来说,网站防火墙往往处在"想用但嫌重"的尴尬位置——商业 WAF 按域名收费、云 WAF 要把流量过别人的节点,而自建 ModSecurity 规则维护成本不低。SamWaf 走的是另一条路:开源、单机私有部署、轻量到一台低配 VPS 就能跑。v1.3.20 这版补上了几个被反复催的功能,尤其是隧道 SSL 和压缩支持,让它在内网穿...

Linux x32 ABI 走向终结:一个折中设计的失败教训

来源: oschina.net 51
Linux 内核开发者正在认真考虑移除 x32 ABI。Linutronix 的 Sebastian Andrzej Siewior 近日提交了弃用补丁,这个在 v3.4 引入、试图在 x86_64 上用 32 位指针换取性能的方案,经过十余年实践证明——它没能兑现承诺。 x32 ABI 的核心思路很简单:在 x86_64 架构上运行,享受更多的寄存器...

用 Bedrock AgentCore 搭建企业级对话式 BI 助手:AWS SMGS 的 NarrateAI 实战拆解

来源: aws.amazon.com 60
AWS 内部的 Sales, Marketing and Global Services(SMGS)组织每天要处理海量业务数据——销售管线、营销 ROI、全球服务工单,数据散落在数十个系统里。传统 BI 仪表盘能看数,但没法"对话"。SMGS 团队用 Amazon Bedrock AgentCore 搭了 NarrateAI,让业务人员直接用自然语言提...

用 KEDA 外部扩展器实现 Kubernetes GPU 自动伸缩

来源: cncf.io 61
跑 GPU 工作负载的开发者迟早会撞上同一堵墙:Kubernetes 默认的 HPA 只看 CPU 和内存,而你的瓶颈在 GPU。vLLM 推理服务排队不是因为 CPU 满了,而是显存吃紧、SM 占用率拉满;Triton 模型服务在 GPU 利用率 90% 时还在被 HPA 判定为"负载正常"。训练任务更离谱——一个 job 占满整张卡,HPA 对此毫...

ReactOS 踏入 ARM64:一个 Windows 兼容系统的跨架构野心

来源: oschina.net 72
近二十年里,ReactOS 一直围绕 x86 构建——这很自然,毕竟 Windows 本身就是 x86 生态的产物。但硬件格局正在变化:ARM64 服务器、ARM 笔记本、甚至 Windows 本身都有了 ARM 版本。ReactOS 近期宣布实验性支持 ARM64 架构,意味着这个开源 Windows 兼容项目不再只盯着传统 PC,而是试图在更广泛的...