标签

全栈

NVIDIA PAIR:把局域网里的多台电脑变成 AI 推理资源池

来源: infoq.com 42
本地 AI 的瓶颈不总是模型太大,也可能是请求太多。单个智能体运行顺畅,并不代表研究、编码、检索等多个智能体同时工作时,一张 GPU 还能稳定响应。处于 Beta 阶段的 NVIDIA Personal AI Router(PAIR)试图解决这个问题:汇集局域网内多台计算机的推理能力,并自动把 AI 请求分配给它们。 PAIR 最适合多个相互独立的模型...

Netflix 如何让 Conductor 承载 4.2 亿次月度工作流执行

来源: infoq.com 58
当工作流从几百个任务增长到数万个任务时,瓶颈通常不在某一台机器的 CPU,而在元数据读写、调度评估和并发控制之间的耦合。Netflix 对 Conductor 4.0 的重构,正是围绕这个问题展开:支持的工作流规模从约 2,500 个任务提升到 30,000 个任务,同时将工作流评估的 p99 延迟降低了约 40%,以支撑每月约 4.2 亿次工作流执行...

Covonaut v1.1.2:让 Go Agent 的终端对话更像真正的协作工具

来源: oschina.net 28
Covonaut v1.1.2 的重点,不只是继续补齐 Go Agent 框架能力,还把注意力放到了终端交互本身:对话过程中可以插入旁问,并提供三档输出方式。对于需要在命令行里调试、运行和观察 Agent 的团队来说,这意味着终端不再只是“提交任务并等待结果”的窗口,而可以成为一个可控的工作界面。 Covonaut 以纯 Go 实现,并采用 MIT 协...

tsgolint v7 稳定版:让 Oxlint 获得 Go 驱动的 TypeScript 类型感知检查

来源: infoq.com 47
TypeScript lint 的性能瓶颈,往往不在语法扫描,而在类型信息构建。只看 AST 的规则可以很快,但一旦规则需要判断 Promise 是否被处理、类型断言是否安全,或两个表达式在语义上是否兼容,就必须借助 TypeScript 编译器的语义分析。 tsgolint v7 已进入稳定阶段,它通过 编译器提供类型语义,并把这部分能力接入 Oxl...

LinkedIn 如何用多教师知识蒸馏把 AI 求职排序训练提速 8 倍

来源: infoq.com 41
LinkedIn 公布了其 AI 求职搜索训练基础设施的一部分:通过多教师知识蒸馏,将多个大型教师模型中的排序能力压缩到一个仅有 0.6B 参数的紧凑模型中。这个思路的关键不只是“把大模型变小”,而是让多个教师模型共同提供训练信号,再用一个适合线上部署的学生模型完成最终排序。 对于搜索、推荐和广告系统来说,这种方案很有吸引力:大模型可以承担复杂的语义理...

CocktailASR-1:把“听清所有人”改成“只听目标说话人”

来源: oschina.net 33
多人同时讲话时,传统语音识别系统面对的并不只是背景噪声,而是多个结构完整、频段重叠的人声。小米开源的 CocktailASR-1 采用了另一条路线:先提供目标说话人的身份线索,再让模型只转写这个人的语音。这个变化把任务从普通 ASR 转成了目标说话人语音识别,也让系统边界、数据组织和评测方式随之改变。 降噪通常假设需要保留的是语音,而需要消除的是风声、...

OmniStudio:把大模型留在本机的免费开源桌面终端

来源: my.oschina.net 37
OmniStudio 的核心定位很直接:提供一个本地优先、免费且开源的桌面终端,让用户在自己的电脑上运行大模型。它关注的不只是“能不能聊天”,而是把模型、数据和执行环境尽量留在本机,减少对云端 API、网络连接和按量计费服务的依赖。 不过,“本地运行”不等于“零成本、零风险”。模型仍会消耗内存、显存、电力和磁盘空间;开源应用的许可证,也不代表所有可下载...

AI 写的 PostgreSQL 索引都能用,为什么还是会拖慢写入

来源: postgr.es 38
现在的编码代理已经很会写 PostgreSQL:GIN、GiST、部分索引、表达式索引、,以及以租户 ID 开头的复合索引,通常都能写对。真正的问题不再是索引无效,而是每个索引单独看都合理,叠到同一张高频更新表上却形成了昂贵的写放大。 一组针对 30 份模型生成 schema 的实验加载并检查了 838 个索引。只有 10 个找不到明确需求,其余大多具...

用会话追踪与成本护栏定位 AI Agent 失控问题

来源: infoq.com 48
AI Agent 的故障往往不是一次明确的异常,而是一段逐渐偏离预期的执行过程:模型反复调用同一个工具、在多个步骤之间循环,或者持续消耗 Token 和外部 API 配额。单看最终错误信息,很难还原问题是从哪一步开始的。 会话追踪(session trace)和成本控制正在成为两项互补的可观测性手段:前者保留足够的执行上下文,帮助事故后复盘;后者在循环...

FocusAny v2.2.0:从模型能力识别到 SDK 诊断与插件资源按需加载

来源: oschina.net 39
FocusAny v2.2.0 的重点不只是增加几个命令,而是把使用过程中的三类摩擦点分别降低了:选模型时更容易判断能力,排查 SDK 问题时有了更明确的入口,插件开发者也不必再把大型资源文件全部塞进安装包。 这三个变化分别影响模型使用者、开发调试人员和插件作者。下面按实际工作流拆开看。 当模型数量达到几十个时,模型名称往往不能直接说明它支持什么。用户...