2026-09-11
来源: realpython.com
26
Python 的 模块不只是“从脚本里执行一条命令”。当你需要包装编译器、媒体工具、运维命令或已有 CLI 时,真正影响可靠性的,是参数传递、退出码、超时,以及标准输出和标准错误的处理方式。 下面从一个可运行的命令包装器出发,梳理这些容易被忽略的细节。 执行外部程序时,推荐把程序名和参数写成列表: 这种写法默认不经过 Shell。Python 会直接启...
2026-09-11
来源: postgr.es
24
PostgreSQL 的逻辑复制通常安静得让人忘记它的存在,直到发布端的 目录突然出现成千上万个文件,磁盘告警随之响起。更棘手的是,这些文件可能在大事务提交后立即消失,只留下一个恢复正常的目录和几项累计统计。 问题往往不是复制槽失效,也不一定是订阅端落后,而是逻辑解码正在为尚未提交的大事务暂存数据。订阅越多,同一份 WAL 就会被重复解码和暂存越多次。...
2026-09-11
来源: cncf.io
32
当 AI 训练从单机 GPU 扩展到多个节点时,平台团队面对的问题就不再只是“有没有足够的显卡”。节点之间的网络、数据读取、任务调度、故障恢复、可观测性和资源隔离,都会直接影响训练是否能稳定完成。 因此,给集群装上 GPU 驱动只是起点。真正的 AI-ready 平台,需要把一次分布式训练当成一个完整的云原生工作负载来设计。 单节点训练失败时,排查范围...
2026-09-11
来源: infoq.com
29
LinkedIn 公布了其 AI 求职搜索训练基础设施的一部分:通过多教师知识蒸馏,将多个大型教师模型中的排序能力压缩到一个仅有 0.6B 参数的紧凑模型中。这个思路的关键不只是“把大模型变小”,而是让多个教师模型共同提供训练信号,再用一个适合线上部署的学生模型完成最终排序。 对于搜索、推荐和广告系统来说,这种方案很有吸引力:大模型可以承担复杂的语义理...
2026-09-11
来源: openai.com
36
当一个存储组件只服务少量应用时,Python API、单区域部署和简单的对象读写通常已经足够。但随着 ChatGPT 用户规模扩大到 10 亿、请求峰值达到每秒 2200 万次,存储系统面对的就不再只是“能不能保存数据”,而是全球流量、容量增长、故障隔离和开发效率的综合考验。 OpenAI 分享的 Habitat 演进路径,核心变化是:它从一个 Pyt...
2026-09-11
来源: oschina.net
22
多人同时讲话时,传统语音识别系统面对的并不只是背景噪声,而是多个结构完整、频段重叠的人声。小米开源的 CocktailASR-1 采用了另一条路线:先提供目标说话人的身份线索,再让模型只转写这个人的语音。这个变化把任务从普通 ASR 转成了目标说话人语音识别,也让系统边界、数据组织和评测方式随之改变。 降噪通常假设需要保留的是语音,而需要消除的是风声、...
2026-09-11
来源: cloud.google.com
29
在 Goldman Sachs Communicopia & Technology Conference 上,Google Cloud CEO Thomas Kurian 更新了公司的云业务与 AI 战略。演讲释放出的重点并不只是某一个模型或产品,而是 Google Cloud 正试图把芯片、服务器、平台、模型和企业应用连接成一条完整的 AI ...
2026-09-11
来源: my.oschina.net
24
OmniStudio 的核心定位很直接:提供一个本地优先、免费且开源的桌面终端,让用户在自己的电脑上运行大模型。它关注的不只是“能不能聊天”,而是把模型、数据和执行环境尽量留在本机,减少对云端 API、网络连接和按量计费服务的依赖。 不过,“本地运行”不等于“零成本、零风险”。模型仍会消耗内存、显存、电力和磁盘空间;开源应用的许可证,也不代表所有可下载...
2026-09-11
来源: postgr.es
28
现在的编码代理已经很会写 PostgreSQL:GIN、GiST、部分索引、表达式索引、,以及以租户 ID 开头的复合索引,通常都能写对。真正的问题不再是索引无效,而是每个索引单独看都合理,叠到同一张高频更新表上却形成了昂贵的写放大。 一组针对 30 份模型生成 schema 的实验加载并检查了 838 个索引。只有 10 个找不到明确需求,其余大多具...
2026-09-11
来源: infoq.com
35
AI Agent 的故障往往不是一次明确的异常,而是一段逐渐偏离预期的执行过程:模型反复调用同一个工具、在多个步骤之间循环,或者持续消耗 Token 和外部 API 配额。单看最终错误信息,很难还原问题是从哪一步开始的。 会话追踪(session trace)和成本控制正在成为两项互补的可观测性手段:前者保留足够的执行上下文,帮助事故后复盘;后者在循环...