来源: azure.microsoft.com
35
管理多个 Kubernetes 集群时,最让人头疼的不是集群本身,而是集群之间的网络。服务跨集群调用、流量路由、安全策略——每一层都得自己搭桥。Azure Kubernetes Fleet Manager 现在引入了基于 Cilium 的跨集群网络,把这件事从"自己造路"变成了"直接上高速"。 多集群架构在大型组织中已经很常见:开发、预发布、生产各一套...
来源: azure.microsoft.com
37
芯片设计(EDA)上云这件事,算力早就不是最大障碍——几千核的仿真任务往 AKS 里一扔就能跑起来。真正卡脖子的是存储:一个 SoC 验证流程动辄几十万并发 I/O,随机读密集、文件数以百万计,传统云盘要么吞吐不够要么延迟抖动,跑完一轮仿真比本地 NFS 慢两三倍,设计师自然不愿意迁。 Azure NetApp Files(ANF)最近拿出了独立基准测...
来源: infoq.com
50
外卖推荐和短视频推荐有一个本质区别:用户打开抖音可以刷半小时,但打开 Uber Eats 通常只想在三分钟内找到今晚吃什么。这意味着推荐系统必须在极短的交互窗口里做出精准判断,而判断的依据——用户刚刚浏览了哪些店铺、停留了多久、是否跳过了某类菜品——这些信号如果还停留在昨天的数据里,推荐就永远慢半拍。 Uber 最近对 Uber Eats Home F...
来源: infoq.com
68
Uber Eats 的首页推荐长期依赖手工特征和逐条打分——用户点了一个汉堡,系统 24 小时后才知道这件事,再逐个给候选餐厅算分数排序。这套流程在冷启动和实时意图捕捉上都有明显短板。最近 Uber 工程团队把整个 Home Feed 推荐系统翻了一遍:特征从手工拼接到 Transformer 序列建模,新鲜度从天级压缩到秒级,排序从逐条打分切换到列表...
来源: oschina.net
34
GPU 推理服务的运维痛点一直很明确——模型版本管理混乱、多卡调度靠人工、API 对接各家格式不一。HeteroFlow V2 在 5 月 22 日上线的推理服务模块,试图把从"模型发现"到"对外 API"这条链路全部自动化,核心抓手是 TaskGroup 生命周期管理和内置 OpenAI 兼容网关。官方给出的目标很直接:让 TOKEN 产量翻倍。 传...
来源: infoq.com
56
生产环境中跑大模型应用的人,最近几年都有一个共同感受——从 demo 到上线之间有一道巨大的沟。RAG 检索不准、agent 行为不可控、评估体系缺失、上线后延迟和成本飙升……这些问题不是靠换一个模型就能解决的。InfoQ 刚上线了一个为期五周的在线 AI Engineering 认证项目,面向已经在生产系统里做 AI 的资深从业者,覆盖 RAG、ag...
来源: realpython.com
51
数据管道跑着跑着,突然因为一列类型不对就崩了——用 Polars 的人多半踩过这个坑。与此同时,开源协作中你经常需要快速判断一个 GitHub 账号值不值得信任:他是活跃贡献者还是机器人?本文把这两个实用话题拆开讲,各给一套可直接跑的代码。 Polars 是强类型的。一个 DataFrame 的 Schema 在创建时就锁定了每列的类型。这带来性能优势...
来源: realpython.com
48
学 Tkinter 最常见的困境是:文档读完了,控件也认了,但拼不出一个完整程序。井字棋(Tic-Tac-Toe)恰好是一个大小合适的练手项目——九个格子、两方轮流、胜负判定清晰,能把 Tkinter 的布局、事件绑定、状态管理全部串起来,还能顺带把 MVC 模式落地成代码结构。 MVC 不是 Web 项目的专属。一个井字棋同样可以拆成三层: Mode...
来源: infoq.com
77
Discord 的基础设施团队规模不大,却要管着支撑数亿用户消息的 ScyllaDB 集群。以前做一次节点替换或集群扩容,几个人手动操作要耗好几天。他们干脆造了一个内部编排框架——Scylla Control Plane(SCP),把大规模 ScyllaDB 管理变成可编程的自动化流程。 Discord 从 Cassandra 迁移到 ScyllaDB...
来源: cncf.io
46
一个租户的请求从网关进入,经过鉴权、编排引擎、数据服务,最终落到下游第三方 API——中间跨越了十几条微服务调用。当这位租户反馈"响应变慢",你打开监控面板,看到的却是一堆散落在各服务日志里的碎片化 trace ID,根本拼不出一条完整链路。这就是大多数云原生 SaaS 平台在可观测性上的真实困境。 单租户系统里,一个 就能串联整条调用链。多租户平台引...