来源: infoq.com
34
生产环境里的 AI 应用,最让人头疼的不是模型本身,而是围绕模型调用的一堆"外围问题"——调用失败要不要重试?工具执行结果要不要做安全过滤?生成循环跑了 50 步还没停,谁来掐断?Google 最近为 Genkit 引入了 Middleware 架构,正是瞄准这些痛点:在模型调用、工具执行、生成循环这三条关键路径上,加了一层可编程的拦截层,让开发者用代...
来源: infoq.com
51
AI 编码代理正在从"能写代码"走向"能操作基础设施"——但直接把 AWS 凭证塞给代理,等于把整栋楼的钥匙交给一个实习生。AWS 的 Model Context Protocol(MCP)服务器现在正式 GA,它做的事情很明确:用标准接口把 AWS API、文档和运维流程暴露给代理,同时用 IAM 做细粒度权限管控,每一步操作可审计。 MCP 是 A...
来源: infoq.com
47
数据仓库和计算引擎长期割裂,做报表用 BigQuery,跑机器学习用 Spark,处理实时流用 Flink,数据往往要在不同系统间来回搬运、复制。在最近的 Apache Iceberg Summit 上,Google 宣布 BigQuery 支持无服务器 Iceberg REST Catalog 的预览版,让 BigQuery、Spark、Flink ...
来源: infoq.com
50
外卖推荐和短视频推荐有一个本质区别:用户打开抖音可以刷半小时,但打开 Uber Eats 通常只想在三分钟内找到今晚吃什么。这意味着推荐系统必须在极短的交互窗口里做出精准判断,而判断的依据——用户刚刚浏览了哪些店铺、停留了多久、是否跳过了某类菜品——这些信号如果还停留在昨天的数据里,推荐就永远慢半拍。 Uber 最近对 Uber Eats Home F...
来源: infoq.com
67
Uber Eats 的首页推荐长期依赖手工特征和逐条打分——用户点了一个汉堡,系统 24 小时后才知道这件事,再逐个给候选餐厅算分数排序。这套流程在冷启动和实时意图捕捉上都有明显短板。最近 Uber 工程团队把整个 Home Feed 推荐系统翻了一遍:特征从手工拼接到 Transformer 序列建模,新鲜度从天级压缩到秒级,排序从逐条打分切换到列表...
来源: infoq.com
56
生产环境中跑大模型应用的人,最近几年都有一个共同感受——从 demo 到上线之间有一道巨大的沟。RAG 检索不准、agent 行为不可控、评估体系缺失、上线后延迟和成本飙升……这些问题不是靠换一个模型就能解决的。InfoQ 刚上线了一个为期五周的在线 AI Engineering 认证项目,面向已经在生产系统里做 AI 的资深从业者,覆盖 RAG、ag...
来源: infoq.com
76
Discord 的基础设施团队规模不大,却要管着支撑数亿用户消息的 ScyllaDB 集群。以前做一次节点替换或集群扩容,几个人手动操作要耗好几天。他们干脆造了一个内部编排框架——Scylla Control Plane(SCP),把大规模 ScyllaDB 管理变成可编程的自动化流程。 Discord 从 Cassandra 迁移到 ScyllaDB...
来源: infoq.com
45
大模型每次对话都从零开始——你反复粘贴同一份业务规则、同一段系统提示词,模型照忘不误。xAI 最新发布的 Grok Skills 直接对准了这个痛点:一次定义,全局生效。配合 Grok 4.3 Responses API 对 Tool Calling 的升级,开发者终于可以把"模型懂什么"和"模型怎么调用外部工具"这两件事分别管起来。 传统做法是把所有...
来源: infoq.com
35
Cloudflare 刚把 Browser Run 从第三方托管迁移到自家 Containers 平台上跑,并发能力翻了 4 倍、响应时间砍掉一半。这件事本身是个性能升级,但更值得注意的是——它把 Cloudflare 的 Agent 基础设施拼到了第六层,从计算到交易,一条链路全部收在边缘网络里。 Browser Run 是 Cloudflare 给...
来源: infoq.com
31
Cloudflare 的 Browser Rendering 一直是开发者做网页抓取、自动化测试时的热门选择,但底层跑的是第三方托管方案,并发和延迟都有天花板。最近 Cloudflare 把整个 Browser Run 搬到了自家 Containers 平台上,并发能力翻了 4 倍、响应速度快了 50%。更重要的是,这一步把 Cloudflare 的 ...