2026-06-30
来源: cncf.io
30
Dragonfly v2.5.0 发布了。这个版本最值得关注的变化,是 Dragonfly Client 开始支持直接下载 Hugging Face 和 ModelScope 上的模型仓库。对正在做推理服务、模型微调、离线部署的团队来说,这不是一个“下载工具多了一个参数”的小事,而是把模型仓库这种越来越重的制品,纳入了更可控的分发链路。 过去我们谈 D...
2026-06-30
来源: oschina.net
21
Piotr Migdał 在一台 128GB 内存的 MacBook Max M5 上,用 Qwen 3.6 27B 跑了一整天本地推理。他的结论很直接:这是他第一次觉得本地模型不再只是“能凑合用”,而是真的可以当成通用智能助手来用。 这个判断很有分量。过去本地大模型常见的问题不是“跑不起来”,而是体验总差一口气:速度慢、上下文短、推理糊、工具调用不稳...
2026-06-30
来源: oschina.net
34
谷歌限制 Meta 访问顶级 Gemini 模型,表面看是两家巨头之间的资源分配问题,实际暴露的是一个更普遍的工程现实:大规模 AI 推理已经开始受制于云计算能力短缺。对依赖模型做诈骗检测、有害内容过滤、自动化安全工作流的团队来说,模型能力很重要,但“持续可用”同样是核心能力。 从摘要信息看,Gemini 曾被 Meta 用在自动化安全流程中,包括诈骗...
2026-06-30
来源: oschina.net
23
DeepReinforce 团队开源了 Ornith-1,一套面向编码 Agent 任务的推理模型,采用 MIT 许可,并提供 9B、31B、35B MoE、397B MoE 四个规格。根据摘要信息,它不是从零训练出来的模型,而是在 Gemma 4 和 Qwen 3.5 这类基座上做 RL post-training,目标是让模型在编码任务里学会更像工...
2026-06-30
来源: infoq.com
25
AWS 推出了 Lambda MicroVMs,这不是又一个普通的函数运行时,而是一个面向“每个用户会话、每个 AI Agent 都需要独立沙箱”的 serverless 计算原语。它把执行单元放进独立的 Firecracker 虚拟机里,强调硬件级隔离、基于快照的快速启动,以及最长 8 小时的状态保留。 这件事之所以值得关注,是因为 AI Agent...
2026-06-30
来源: openai.com
41
OpenAI Signals 的新数据指出,ChatGPT 的采用正在全球范围内继续增长:用户使用频率更高,探索的能力更多,增长也跨越了不同地区和语言。这件事的意义不只在于“用户数变多”,而在于 ChatGPT 正从一个单点工具,逐渐变成很多人处理信息、写作、学习、编程和决策前准备的日常入口。 看 AI 产品采用率时,最容易盯着注册用户或访问量。但这类...
2026-06-30
来源: infoq.com
26
事件驱动架构很容易被描述成“天然可扩展”:生产者写事件,消费者水平扩容,Kafka 扛住吞吐。但在 Java 实时系统里,真正棘手的问题往往不是消息能不能进队列,而是状态放哪里、分区怎么切、重复事件如何处理、JVM 抖动会不会拖垮实时链路。 这篇文章基于一个 Java/Kafka 联络中心平台的经验展开:系统需要支撑约 80k BHCC(busy ho...
2026-06-30
来源: oschina.net
21
Cursor 把 iOS 移动应用推向公开测试后,一个很具体的开发场景变得更顺手:你合上笔记本,Agent 继续在云端跑;CI 结束后,手机收到通知;你在路上看 diff、审 PR,甚至完成 merge。它不是把完整 IDE 塞进小屏幕,而是把“等待 Agent、检查结果、处理 PR”这段碎片化工作迁到手机上。 这次变化的核心不是 iOS App 本身...
2026-06-30
来源: my.oschina.net
29
Higress 最近发布 v2.2.3,同时项目迈入 CNCF Sandbox。这个节点值得关注:它不只是一次版本号更新,主仓库有 48 项更新,Higress Console 有 8 项更新,方向也很明确——继续扩展 AI Gateway 能力,并增强对 Kubernetes Gateway API 的兼容。 对正在把大模型能力接入生产流量的团队来说...
2026-06-30
来源: oschina.net
28
去年有公司把员工的 Token 消耗量写进绩效考核,结果并没有自动带来生产力,反而催生了荒诞操作:有人让两个 Agent 互相聊天一整天,只为了把用量刷上去。这个现象被称为 tokenmaxxing:用行政指标逼团队“用 AI”,哪怕消耗本身没有任何业务意义。 更有意思的是,复盘者的判断不是“AI 没用”,而是“第一阶段的 tokenmaxxing 已...