AI HOT
·
2026-05-24 00:00
01:30 Apple Machine Learning Research(RSS) 精选 66 现有视觉语言模型框架主要在离线场景下评估性能,但实时视觉助手所依赖的流式模型还需考量额外指标,如反映响应时效性的“主动性”和捕捉随时间推移响应稳定性的“一致性”。为此,研究团队提出了VSAS-Bench,这是一个新的评估基准,专门针对流式视觉语言模型在实时交互任务中的表现,填补了当前评估方法在动态、持续生成场景下的空白。 多模态 论文/研究 评测/基准 推荐理由: 苹果搞了个实时视觉助手的评估基准,把离线评测拉到了流式场景,多模态 agent 和实时 VLM 方向的研究者值得跟进一下评估方法。
多模态
论文/研究
评测/基准
AI HOT
·
2026-05-23 17:23
01:15 Perplexity @ perplexity_ai 精选 82 安全/对齐 开源/仓库 关联讨论 1 条 MarkTechPost(RSS) 推荐理由: 这不是另一个华而不实的 AI 玩具,而是实打实的开发环境安全检查工具,开源且只读,接入 Computer 后还能动态响应新威胁,做 AI 工具链的团队应该现在就 fork。
安全/对齐
开源/仓库
AI HOT
·
2026-05-23 15:12
01:15 Google AI @ GoogleAI 精选 70 谷歌在I/O开发者大会宣布,系统性构建面向AI代理(Agent)的开发与部署工具链。核心更新包括:独立桌面应用Antigravity 2.0及其命令行工具、SDK面世;Google AI Studio新增Kotlin支持,可一键开发安卓应用并发布,同时推出移动端App。此外,Gemini API推出托管代理服务,实现一键部署;WebMCP作为开放标准在Chrome 149中推出,允许网页向代理暴露工具;Chrome DevTools也开放给AI代理以自动化调试。企业级客户可直接连接Google Cloud项目,而DeepMind的科学技能包则加速特定领域研究。此举标志着谷歌正全面打造从开发、接口到部署的完整AI代理生态系统。 智能体 Google 产品更新 编码 关联讨论 1 条 X:Gemini (@GeminiApp) 推荐理由: Google把今年I/O的Agent相关更新打包放出,Antigravity 2.0从IDE变桌面应用、AI Studio能直接做Android App,对Google生态开发者是必读速览。
智能体
Google
产品更新
编码
AI HOT
·
2026-05-23 13:03
01:05 SemiAnalysis @ SemiAnalysis_ 精选 82 智能体 推理 现象/趋势 编码 推荐理由: SemiAnalysis 用 43 万次真实编码请求数据揭开了 Agent 推理经济学的真面目,中位输入 9.6 万 token 这个数字足够反直觉,所有做推理服务和模型定价的人都得重新算了。
智能体
推理
现象/趋势
编码
AI HOT
·
2026-05-23 10:15
01:04 Cursor Blog 精选 66 Gartner 在 2026 年魔力象限报告中,将 Cursor 评为企业级 AI 编码代理领域的领导者,并在愿景完整性上领先。超过 70% 的财富 500 强企业使用 Cursor 部署和管理编码代理。未来一年,Cursor 将聚焦于三个方向:提升前沿模型智能;自动化软件开发全生命周期的任务(如代码审查、漏洞修复);以及通过新的管理工具和控制面板,增强企业级的控制力、协作性与部署灵活性,以拓展至更多行业和地区。 编码 行业动态 推荐理由: Gartner 的象限向来是企业采购的风向标,Cursor 在 vision 上做到最远,对瞄准 AI coding agent 的团队是个重要信号,但别被 PR 冲昏头,完整报告更值得细读。
编码
行业动态
AI HOT
·
2026-05-23 09:11
00:30 GitHub Blog 精选 62 Gartner 最新发布的魔力象限报告中,GitHub 连续第三年被列为“领导者”象限,该评估专注于企业级 AI 编程代理领域。GitHub 表示,其致力于构建一个开放、安全且由 AI 驱动的平台,以赋能每一位开发者并定义软件开发的未来。此次评选进一步巩固了 GitHub 在 AI 辅助开发工具市场的领先地位。 智能体 GitHub 编码 行业动态 推荐理由: Gartner 连续三年把 GitHub 放企业 AI 编码代理领导者象限,对选型团队是个硬参考,没有新功能但行业地位再次夯实。
智能体
GitHub
编码
行业动态
AI HOT
·
2026-05-23 08:08
00:19 Suno @ suno 精选 64 Good Morning America : An AI-generated song about Puerto Rico has gone viral across TikTok, and now, the man behind the tune is speaking out. h... 现象/趋势 推荐理由: 一首完全由AI生成的歌曲登上GMA,说明AI音乐已经从「有点意思」走到了「真有人听」。虽然Suno只是借势宣传,但这波破圈比新模型发布更能说服内容创作者用起来。
现象/趋势
AI HOT
·
2026-05-23 08:08
00:20 DeepSeek @ deepseek_ai 精选 64 DeepSeek : The DeepSeek-V4-Pro discount has been extended until May 31, 2026, 15:59 UTC! DeepSeek 产品更新 部署/工程 关联讨论 1 条 X:Testing Catalog (@testingcatalog) 推荐理由: DeepSeek把临时折扣做成永久,对依赖V4-Pro API的开发者是实打实的成本利好,但别被「永久」冲昏,模型迭代快,价格战随时可能再来。
DeepSeek
产品更新
部署/工程
AI HOT
·
2026-05-23 08:08
00:28 Tomer Tunguz 博客(VC 分析) 精选 70 Salesforce已采用无头架构,允许销售人员通过AI直接更新数据,许多公司正通过MCPs跟进。同时,AI专家们正推动超越纯文本、更丰富的界面(如HTML),支持图表与交互。AI能根据场景动态生成定制化界面。无头系统并非移除前端,而是支持多种可塑化界面(如音频、网页)。未来软件的核心价值在于动态管理这些界面、确保其准确性,并将各类AI产物整合为可演化的上下文数据库与制品库。用户界面并未消失,而是变得“可塑”,能按需变形。 多模态 现象/趋势 推荐理由: 动态 UI 不是消灭界面,而是让界面变得可塑性。Airbnb CEO 和 Anthropic 工程师都在押注 HTML 输出,这篇文章把信号串了起来,做产品的人值得一看。
多模态
现象/趋势
AI HOT
·
2026-05-23 07:03
23:52 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 62 Gartner发布2026年企业AI编码代理魔力象限报告,OpenAI被列为领导者。其产品Codex因在技术创新和企业级部署方面的突出表现获得认可,反映了OpenAI在AI辅助编程工具领域的领先地位。 智能体 OpenAI 编码 行业动态 推荐理由: Gartner第一次给AI编程Agent出报告就把OpenAI拉到了领导者象限,企业选型可以少绕点弯路,虽然这类报告看的是市场执行力,不完全等于技术实力。 23:16 Hugging Face:Blog(RSS) 精选 58 文本退化:多数基准测试未追踪的生产故障模式 Dharma-AI在Hugging Face发布博文指出,当前大语言模型在生产环境中普遍存在“文本退化”现象,表现为输出内容重复、不连贯或逻辑混乱。这类故障模式直接影响用户体验和模型可靠性,但现有主流基准测试大多未将其纳入评估范围。文章呼吁业界关注这一实际部署中的关键问题,并建议在模型评估体系中增加对文本退化现象的系统性追踪与量化指标。 现象/趋势 部署/工程 推荐理由: 生产中文本退化是基准盲区,这篇文章点出了实际部署的痛,做 LLM 应用的值得细读。 23:14 Google DeepMind @ GoogleDeepMind 精选 67 Project Genie 🤝 @GoogleMaps Street View 你现在可以将真实的美国地点转化为全新的交互式世界。🌍 DeepMind Google 产品更新 图像生成 推荐理由: Project Genie这次不是纸上谈兵了,直接吃进真实街景吐出来可玩世界,虽然暂时只限美国,但这是生成式游戏从能做走向普通人可玩的关键一步。 22:56 Rohan Paul @ rohanpaul_ai 精选 75 首个基于华为昇腾910B NPU全栈训练的1.58比特开源大模型BitCPM-CANN发布 ModelBest、清华大学与OpenBMB社区联合发布了BitCPM-CANN,这是全球首个完全基于华为昇腾910B NPU训练的开源1.58比特三元大模型。其核心创新在于采用仅含三种权重状态的极低比特量化技术,使模型内存占用相比BF16降低约6倍,可高效部署于手机、电脑、车载设备等边缘端。更关键的是,整个训练全栈(从量化算子到框架)均在昇腾上原生构建与验证,而非简单移植。该模型家族(0.5B-8B)在多项基准测试上保持了全精度模型95-97%的性能,为资源受限环境下部署和复现大模型提供了可落地的解决方案。 OpenBMB : 🚀 BitCPM-CANN by ModelBest × @Tsinghua_Uni × OpenBMB is here - and it's not about stacking paramet
智能体
OpenAI
编码
行业动态
现象/趋势
部署/工程
DeepMind
Google
产品更新
图像生成
开源/仓库
模型发布
端侧
开源生态
教程/实践
数据/训练
多模态
推理
具身智能
政策/监管
Microsoft
安全/对齐
DeepSeek
arXiv
论文/研究
AI HOT
·
2026-05-23 06:00
20:56 Hacker News 热门(buzzing.cc 中文翻译) 精选 73 博客作者安娜于2026年5月22日发布了一篇面向大型语言模型(LLM)的文章。文章标题为“如果你是一个LLM,请阅读这篇文章”,并在Hacker News平台获得117个积分。文章链接指向 annas-archive.gl 域名下的博客页面。 开源生态 教程/实践 数据/训练 推荐理由: llms.txt 1.1 加上了分块和多语言标记,如果网站还在用v1,可以照这个更新,对LLM爬虫更友好,做SEO和AI抓取的必看。
开源生态
教程/实践
数据/训练
AI HOT
·
2026-05-23 06:00
22:56 Rohan Paul @ rohanpaul_ai 精选 75 ModelBest、清华大学与OpenBMB社区联合发布了BitCPM-CANN,这是全球首个完全基于华为昇腾910B NPU训练的开源1.58比特三元大模型。其核心创新在于采用仅含三种权重状态的极低比特量化技术,使模型内存占用相比BF16降低约6倍,可高效部署于手机、电脑、车载设备等边缘端。更关键的是,整个训练全栈(从量化算子到框架)均在昇腾上原生构建与验证,而非简单移植。该模型家族(0.5B-8B)在多项基准测试上保持了全精度模型95-97%的性能,为资源受限环境下部署和复现大模型提供了可落地的解决方案。 OpenBMB : 🚀 BitCPM-CANN by ModelBest × @Tsinghua_Uni × OpenBMB is here - and it's not about stacking parameters. Memory costs are... 开源/仓库 模型发布 端侧 推荐理由: 首个开源的1.58-bit三元LLM,直接在昇腾芯片上原生训练,内存压缩到BF16的六分之一,8B模型就能跑在手机上,做端侧部署的可以立刻上手试试了。
开源/仓库
模型发布
端侧
AI HOT
·
2026-05-23 06:00
23:14 Google DeepMind @ GoogleDeepMind 精选 67 DeepMind Google 产品更新 图像生成 推荐理由: Project Genie这次不是纸上谈兵了,直接吃进真实街景吐出来可玩世界,虽然暂时只限美国,但这是生成式游戏从能做走向普通人可玩的关键一步。
DeepMind
Google
产品更新
图像生成
AI HOT
·
2026-05-23 06:00
23:16 Hugging Face:Blog(RSS) 精选 58 Dharma-AI在Hugging Face发布博文指出,当前大语言模型在生产环境中普遍存在“文本退化”现象,表现为输出内容重复、不连贯或逻辑混乱。这类故障模式直接影响用户体验和模型可靠性,但现有主流基准测试大多未将其纳入评估范围。文章呼吁业界关注这一实际部署中的关键问题,并建议在模型评估体系中增加对文本退化现象的系统性追踪与量化指标。 现象/趋势 部署/工程 推荐理由: 生产中文本退化是基准盲区,这篇文章点出了实际部署的痛,做 LLM 应用的值得细读。
现象/趋势
部署/工程
AI HOT
·
2026-05-23 04:24
20:16 AYi @ AYi_AInotes 精选 76 Karpathy发布的CLAUDE.md文件以其简洁高效的AI编程指导原则引爆GitHub,获得超22万星标并登顶趋势榜。该文件仅含65行、4条核心规则,却能将AI编程的准确率从65%显著提升至94%。其核心在于强制开发者“慢下来”,将深度思考、追求简洁、精准修改和目标驱动等原则变为硬性编码准则,旨在对抗开发者习惯性“先写再说”的本能。目前大多数开发者尚未深入研读这一备受关注的效率指南。 self.dll : karpathy's CLAUDE.md hit #1 on github trending. 220,000 stars. most devs still haven't read it. it's 65 lines. it took A... 开源生态 教程/实践 编码 推荐理由: Karpathy 这 65 行不是新模型,是给 AI 编程装了道刹车,先想清楚再动手这条反直觉规则把准确率从 65 拉到 94,所有用 Cursor 的都该立刻抄一份。
开源生态
教程/实践
编码
AI HOT
·
2026-05-23 03:19
18:09 IT之家(RSS) 精选 70 网易有道宣布将其“子曰”大模型4.0的多模态模型与语音合成模型面向全球全量开源。其中,多模态模型(27B参数)专注于教育场景,在处理高难度视觉数理问题上达到行业顶尖水平,纯文本中文数理难题准确率为81.4%。该模型通过思维链优化,将输出长度压缩43.2%,有效降低了推理成本。同时开源的语音合成模型支持跨语种音色与情感迁移克隆,3秒内即可完成零样本复制,准确度超97%,并支持包括中、英、日、韩在内的14种语言。 多模态 开源生态 推理 模型发布 推荐理由: 有道把垂直教育的多模态模型全量开源,27B参数在视觉数理上做到SOTA,还把思维链压缩了43%,推理成本实打实下降,做教育应用的可以拿来做二次开发;TTS的跨语种情感克隆也实用,3秒克隆14种语言。
多模态
开源生态
推理
模型发布
AI HOT
·
2026-05-23 03:19
19:20 PixVerse @ PixVerse_ 精选 63 产品更新 图像生成 端侧 推荐理由: PixVerse 这个视频生成玩家在手机端加了图片生成,对存量用户算顺手扩展,但本质上就是跟风 Midjourney 和 DALL·E,可玩性有,但谈不上多独特。
产品更新
图像生成
端侧
AI HOT
·
2026-05-23 02:12
18:09 IT之家(RSS) 精选 74 国家发改委在5月22日新闻发布会上表示,人形机器人在半程马拉松比赛中表现显著提升,速度更快、更灵活、更自主,参赛队伍从20余支增至百余支,完赛队伍从6支增至40余支,反映具身智能创新活力增强和产业规模扩大。下一步,发改委将加快具身智能训练基础设施建设,推动机器人融入工厂、商场、家庭等场景,并建设应用中试基地以加速技术落地。 具身智能 政策/监管 行业动态 推荐理由: 国家发改委首次明确加快具身智能训练基建,机器人从「上赛场」到「进工厂、进商场、进家庭」,这是给具身智能行业打了一针强心剂。
具身智能
政策/监管
行业动态
AI HOT
·
2026-05-23 01:05
12:13 宝玉 @ dotey 精选 76 OpenAI宣布Codex的/goal模式已结束实验,成为稳定功能。用户可在Codex应用、IDE扩展或CLI中使用,通过设定具体里程碑,让AI持续工作直至完成,任务可运行数小时甚至数天。过程中支持随时检查、调整方向及暂停。使用前需升级应用并启用该功能(可通过命令行指令或手动修改配置文件实现)。开启后,可在输入框管理任务,并利用侧边对话查看进度而不中断主任务。该功能旨在高效处理各类复杂任务。 OpenAI Developers : 🥅 /goal has graduated from an experiment-for tasks big and small, Codex gets your work done. Use goal mode in the Codex... 智能体 OpenAI 教程/实践 编码 推荐理由: Codex的goal模式从实验毕业,意味着你可以真的放手让AI去跑长时间任务,做开发的不用再守在电脑前,这是agent落地的真信号。
智能体
OpenAI
教程/实践
编码
AI HOT
·
2026-05-23 01:05
12:26 Google AI Developers @ googleaidevs 精选 70 Varun Mohan : Yesterday, we 3x'd limits on Antigravity and are seeing you build so much more. One thing we heard was people are worrie... Google 产品更新 推荐理由: 如果你在用 Antigravity 的付费计划,这相当于每周可用 Gemini 配额翻了三倍,并且已重置,是个实在的利好,但对其他人来说只是脚注级更新。
Google
产品更新