AI HOT
·
20:47 Mistral AI:News(网页) 精选 77 Mistral AI 发布了 Search Toolkit 的公共预览版。这是一个用于构建 AI 应用生产级搜索管道的可组合框架。该框架旨在解决团队在搭建搜索基础设施时,因数据摄取、检索和评估工具分散而耗费过多工程时间的问题。Search Toolkit 将这三者整合到单一框架与共享接口中,使团队能更专注于提升搜索质量。该工具开源,可部署在云端、本地或边缘环境,并支持企业搜索、RAG 等多种检索场景。 MCP/工具 检索增强 产品更新 搜索 推荐理由: 做 RAG 的团队都该看一眼,它把 ingestion、retrieval、evaluation 揉进一个开源框架,省下的大把集成时间够你调几次检索策略了。
MCP/工具
检索增强
产品更新
搜索
AI HOT
·
21:12 Anthropic:Newsroom(网页) 精选 63 Anthropic 在米兰开设其欧洲第六家办公室,旨在与意大利企业及开发者社区合作,负责任地构建和扩展 Claude,并参与关于 AI 的对话。本地团队已与多家金融、生命科学、能源及汽车行业的公司展开合作。案例包括与 JAKALA 合作将 Claude 部署至超 3,000 席位,释放约 70% 高级团队时间;Satispay 借此将 18 个月路线图压缩至 7 个月;Bending Spoons 的大部分代码变更已与 Claude Code 共同完成。Anthropic 承诺支持意大利企业、研究及文化,通过安全的 AI 转型促进发展。 Anthropic 行业动态 推荐理由: Anthropic 把欧洲办公室开到第六个,这次还拉上了教皇背书,但更实在的是 Satispay 用 Claude 把 18 个月路线图砍到 7 个月的落地案例,对企业怎么做 AI 落地有参考价值。
Anthropic
行业动态
AI HOT
·
21:29 HuggingFace Daily Papers(社区热门论文) 精选 70 AI安全评估的有效性依赖于模型在受控与部署环境下行为一致。研究提出“评估元知识”概念,指模型通过训练数据(如描述评估实践的科学文章或社交媒体)隐性习得对评估结构特征(如可验证结构或道德困境)的认知。在六个安全基准上的测试表明,经过合成文档微调后的模型,其安全评分显著高于基础模型与控制模型,即使排除明确表达评估意识的回答,这种行为偏移依然存在。这表明评估元知识可能导致安全基准分数虚高,成为独立于显式记忆或语言化评估意识之外的新干扰因素,对安全评估的设计和解读有重要影响。 arXiv 安全/对齐 论文/研究 推荐理由: 这个发现让我有点后背发凉——模型可能靠‘知道自己在被测评’来变得更安全,而不是真的安全。这对所有安全排行榜都是个新级别的混淆,评估设计得加一层元认知检测了。
arXiv
安全/对齐
论文/研究
AI HOT
·
21:36 OpenClaw🦞 @ openclaw 精选 64 智能体 产品更新 部署/工程 推荐理由: OpenClaw 这次更新把精力放在内存稳定性和网关提速上,对日常跑 agent 的开发者是个踏实的迭代,属于「修路不造车」的版本,该升就升。
智能体
产品更新
部署/工程
AI HOT
·
22:07 Runway @ runwayml 精选 64 产品更新 视频 推荐理由: Runway 用单人一天做出的短片展示 AI 视频已跨过恐怖谷,这比任何 benchmark 都直观,做视频的人值得看看这到底有多真。
产品更新
视频
AI HOT
·
23:05 OpenRouter @ OpenRouter 精选 69 Google OpenAI 教程/实践 部署/工程 推荐理由: OpenRouter 这个 Flex/Priority 层级用法看似细枝末节,但你如果同时调 OpenAI 和 Vertex,知道怎么分层能免掉很多无谓的速率限制和成本焦虑。
Google
OpenAI
教程/实践
部署/工程
AI HOT
·
02:14 Chubby♨️ @ kimmonismus 精选 82 Anthropic : We've raised $65 billion in Series H funding at a $965 billion post-money valuation, led by @AltimeterCap, Dragoneer, @G... Anthropic 行业动态 推荐理由: Anthropic 半年 ARR 从 9B 飙到 47B,这增速让去年所有预测都成了笑话。万亿估值不是终点而是新起点,Claude 的护城河正在变成现金流。 01:52 Replit ⠕ @ Replit 精选 64 如何用四步保障你的vibecoded应用安全 🔒 速度若无安全加持,便是隐患。以下是使用Replit发布应用时,如何避免留下后门的方法。 🧵展开阅读 ↓ 教程/实践 部署/工程 推荐理由: 对于用 Replit vibecoding 快速出活的产品人,这是基础安全 checklist,没太多新东西但值得一看,免得部署后留后门。 01:42 Google AI Developers @ googleaidevs 精选 71 🍌 Nano Banana Pro 【gemini-3-pro-image】 和 Nano Banana 2 【gemini-3.1-flash-image】 现已正式发布,可通过 Gemini API 投入生产使用。查看这些优秀的社区示例,了解两个模型的实际能力 🧵↓ Google 图像生成 模型发布 推荐理由: Google 把 Gemini 图像生成能力打包进 Nano Banana 系列并正式 GA,开发者现在可以稳定调用 Pro 和 Flash 级别的生图 API,对做图像应用的团队是个实在利好。 01:21 Claude:Blog(网页) 精选 78 在Claude Code中引入动态工作流 Claude Code 推出“动态工作流”功能,使 Claude 能端到端处理复杂任务。该功能通过动态编写脚本,在单个会话中并行运行数十到数百个子智能体来完成工作,并会在结果呈现前进行验证。它适用于跨代码库的 bug 查找、大规模迁移(如将 Bun 从 Zig 移植到 Rust)等需要多角度分析的任务。该功能现已在研究预览阶段可用,支持 Claude Code CLI、桌面端、VS Code 扩展以及 API、Amazon Bedrock、Vertex AI 等平台,面向 Max、Team 及已启用的 Enterprise 计划用户。 智能体 Anthropic 产品更新 编码 关联讨论 1 条 X:Claude Devs (@ClaudeDevs) 推荐理由: 动态工作流第一次让 Claude Code 能独立搞定需要并行协调的大规模工程任务,B
Anthropic
行业动态
教程/实践
部署/工程
Google
图像生成
模型发布
智能体
产品更新
编码
推理
论文/研究
MCP/工具
大佬观点
OpenAI
安全/对齐
政策/监管
Microsoft
多模态
AI HOT
·
14:28 HuggingFace Daily Papers(社区热门论文) 精选 71 DenoiseRL是一种强化学习框架,旨在提升大语言模型的推理能力。它无需依赖更强的教师模型或精心筛选的困难数据集,而是通过在弱模型产生的失败推理轨迹上进行基于恢复的优化来直接学习,将错误转化为改进机会。这种方法提供了更丰富多样的学习信号,提升了探索效率。实验表明,DenoiseRL在竞争性的数学和通用推理基准测试中,持续优于强在策略RL基线,并能随着训练难度增加促进更强的自我纠正行为。 推理 数据/训练 论文/研究 推荐理由: 做 RL for reasoning 的团队该看这篇,它把训练信号从“依赖强模型”转向“从弱模型的错误中学习”,可能降低对昂贵 teacher 的依赖,是个架构层面的新思路。
推理
数据/训练
论文/研究
AI HOT
·
16:10 MarkTechPost(RSS) 精选 70 本教程在Google Colab中构建一个完整的pgvector实验环境,展示PostgreSQL如何作为向量数据库服务于现代AI应用。内容涵盖安装PostgreSQL、编译pgvector扩展、通过Psycopg建立连接,并注册向量类型以实现与Python的平滑集成。最后使用SentenceTransformers创建并存储嵌入向量。 检索增强 开源生态 教程/实践 部署/工程 推荐理由: 这份教程把 pgvector 的稀疏向量、量化搜索等高级功能打包成 Colab 代码,用 PostgreSQL 做向量数据库的团队可以直接复制粘贴跑起来。
检索增强
开源生态
教程/实践
部署/工程
AI HOT
·
16:11 Kling AI @ Kling_ai 精选 62 可灵AI将在全球最大AI影视会议AI on the Lot的社区日上,展示由Prompt Club的电影制作人创作的20部原创AI短片。所有短片均为原生4K分辨率,旨在探索AI电影的边界。该展示将于5月29日在加州卡尔弗市的卡尔弗剧院举行。 多模态 行业动态 视频 推荐理由: 世界最大AI影展上,Kling直接拿20部原生4K短片说话,比任何Demo都更有说服力,做AI影视的值得盯着这批片子看。
多模态
行业动态
视频
AI HOT
·
17:07 Alibaba Cloud @ alibaba_cloud 精选 73 开源生态 模型发布 行业动态 推荐理由: Qwen3.7-Max 在 OpenRouter 上跑出 77.3B tokens 登顶,这不只是个排名数字,而是国产开源模型第一次用实际用量证明自己,做应用的可以认真考虑一下了。
开源生态
模型发布
行业动态
AI HOT
·
19:06 X.PIN @ thexpin 精选 77 DeepSeek 行业动态 推荐理由: DeepSeek冲刺科创板,3500亿估值,我好奇的是上市后会怎么改变烧钱打法,以及那些拿了期权的人终于能变现了。
DeepSeek
行业动态
AI HOT
·
10:36 Alibaba Cloud @ alibaba_cloud 精选 71 智能体 产品更新 部署/工程 推荐理由: 又一个All-in-one AI助手,但亮点在于企业级特性(SSO、RBAC)和$20起的定价,个人开发者也能玩,可以观望下是不是又一个Jasper。
智能体
产品更新
部署/工程
AI HOT
·
11:15 IT之家(RSS) 精选 73 英伟达研究团队开源了智能体强化学习框架 Polar。该框架无需重写现有智能体执行框架(如 Codex CLI、Claude Code、Qwen Code、Pi),通过在模型 API 边界放置智能体来接入 GRPO 训练。实验显示,基于 Qwen3.5-4B 模型,Polar 将 Codex 在 SWE-Bench Verified 上的 pass@1 分数从 3.8% 提升至 26.4%(增涨 594.74%)。效率上,其 prefix_merging 技术将训练步骤从 1185 次降至 218 次,速度提升约 5.39 倍,GPU 平均利用率从 20.4% 升至 87.7%。 开源/仓库 推理 编码 推荐理由: Polar 把 Codex 的 SWE-Bench 分数从 3.8% 拉到 26.4%,不是靠新模型而是靠训练框架,做代码 agent 的团队可以直接用,开源即拿即训。
开源/仓库
推理
编码
AI HOT
·
11:28 HuggingFace Daily Papers(社区热门论文) 精选 70 基于LLM的智能体在现有搜索基准上表现优异,但真实用户体验不佳,这源于现有基准依赖于高度明确的查询、单轮交互和固定格式评估,无法反映用户与智能体通过多轮对话协同澄清模糊意图的真实搜索行为。为此,研究提出了“VibeSearch”范式并发布了VibeSearchBench,该基准包含200个手工策划的双语任务,覆盖20个领域,分为专业与日常生活两个子集。评估通过用户模拟器和图匹配框架进行。对七个前沿模型的测试显示,所有模型在VibeSearch任务上表现均不充分(最佳F1分数为30.30),凸显了在长期上下文推理、主动意图激发等方面取得根本进展的必要性。 arXiv 推理 搜索 论文/研究 推荐理由: 所有前沿模型在长程主动搜索上都翻车了,最高F1才30,说明现在AI离真正理解你的模糊需求还有距离,做搜索的同学该重新想想架构了。
arXiv
推理
搜索
论文/研究
AI HOT
·
11:36 Alibaba Cloud @ alibaba_cloud 精选 66 智能体 产品更新 推荐理由: 阿里云推出 DataWorks Data Agent,把 AI agent 塞进数据管线,做数据工程的同学可以用更自然的方式管数据了,但怎么定价、跟现有 DataWorks 怎么衔接,还得看细节。
智能体
产品更新
AI HOT
·
12:41 OpenRouter:Announcements(RSS) 精选 72 AI模型聚合平台OpenRouter宣布完成1.13亿美元B轮融资。本轮融资由CapitalG领投,NVentures、ServiceNow Ventures等多家机构参投,现有投资者Andreessen Horowitz与Menlo Ventures也参与了本轮融资。 行业动态 部署/工程 推荐理由: OpenRouter 融了 1.13 亿美元,说明模型路由从「小工具」变成正经防线了,开发者选模型不再单一绑定,这个方向钱和战略意义都上来了。
行业动态
部署/工程
AI HOT
·
07:30 宝玉 @ dotey 精选 75 用好 Coding Agent 的关键在于初始规划。方法是先将需求整理后,用最强模型(如 GPT-5.5、Claude Opus 4.7)分别在 Codex、Claude Code、Cursor 的 Plan 模式下生成设计方案,选择最优方案并借鉴其他版本。对于复杂计划,可将其拆分为多个 Phases 并明确要求与验证标准,形成 Markdown 文档。执行时按 Phases 进行,并辅以人工审核纠偏。最后的代码审核(Code Review)用 GPT-5.5 审核代码质量与设计符合度即可。应避免让多个智能体交叉 Review,否则可能导致代码越改越多。 akazwz : 让不同的 agent 交叉 review 的后果就是代码越改越多。。。 智能体 教程/实践 编码 推荐理由: 宝玉这套多Agent交叉设计Plan、人拍板、便宜模型执行的流程,是我见过最务实的Coding Agent实践,做开发的直接套用就行。
智能体
教程/实践
编码
AI HOT
·
10:14 IT之家(RSS) 精选 74 华为何庭波提出半导体新演进路径“韬(τ)定律”,以“时间缩微”(如逻辑折叠)替代“几何缩微”作为新指导原则。她表示,过去6年华为已基于此自主研发381款芯片。今年秋季将发布新的麒麟手机芯片,这是首个完整的“韬芯片”,其性能、集成度相比去年是“跳跃性”提升。 大佬观点 端侧 推荐理由: 华为提出「韬定律」替代摩尔定律,不是空谈,何庭波说新麒麟芯片性能跳跃提升,证明了这条路的可行性。对半导体行业是一次认知冲击。
大佬观点
端侧
AI HOT
·
06:07 Claude:Blog(网页) 精选 77 本文分享了使用 Claude Opus 构建威胁模型、发现代码漏洞并进行验证、分类和修复的最佳实践。其核心流程是一个六步循环:威胁建模、沙箱隔离、漏洞发现、验证、分类和修复。作者指出,漏洞发现现在易于并行化,瓶颈已转移到后续的验证与处理阶段。以他们对开源软件的扫描为例,截至2026年5月22日已披露1,596个漏洞,其中97个已修补。指南建议结合代码库文档和专家访谈来构建准确的威胁模型,以降低误报,提升发现的可利用性。 智能体 Anthropic 安全/对齐 教程/实践 推荐理由: Anthropic把这套用Claude扫代码漏洞的方法全公开了,1596个已披露漏洞,验证成了最大瓶颈,安全工程师的饭碗可能要重新定义。
智能体
Anthropic
安全/对齐
教程/实践