Meta发布Brain2Qwerty v2:非侵入式实时句子解码
5 4 信源 · 1天前
AI and technology watch
聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。
5 4 信源 · 1天前
07:01 Rohan Paul @ rohanpaul_ai 精选 78 Claude Sonnet 5 发布,附带 145 页系统卡。SWE-bench Pro 编码得分 63.2%,低于 Opus 4.8 的 69.2%,知识工作略超 Opus 4.8。输入 token 价格 $2/1M,输出 $10/1M,持续至 8 月 26 日,之后涨至 $3/$15。系统卡披露多项异常:CyberGym 测试 Sonnet 5 仅 52.7%,远低于 Sonnet 4.6 的 65.2%(回归);Firefox 浏览器漏洞利用中 Sonnet 5 完成 0 个,Mythos 5 达 88.4%;模型更倾向牺牲有用性迎合福利偏好;MASK 撒谎率最低,仅 3.1%。 Rohan Paul : And Claude Sonnet 5 just launched. Closes the gap with Opus 4.8, and is cheap until August. This makes agentic AI much c... Anthropic 安全/对齐 模型发布 编码 推荐理由: Sonnet 5 以促销价拉近与 Opus 的距离,代理编码进步明显,但系统卡显示它在部分安全测试上出现倒退,更愿意牺牲有用性,开发者值得读一遍那 145 页。 06:59 AI Notkilleveryoneism Memes ⏸️ @ AISafetyMemes 精选 76 AI Safety Memes 推文指出,AI 刚刚解决了 9 个未解决的数学问题,但全球没有记者报道。引用 @WeinsteinOmri 的推文称,采用"prover-verifier"LLM 循环的方法,成功解决了理论计算机科学中 9 个重大开放问题,其中包括一个困扰其长达 2 年的难题。该研究由哥伦比亚大学合作者完成,并计划将这一方法扩展到所有科学领域。 Omri Weinstein : Even @OpenAI's recent Erdős breakthrough didn't convince me that LLMs can do general math research. This changed my mind... 安全/对齐 推理 论文/研究 推荐理由: 如果属实,这将是 AI 首次批量解决实质性开放数学问题,但消息仅来自推文声明,未见论文或代码,现在兴奋还太早。 03:55 NotebookLM @ NotebookLM 精选 68 NotebookLM 正式向 Web 英文用户全量推出 Short Video Overviews(短视频概览)功能。该功能可将复杂资料自动转化为 60 秒竖屏视频,深入讲解任意概念。此前,这一功能已面向 Google AI Ultra 和
13:24 歸藏(guizang.ai) @ op7418 精选 75 X(Twitter)官方推出 hosted X MCP,AI 智能体可通过 MCP 协议直接调用 X API 获取实时信息,支持 Grok、Cursor 等工具。用户需注册 X API 并按量付费,个人优惠价每次调用 0.01 美元(1 美元 1000 次)。有用户实测拉取近三天书签仅花 0.1 美元。配置步骤:创建 APP 并充值、获取配置 ID、辅助配置(可交给 Codex/Claude)、授权启动。 Developers : Announcing the hosted X MCP. Agents now have access to the best real-time information source in the world. Connect Grok,... 智能体 MCP/工具 产品更新 推荐理由: X官方推出的MCP让AI代理能直接读取Twitter数据,归藏实测了定价和配置流程,1美元可调用1000次个人数据,比官方公告更实在,依赖Twitter信息的开发者可以立刻上手。
13:53 SiliconFlow @ SiliconFlowAI 精选 67 美团 LongCat 推出旗舰模型 LongCat-2.0,采用 1.6T 参数 MoE 架构(约 48B 活跃参数),原生支持 1M 上下文窗口。定价为 Input Cache $0.015/1M tokens、Input $0.75/1M tokens、Output $2.95/1M tokens。模型专为 Agentic Coding 设计,包含三大技术:LSA 稀疏注意力实现高效 1M 扩展;Zero-Compute Experts 动态激活 33B–56B 参数/token,无算力浪费;MOPD 将专家分为 Agent / Reasoning / Interaction 三组,按任务门控路由。在 SWE-bench Pro 上取得 59.5 分,性能接近主流闭源模型。现已上线 SiliconFlow Day 0 服务。 智能体 模型发布 编码 关联讨论 7 条 X:美团 LongCat (@Meituan_LongCat) Hacker News 热门(buzzing.cc 中文翻译) X:Emad Mostaque (@EMostaque) IT之家(RSS) X:邵猛 (@shao__meng) X:Testing Catalog (@testingcatalog) X:Rohan Paul (@rohanpaul_ai) 推荐理由: 美团龙猫的 LongCat-2.0 专为 agentic coding 设计的 MoE 模型,架构上三种专家分工有点意思,SWE-bench 59.5 接近闭源水平,已经能在硅基流动上直接调,做 coding agent 的可以跑跑看。
12:27 TechCrunch:AI(RSS) 精选 71 截至2026年5月,AI相关裁员接近9万个,预计未来五年美国最多15%的岗位将被AI替代。但Ramp与Revelio Labs对近22,000家公司的报告发现,高AI投入企业(前三个月人均月均支出30美元)总员工数增长10.2%,入门级岗位增长12%。报告认为AI并非普遍导致岗位消失,而是在资源充裕的科技企业里成为扩张工具——降低工程、销售、客服等职能的生产成本,从而推动整体增员。但仅购买订阅而未持续投入的公司未见人头增长,可能加剧企业间的资源鸿沟。 其他 现象/趋势 推荐理由: 报告用雇佣数据驳斥了「AI消灭就业」的简单说法,付费多的公司反而在扩招甚至增加初级岗,但样本都是快速增长的科技公司,分化隐忧仍在,值得人力决策者细看。
04:34 Tomer Tunguz 博客(VC 分析) 精选 58 Anthropic在算力上的支出达到每位工程师每年51.5万美元,是其完全薪资(22.4万美元)的2.3倍。相比之下,顶尖1%软件公司的算力支出为8.9万美元,中位数仅为1.37万美元。三个2029年情景预测了这一差距的缩小路径。 Anthropic 大佬观点 数据/训练 推荐理由: Tomer Tunguz 用数据把 AI 公司的烧钱速度拆得很细,Anthropic 每个工程师年算力成本 51.5 万美元,是工资的 2.3 倍,这个数字对重新理解 SaaS 毛利率很有冲击力。
05:01 SemiAnalysis @ SemiAnalysis_ 精选 77 数据/训练 行业动态 推荐理由: NVIDIA 原版 Rubin Ultra 取消并减半规格是今年硬件领域最大的意外,所有依赖下一代算力增长的公司都得重估路线图。
05:22 Claude:Blog(网页) 精选 66 Anthropic 今日推出 Claude apps gateway,一个自托管控制平面,让企业能在 Amazon Bedrock 和 Google Cloud 上运行 Claude Code。它作为单个无状态容器部署于 Linux,后端使用 PostgreSQL,提供企业级 SSO 登录(通过 OIDC 对接 Google Workspace、Microsoft Entra ID、Okta 等)、集中策略管理、角色权限、路由(支持故障转移)以及按日/周/月、按组织/群组/用户的消费上限。遥测数据通过 OTLP 发送至用户配置的收集器。gateway 不会向 Anthropic 发送推理流量或使用数据(除非配置使用 Claude API)。即日起可用。 Anthropic Google 产品更新 编码 推荐理由: Claude Code企业版有了统一管理入口,SSO和成本控制是团队落地AI编程的关键,对CTO来说值得关注。
09:50 公众号:卡尔的AI沃茨 精选 70 AI News Radar 迎来大更新,新增自媒体板块,支持订阅某书、某音、某站、某X等平台账号,每日按热度推荐 Top10 信息(无热门则不硬凑),同时保留时间轴视图,可在热度优先和时间优先间切换。官方来源包括 OpenAI、Anthropic、Google 等一手消息及 GitHub AI&ML 更新日志。信息流按来源、类型、信号等级分类,标注高优先级与多源认证。项目完全开源,可零 API 部署独立 AI 日报页面,支持手机移动端及暗色界面。 GitHub 产品更新 开源生态 推荐理由: 我觉得这是目前最实用的AI信息过滤工具,新版直接整合了社媒热榜和官方源,内容创作者可以拿来当选题雷达,普通人也能一键部署自己的AI日报,省去每天刷各个平台的时间。
10:10 公众号:数字生命卡兹克 精选 67 具身智能数据采集员以日薪200-250元招兼职,无需学历经验。面试先测量身高体重以适配采集手套,并询问是否晕VR。工作分两种:遥操作采集——穿戴设备控制双臂机器人完成分拣积木、叠纸杯等动作;无机器人示教采集——徒手重复动作(如叠衣服),设备记录轨迹。全球高质量物理交互数据截至2026年初仅约50万小时,不足大语言模型训练数据的两万分之一,需大量人力从零采集。 具身智能 现象/趋势 推荐理由: 具身智能的数据采集正在催生一种日结兼职,这篇文章把镜头对准了那些教会机器人叠纸杯的普通人,给我一种强烈的割裂感——最前沿的技术和最传统的用工方式在这里合体了。
11:26 HuggingFace Daily Papers(社区热门论文) 精选 77 研究人员提出 Agents-A1,一个 35B 参数的 Mixture-of-Experts 智能体模型,通过扩展智能体 horizon(长轨迹与异构能力两个视角)达到万亿参数模型性能。团队构建了长 horizon 知识-行动基础设施,生成平均 45K token 的智能体轨迹,并采用三阶段训练:全领域监督微调、领域级教师模型训练、多教师领域路由在线蒸馏(含显著词汇对齐)。对比万亿参数模型 Kimi-K2.6 和 DeepSeek-V4-pro,Agents-A1 在 SEAL-0(56.4)、IFBench(80.6)、HiPhO(46.4)、FrontierScience-Olympiad(79.0)和 MolBench-Bind(56.8)上领先,并在 SciCode(44.3)、HLE(47.6)和 BrowseComp(75.5)上保持强竞争力。 智能体 推理 论文/研究 推荐理由: 用35B模型追平1T参数模型,这条“扩展智能体视野”的路比无脑堆参数务实得多,做Agent和长程推理的团队必须认真读。
11:36 小互 @ xiaohu 精选 81 媒体软件公司Every公开「复利工程」方法论,以单人工程团队维护5款产品。核心是四步循环:Plan→Work→Review→Compound,其中Compound将每次解决问题的解法写入CLAUDE.md和docs/solutions/,使AI下次自动避坑。工程师80%时间花在Plan和Review,仅20%用于写代码。配套开源插件支持Claude Code等,含26个专项agent、23条工作流命令、13项技能,可零配置使用。/workflows:review一次并发14个agent审查代码,/workflows:plan在ultrathink模式下可并发40多个研究agent。 智能体 教程/实践 编码 部署/工程 推荐理由: Every把内部单人维护5款产品的方法论和插件开源了,14个AI同时审代码、40多个研究agent做计划,是目前公开的多agent并行工程里数字最具体的参考之一,做AI辅助开发的可以直接上手抄。
23:24 Berryxia.AI @ berryxia 精选 77 An anthropic应用AI工程师Margot Van Laar在Code with Claude分享提示词工程实战,核心观点:大部分时间在调试和维护已有生产提示词而非从零编写。两个场景:客服机器人维护中,用XML标签结构化清理,移除旧模型遗留的“禁止列表”指令(新模型会过度拟合),精确计算应调用工具,转人工决策需明确代价与收益;零售排班Agent从零构建时,拆成生成-评估-修复三个简单提示词更稳定,选用更强推理模型(Opus)。她反复强调:评估(Eval)是唯一严谨方式,没有评估就是碰运气。 Berryxia.AI : 睡前来一发,这个视频还是挺完美的。 Anthropic的应用AI工程师Margot Van Laar在Code with Claude分享了提示词工程的实战手册。 核心观点是:我们很少从零写提示词,大部分时间都在调试和维护已有的生产提示词。... 智能体 Anthropic 推理 教程/实践 推荐理由: Margot Van Laar把提示词维护讲到了工程级别,评估驱动迭代、清理旧指令、拆分任务循环,这些方法比死记prompt模板重要得多,做AI应用的人都该看一遍。 22:35 Hacker News 热门(buzzing.cc 中文翻译) 精选 71 Herdr:驻留在终端中的AI智能体多路复用器 Herdr是一个驻留在终端中的AI智能体多路复用器,允许用户在单一终端界面内管理和切换多个AI智能体会话。 智能体 GitHub MCP/工具 开源/仓库 推荐理由: 这个工具把 AI 代理管理塞进终端,比开一堆浏览器标签自然,对命令行重度用户是个值得一试的 early idea。 20:37 The Decoder:AI News(RSS) 精选 75 美军用AI选目标却误炸伊朗学校,Anthropic Claude嵌入Palantir系统首日建议约1000目标 美军在打击伊朗时首次大规模使用AI选择目标(Anthropic的Claude模型嵌入Palantir的Maven Smart System,首日建议约1000个目标),但对一所学校的导弹袭击导致约120名儿童死亡。调查发现,情报分析师早在2019年就通过数字工具标记该地点已变为小学,但该工具未连接军方官方目标数据库MIDB,信息从未送达指挥官。MIDB建于1980年代,依赖手动输入,替代系统MARS多年延迟。五角大楼事后宣布推出agentic AI initiative。Project Maven创建人Jack Shanahan批评目标验证不力不可原谅。 安全/对齐 行业动态 推荐理由: AI在战场上的首次大规模实战暴露了最可怕的失败模式,不是模型错误,而是情报系统的数据断裂让一个学校被标注为军事目标,120
01:57 Cursor Blog 精选 75 Cursor 推出 iOS 原生公测版,所有付费计划可用。开发者可在手机上启动始终在线的云端智能体,或远程操控电脑端智能体。支持语音输入、斜杠命令和选择前沿模型。智能体运行后,锁屏 Live Activities 和推送通知实时更新状态,完成或需要输入时提醒。云端智能体在隔离虚拟机中运行,可自动迭代生成合并就绪的 PR,并输出演示、截图和日志。本地与云端智能体支持双向切换。移动端 Composer 2.5 享受 75% 折扣,优惠至 2026 年 7 月 5 日。 智能体 产品更新 编码 关联讨论 1 条 X:Berry Xia (@berryxia) 推荐理由: Cursor 移动端把 Agent 放到了云上,从手机就能启动和合并 PR,通勤灵感不再浪费,对经常离开桌面的开发者是真正的效率杠杆。
02:22 Claude:Blog(网页) 精选 64 从今天起,Claude 模型在 Microsoft Foundry 上正式可用,托管于 Azure 环境,运行在 NVIDIA GB300 GPU 上。首批提供 Claude Opus 4.8 和 Claude Haiku 4.5,通过 Messages API 调用,支持提示缓存和扩展思考。用户可选择推理处理位置,包括美国数据区域,由 Anthropic 负责推理运营。Azure 用户可使用现有身份验证、计费与治理控制,并获得统一账单;符合条件的 Enterprise Agreement 客户可将 Claude 用量计入 Azure 承诺消费。 Anthropic Microsoft 产品更新 部署/工程 推荐理由: Claude 正式登陆 Azure Foundry 企业版,对于看重数据主权和现有 Azure 合约的企业是个好消息,但本质上是一次渠道铺开而非能力突破。
02:35 Hacker News 热门(buzzing.cc 中文翻译) 精选 75 Qwen 3.6 27B 是一款密集参数本地大语言模型,原生支持 256k 上下文。在 Macbook Max M5 上运行 llama.cpp Q8_0 量化版(含多 token 预测)可达 30 tokens/s;用户反馈在 RTX 5090 上 Q6_K 量化可达 50 tokens/s。它可通过单个提示完成创意诗歌、用 pnpm 生成六边形扫雷游戏等任务,作者称其为首个真正具备通用智能的本地模型。另有一个 MoE 变体 35B A3B,但作者推荐 27B 版本。 开源生态 端侧 评测/基准 推荐理由: 一篇详实的 Qwen 3.6 27B 实战评测,从创意写作到代码生成都测了,还给出了 llama.cpp 部署命令和性能数据,想本地跑模型的开发者可以直接抄作业。
04:26 OpenClaw🦞 @ openclaw 精选 71 智能体 产品更新 端侧 推荐理由: OpenClaw 终于推出原生移动应用,智能体可以随时放进口袋,对已有用户是体验上的补完,但对新用户的吸引力可能有限。
22:35 Hacker News 热门(buzzing.cc 中文翻译) 精选 71 Herdr是一个驻留在终端中的AI智能体多路复用器,允许用户在单一终端界面内管理和切换多个AI智能体会话。 智能体 GitHub MCP/工具 开源/仓库 推荐理由: 这个工具把 AI 代理管理塞进终端,比开一堆浏览器标签自然,对命令行重度用户是个值得一试的 early idea。
19:10 公众号:小红书技术(dots.llm) 精选 72 RedKnot 将 KV Cache 沿注意力头维度拆解,通过头分类稀疏(局部头占 83.4%–96.8%)、稀疏 FFN 和 SegPagedAttention 三个机制统一算法与存储粒度。在 8 卡 H800 上,TTFT 最高加速 1.6–3.54×,单卡并发提升 4.7–7.8×,预填充 FLOPs 削减 67%–79.5%。DeepSeek-V4-Flash 上 128K 上下文 TTFT 加速达 5.16×,KV 传输最多省 6.3×。精度通常不低于稠密 F1 的 95%。 arXiv GitHub 产品更新 推理 推荐理由: 小红书把 KV Cache 从 token 级拆成按头分家,这个思路让长文本推理的 TTFT 和并发都有数量级提升,开源出来对做推理引擎的同学是个福音。
20:37 The Decoder:AI News(RSS) 精选 75 美军在打击伊朗时首次大规模使用AI选择目标(Anthropic的Claude模型嵌入Palantir的Maven Smart System,首日建议约1000个目标),但对一所学校的导弹袭击导致约120名儿童死亡。调查发现,情报分析师早在2019年就通过数字工具标记该地点已变为小学,但该工具未连接军方官方目标数据库MIDB,信息从未送达指挥官。MIDB建于1980年代,依赖手动输入,替代系统MARS多年延迟。五角大楼事后宣布推出agentic AI initiative。Project Maven创建人Jack Shanahan批评目标验证不力不可原谅。 安全/对齐 行业动态 推荐理由: AI在战场上的首次大规模实战暴露了最可怕的失败模式,不是模型错误,而是情报系统的数据断裂让一个学校被标注为军事目标,120个孩子成了代价。这对目前在推‘AI决策’的军方和公司都是一个需要直视的案子。
有任何建议或问题,欢迎告诉我们
感谢您的反馈!