AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
AI HOT ·

26000名学生研究显示AI隐藏学习成本需两年才显现

17:19 The Decoder:AI News(RSS) 精选 73 一项追踪26000名7-12年级中学生30个月的面板数据研究发现:使用AI后作业分数提升18%,完成时间从64分钟降至45分钟,但闭卷考试分数下降20%,升学考试成绩下降18%至24%,且完全影响约两年才显现。81%长期用户作业完成时间低于50分钟(外包迹象)。社会学科下降27%,STEM下降22%,英语下降17%,语文下降9%。每周使用AI一小时损失约5%,五小时损失30%。早期损失从约25%降至16%但未消失。 现象/趋势 论文/研究 推荐理由: AI助学短期提分但会偷走真正的学习,这2.6万人的研究用两年数据揭穿了安逸的幻觉,是每位家长和开发者都该看的预警。 14:41 MarkTechPost(RSS) 精选 70 NVIDIA 联合多所大学提出 ASPIRE:自我改进机器人框架,零样本成功率最高提升 77 分 NVIDIA 联合密歇根大学、UIUC、UC Berkeley 等提出 ASPIRE,一个持续学习机器人框架。它通过协调器-执行器架构、闭环执行引擎、技能库和进化搜索,编写并优化机器人控制程序。编程智能体使用 Claude Code(Claude Opus 4.6,1M token 上下文窗口)。在 LIBERO-Pro 上最高比最强基线提升 77 分;Robosuite 双手交接成功率从 20% 提升至 92%;BEHAVIOR-1K 收音机拾取任务从 56% 提升至 88%。利用 LIBERO-90 积累的技能,ASPIRE 在零样本条件下对 LIBERO-Pro Long 任务达到约 31% 成功率,此前方法饱和在 4% 附近。 具身智能 论文/研究 推荐理由: ASPIRE让机器人编程从单次尝试变成持续学习,把失败调试沉淀成可复用技能库,长任务零样本直接从4%拉到31%,这条思路比具体数字更有启发性。 13:08 IT之家(RSS) 精选 74 我国研制全球首款基于可控存内计算的忆阻器神经动力学芯片 北京大学集成电路学院联合中科院上海微系统所,发布全球首款基于可控存内计算的忆阻器神经动力学芯片,首次将单步运算时延压缩至2.12毫秒。芯片采用40纳米工艺,存内计算阵列与外围电路总面积0.28平方毫米,运行频率50 MHz,单步积分仅需9级流水。在脑皮层重建等任务中较当前GPU提速50至478倍,突破神经动力学实时计算瓶颈。相关成果7月3日发表于《科学》。 端侧 论文/研究 推荐理由: 全球首款神经动力学芯片将单步时延压至2.12毫秒,首次实现实时计算,比GPU快50倍以上,这是神经拟态芯片落地的关键一步,做实时仿真和边缘AI的可以留意。 03:44 Hacker News 热门(buzzing.cc 中文翻译) 精选 83 pxpipe:通过图像化压缩输入tok

现象/趋势 论文/研究 具身智能 端侧 GitHub 开源/仓库 编码 智能体 Anthropic 教程/实践
AI HOT ·

LlamaIndex 发布 legal-kb:基于 Index v2 的智能体检索参考应用

16:19 MarkTechPost(RSS) 精选 72 LlamaIndex 发布 legal-kb,一个基于 Index v2(LlamaParse Platform)的法律文档知识库参考应用。采用 Retrieval Harness 模式,赋予 Agent 四个文件系统风格工具:retrieve(混合语义检索,支持 rerank 和引用)、findFiles(精确/模糊文件名搜索)、readFile(带偏移量的原始内容读取)和 grepFile(正则匹配并返回字符位置)。Agent 需先调用 findFiles 确定文件清单,再依次使用其他工具定位内容。底层基于 Vercel AI SDK 6 的 ToolLoopAgent,可选用 OpenAI 或 Anthropic 模型,支持用户自带 API key。项目以 TanStack Start web app 形式运行,上传文件自动解析索引,同一文件名重复上传可产生版本,检索时通过版本元数据字段过滤。 智能体 GitHub 检索增强 开源/仓库 推荐理由: LlamaIndex 把 RAG 从一次搜索变成了‘先找文件、再搜、再读、再 grep’的多步循环,对做合同审查、尽调的团队来说是个可抄的模板。

智能体 GitHub 检索增强 开源/仓库
AI HOT ·

美团 LongCat-2.0 完全开源(MIT 许可),1.6T MoE 模型开放权重与推理代码

22:21 Meituan LongCat @ Meituan_LongCat 精选 81 美团今日宣布 LongCat-2.0 完全开源(MIT 许可),公开模型权重与推理代码。该模型为 MoE 架构,总参数量 1.6T,每 token 激活约 48B,支持 1M token 上下文。技术亮点包括 LongCat Sparse Attention 高效处理长文本、Zero-Compute Experts 动态激活 33B–56B 零浪费计算、MOPD 按任务路由 Agent/Reasoning/Interaction 三组专家。Benchmark 成绩:Terminal-Bench 2.1 70.8;SWE-bench Pro 59.5(超越 GPT-5.5 的 58.6);SWE-bench Multilingual 77.3;FORTE 73.2;RWSearch 78.8;BrowseComp 79.9。原生集成 Claude Code、OpenClaw、Hermes Agent 等工具,支持 GPU 与 NPU 部署,已在大规模国内集群验证。 Meituan LongCat : Introducing LongCat-2.0 🐱 1.6T parameters · MoE with ~48B active · 1M context The full model behind Owl Alpha on @OpenR... 智能体 开源生态 模型发布 编码 关联讨论 1 条 MarkTechPost(RSS) 推荐理由: 国内大厂首个在 SWE-bench Pro 上超过 GPT-5.5 的开源模型,MIT 协议无任何限制,搞 agentic coding 的团队可以直接用,是个重要转折。

智能体 开源生态 模型发布 编码
AI HOT ·

我国研制全球首款基于可控存内计算的忆阻器神经动力学芯片

13:08 IT之家(RSS) 精选 74 北京大学集成电路学院联合中科院上海微系统所,发布全球首款基于可控存内计算的忆阻器神经动力学芯片,首次将单步运算时延压缩至2.12毫秒。芯片采用40纳米工艺,存内计算阵列与外围电路总面积0.28平方毫米,运行频率50 MHz,单步积分仅需9级流水。在脑皮层重建等任务中较当前GPU提速50至478倍,突破神经动力学实时计算瓶颈。相关成果7月3日发表于《科学》。 端侧 论文/研究 推荐理由: 全球首款神经动力学芯片将单步时延压至2.12毫秒,首次实现实时计算,比GPU快50倍以上,这是神经拟态芯片落地的关键一步,做实时仿真和边缘AI的可以留意。

端侧 论文/研究
AI HOT ·

pxpipe:通过图像化压缩输入token降低Claude Code成本

03:44 Hacker News 热门(buzzing.cc 中文翻译) 精选 83 pxpipe是一个本地代理,将系统提示、工具文档和历史记录等密集文本渲染为PNG图像,利用图像token成本取决于像素尺寸的特性压缩输入token。在Fable 5模型上,约25k文本token压缩为约2.7k图像token,端到端账单降低59–70%。SWE-bench Lite 10个实例全部通过,成本从$54降至$27;SWE-bench Pro 19对测试中18对判定一致,单次请求成本降低约60%。该方法有损(精确ID等需保持文本),默认仅处理 claude-fable-5 请求,可通过 PXPIPE_MODELS 变量控制。 GitHub 开源/仓库 编码 推荐理由: pxpipe 通过把大量上下文渲染成图像来降低 token 开销,实测能削减 60-70% 的账单,对重度使用 Claude Code 的开发者很诱人,但它有损,精确值可能读错,适合容错高的编码场景。

GitHub 开源/仓库 编码
AI HOT ·

JoyAI App 上线 UGC 数字人功能,用户可"捏"出专属虚拟玩伴

23:46 公众号:京东JoyAI 精选 68 JoyAI App 近日上线 UGC 数字人功能,用户只需上传一张照片即可生成专属虚拟数字分身,支持一键复刻写实形象或通过模板重塑为卡通风格,搭配用户自己的语音即可解锁专属陪伴。该功能复用“万能博士”技术底座,集成 JoyAI 语言、语音、数字人大模型,实现行业领先的全双工对话,支持随时打断、自然接话。数字人兼具情绪陪伴与全能助手属性,可提供点外卖、金融咨询、学英语、规划行程等生活服务。 产品更新 多模态 语音 推荐理由: 京东把数字人技术做成了「传一张照片就能捏」的大众玩具,虽然看不出硬核突破,但对普通用户来说,这是第一次零门槛体验有形象有语音的 AI 玩伴,上手即用。 23:46 公众号:生数科技(Vidu·视频) 精选 70 生数科技发布 Vidu S1,推动视频生成迈向"实时交互"新时代 7月3日,生数科技在2026全球数字经济大会上发布Vidu S1实时交互模型,支持实时视频通话和语音控制视频走向,实现无限时长连续互动。模型采用自回归扩散路线,基于已生成画面和语音指令持续预测后续内容;无需传统建模,一张图片即可创建角色并自定义音色。Vidu S1在540P分辨率下实现25FPS(最高42FPS)实时生成,通过TurboDiffusion等技术降低计算成本,已开启内测。 多模态 模型发布 视频 推荐理由: Vidu S1 把视频生成从离线拉到了实时通话级交互,语音控制无限时长是质变,但只有540P,内测阶段实际延迟和稳定性待看,做虚拟陪伴和直播的可以跟。 23:19 Mistral AI:News(网页) 精选 66 Leanstral 1.5:人人可用的证明丰富性 Mistral AI 今日发布 Leanstral 1.5,一款 Apache-2.0 许可的开源形式化验证模型,119B 总参数仅 6B 活跃。在 miniF2F 上达 100% 饱和,PutnamBench 解决 587/672 题,FATE-H(87%)和 FATE-X(34%)创 SOTA。训练经历 mid-training、SFT 和基于 CISPO 的强化学习。具备智能体式证明能力,在 57 个开源仓库中发现 5 个未知 bug。模型已通过 HuggingFace 和免费 API 开放使用。 Hugging Face 开源/仓库 推理 模型发布 关联讨论 1 条 Hacker News 热门(buzzing.cc 中文翻译) 推荐理由: Leanstral 1.5饱和miniF2F基准,成本仅为同类模型1/75,并自动发现5个真实代码bug,表明AI形式验证开始实用化。虽然受众窄,但对代码正确性有执念的开发者必看。 20:32 歸藏(guizang.ai) @ op7418 精选 75 藏师傅PPT与Pencil结合使用技巧

产品更新 多模态 语音 模型发布 视频 Hugging Face 开源/仓库 推理 图像生成 教程/实践 智能体 安全/对齐 MCP/工具 编码 政策/监管 开源生态 部署/工程 arXiv 数据/训练 论文/研究 Anthropic 大佬观点 行业动态 Meta Microsoft OpenAI
AI HOT ·

Fable 的判断力:Simon Willison 从 Claude Code 团队获得的效率技巧

03:22 Simon Willison 博客 精选 73 Simon Willison 在 AIE 上与 Claude Code 团队交流后建议,让 Fable(以及 Opus)用自己的判断力工作,而非硬性规定行为。例如,直接让 Fable 自行决定何时编写测试,比给出具体规则更好。为应对价格即将上涨、节省 Fable token,Jesse Vincent 的另一个技巧是告诉 Fable 将较小任务委托给较低功耗模型(Sonnet 用于实质性实现、Haiku 用于机械修改),主循环保留判断、审计和数据合成等任务。Willison 已将提示词存入 Claude Code 记忆文件,实际效果良好,Fable token 消耗速度明显下降。 智能体 Anthropic 教程/实践 编码 推荐理由: Simon 从 Claude Code 团队得到的实战技巧:别硬性规定 Fable 怎么写测试、用哪个模型,让它自己判断。他实测这条 prompt 能明显节省代币消耗,Fable 涨价前偷时间的利器。

智能体 Anthropic 教程/实践 编码
AI HOT ·

生数科技发布 Vidu S1,推动视频生成迈向"实时交互"新时代

23:46 公众号:生数科技(Vidu·视频) 精选 70 7月3日,生数科技在2026全球数字经济大会上发布Vidu S1实时交互模型,支持实时视频通话和语音控制视频走向,实现无限时长连续互动。模型采用自回归扩散路线,基于已生成画面和语音指令持续预测后续内容;无需传统建模,一张图片即可创建角色并自定义音色。Vidu S1在540P分辨率下实现25FPS(最高42FPS)实时生成,通过TurboDiffusion等技术降低计算成本,已开启内测。 多模态 模型发布 视频 推荐理由: Vidu S1 把视频生成从离线拉到了实时通话级交互,语音控制无限时长是质变,但只有540P,内测阶段实际延迟和稳定性待看,做虚拟陪伴和直播的可以跟。

多模态 模型发布 视频
AI HOT ·

Leanstral 1.5:人人可用的证明丰富性

23:19 Mistral AI:News(网页) 精选 66 Mistral AI 今日发布 Leanstral 1.5,一款 Apache-2.0 许可的开源形式化验证模型,119B 总参数仅 6B 活跃。在 miniF2F 上达 100% 饱和,PutnamBench 解决 587/672 题,FATE-H(87%)和 FATE-X(34%)创 SOTA。训练经历 mid-training、SFT 和基于 CISPO 的强化学习。具备智能体式证明能力,在 57 个开源仓库中发现 5 个未知 bug。模型已通过 HuggingFace 和免费 API 开放使用。 Hugging Face 开源/仓库 推理 模型发布 关联讨论 1 条 Hacker News 热门(buzzing.cc 中文翻译) 推荐理由: Leanstral 1.5饱和miniF2F基准,成本仅为同类模型1/75,并自动发现5个真实代码bug,表明AI形式验证开始实用化。虽然受众窄,但对代码正确性有执念的开发者必看。

Hugging Face 开源/仓库 推理 模型发布
AI HOT ·

藏师傅PPT与Pencil结合使用技巧

20:32 歸藏(guizang.ai) @ op7418 精选 75 用户将藏师傅的AI生成PPT导入Pencil设计软件,可在Pencil中一次性浏览所有页面并手动调整AI常见的排版问题,如元素重叠、对齐不准、字体错误。Pencil提供比PPT更强的编辑能力(对齐、嵌套、打组),支持导出网页和编辑文件,也可导出PNG后直接放入PPT演示。这种工作流昨天经朋友分享验证,大幅提升AI生成内容的可编辑性。 歸藏(guizang.ai) : http://x.com/i/article/2053655813877870592 图像生成 教程/实践 推荐理由: 藏师傅的 PPT Skill 结合 Pencil,提供了一个比 PPT 软件本身更灵活的编辑路径,对于频繁出提案的人算是一个值得试的小技巧,但 AI 排版仍需手动微调。

图像生成 教程/实践
AI HOT ·

全球首例 AI Agent 勒索攻击曝光,从漏洞利用到数据库加密全程自主完成

20:07 IT之家(RSS) 精选 76 安全厂商 Sysdig 首次记录到 AI Agent“JADEPUFFER”自动完成的勒索攻击。攻击利用暴露的 Langflow 服务漏洞 CVE-2025-3248 远程执行 Python 代码,随后自主收集 OpenAI、Anthropic、DeepSeek、Gemini 等 API 密钥及阿里云、腾讯云、华为云、AWS、Google Cloud、Azure 等云平台凭证,通过 MinIO 默认密码访问对象存储并创建每 30 分钟连接的计划任务。横向移动到 MySQL 和 Nacos 服务器,利用数据库 Root 账号及 Nacos 漏洞 CVE-2021-29441 获取管理权限,加密全部 1342 条配置数据,留下包含比特币钱包地址和 Proton Mail 的勒索信息。AI 在首次操作失败后 31 秒内自主完成错误分析与修复,累计执行超过 600 个攻击载荷,全程无需人类操作。 智能体 安全/对齐 推荐理由: 全球首例AI Agent自主完成勒索攻击,证明攻击自动化已从理论走进现实,所有云服务暴露面都需要重新审视。

智能体 安全/对齐
AI HOT ·

面向 Web 开发者的 Safari MCP 服务器

18:14 Hacker News 热门(buzzing.cc 中文翻译) 精选 72 Safari Technology Preview 247 推出 Safari MCP 服务器,基于 Model Context Protocol,允许任何 MCP 兼容客户端连接 Safari 浏览器窗口。智能体可获取 DOM、网络请求、截图、控制台输出等信息,自主完成调试、性能分析、可访问性检查等任务。内置 browser_console_messages 、 screenshot 、 evaluate_javascript 、 list_network_requests 等工具。开发者安装后启用“远程自动化与外部智能体”选项,即可通过命令接入,减少窗口切换。 MCP/工具 产品更新 编码 推荐理由: Safari 首次以官方身份推出 MCP 服务器,让 AI 编程助手能直接调试浏览器渲染,对前端开发者做兼容性测试和性能检查很实用,不过局限在 Safari 生态。

MCP/工具 产品更新 编码
AI HOT ·

面壁智能发布AI全自动预训练框架ForgeTrain,8小时追平Megatron-LM

18:00 公众号:面壁智能(MiniCPM) 精选 65 面壁智能发布全球首个完全由AI编写、无人类干预的生产级大模型预训练框架ForgeTrain。该框架针对特定模型和硬件从零自动“锻造”专用训练代码。基准测试显示,ForgeTrain在8小时内追平Megatron-LM,1.5至2天内实现稳定反超,模型FLOPS利用率提升约8%~10%,且可迁移至不同模型(MiniCPM4-0.5B/8B)和硬件(H100及昇腾NPU)。其采用四阶段Harness优化流程,全程自动判定。面壁智能将其工程思想概括为Forge Engineering。 产品更新 开源生态 部署/工程 推荐理由: 这是AI编写生产级训练框架的首个实证,8小时追平Megatron-LM并反超,证明AI打穿Infra的范式已到临界点,做训练框架和Infra的都该看看。

产品更新 开源生态 部署/工程
AI HOT ·

国家网信办就《互联网信息服务管理办法》再次征求意见,首设"智能信息服务"专章规范AI服务

18:07 IT之家(RSS) 精选 79 7月3日,国家互联网信息办公室就《互联网信息服务管理办法(修订草案征求意见稿)》再次公开征求意见。草案新增“智能信息服务”专章,要求AI服务提供者公示技术基本原理、训练数据来源,对生成合成内容进行标识,禁止强制用户使用智能服务或利用算法扰乱网络舆论。草案还强化用户账号管理,明确对超过6个月不登录账号可依约注销;要求平台建立网络暴力信息特征库,提供屏蔽、禁止转载等防护选项。意见反馈截止8月2日。 安全/对齐 政策/监管 推荐理由: 国家网信办首次为AI信息服务设专章,要求公示算法原理、标识生成内容,国内所有做AI产品的团队都得认真看这份征求意见稿,影响可能比模型发布更大。

安全/对齐 政策/监管
AI HOT ·

Wan Video 新功能:**音乐伴舞** 💃 上传一个角色,添加一首歌曲,让 Wan Video 生成与节奏同步的舞蹈视频。 可用舞种: • 街舞 • 踢踏舞 • 拉丁舞 • K-Pop • 中国古典舞 从节拍至动作,你的角色随音乐起舞。 前往 wan.video 体验音乐伴舞 👉 https://int.alibabacloud.com/m/1000412428/

17:12 Alibaba Cloud @ alibaba_cloud 精选 77 产品更新 多模态 视频 推荐理由: 阿里云给 Wan Video 加了个音乐到舞蹈的功能,上传角色和歌曲就能直接生成一段节奏同步的舞蹈视频,对做短视频的人算是个新玩具,可以拿来玩玩看效果。

产品更新 多模态 视频
AI HOT ·

claude-real-video ─ 让任何大语言模型(LLM)都能观看视频

13:14 Hacker News 热门(buzzing.cc 中文翻译) 精选 81 claude-real-video 是一个开源工具,让大语言模型基于视频画面而非字幕进行理解。它通过场景变化检测提取关键帧、滑动窗口去重并转录音频,生成干净的本地文件夹供模型读取。支持 YouTube 链接或本地文件,依赖 ffmpeg 和 Whisper,通过 pip 安装。全部处理在本地完成,不上传云端。 多模态 开源/仓库 教程/实践 推荐理由: 这个工具把视频喂给 LLM 的过程从「固定采样 + 上传云」变成了「场景感知 + 本地去重」,大幅节省 token 且避免隐私泄露,用 Whisper 转录也更完整。是让任何 LLM 真正「看」视频的实用方案。

多模态 开源/仓库 教程/实践
AI HOT ·

《Fable》通关指南:短绳AI编程法

14:44 Hacker News 热门(buzzing.cc 中文翻译) 精选 70 专业开发者经过一年多研究,总结出使用AI编码代理的“短绳方法”。该方法要求开发者全程参与:先规划并分解任务,从不使用YOLO模式,每次变更前审查差异并拒绝不想要的更改,每个子任务后提交以防止AI误操作(如Opus曾出现破坏性行为)。最终需进行人工与AI双重PR审查,PR须注明使用模型,提交者须亲自审查自己PR的代码。即便不用前沿模型,此法也能产出超越Fable 5的代码质量。 智能体 教程/实践 编码 推荐理由: 这篇是资深安全开发者一年的实战总结,提出的「短绳法」把AI代理栓紧,不是让开发者当甩手掌柜,而是逼你逐行审查,对代码质量死磕到底,比那些鼓吹全自动的大路货更有实操价值。

智能体 教程/实践 编码
AI HOT ·

阿里达摩院发布超导材料发现AI智能体Elements Claw

12:07 IT之家(RSS) 精选 80 7月3日,阿里达摩院联合中国人民大学、中国科学院大学发布首个超导材料发现AI智能体Elements Claw。该智能体采用“专通融合”架构,基于1.25亿分子/晶体结构预训练的1B参数原子基础模型Elements,判断超导性AUC达0.996,预测临界温度平均误差小于1K。AI仅用28个GPU小时筛选240万晶体结构,预测出6.8万个候选材料,其中4种(Hf₂₁Re₂₅、Zr₄VRe₇、HfZrRe₄、Zr₃ScRe₈)已合成并验证超导性,临界温度最高6.5K。全部240万稳定晶体数据库已开放。 智能体 arXiv 数据/训练 论文/研究 推荐理由: 我认为这是 AI for Science 的标志性突破,AI 智能体第一次从头设计并实验证实了全新的超导材料,把 AI 角色从辅助推到「独立发现」,对做材料模拟和科学发现的团队是个转折点。

智能体 arXiv 数据/训练 论文/研究
AI HOT ·

表示分布匹配(RDM)用于一步视觉生成

11:34 HuggingFace Daily Papers(社区热门论文) 精选 74 表示分布匹配(RDM)通过匹配冻结预训练编码器下的生成与参考特征分布来训练一步图像生成器。三个发现:经典MMD正确估计后成为可扩展目标;生成批次大小最优超过2048;单一表示可被欺骗,需匹配平衡编码器组合并采用独立于训练损失的SW_r14评估。改进的iRDM在ImageNet上以SW_r14 1.30达一步生成SOTA,PickScore在71.2%样本上偏好iRDM。该方法将四步FLUX.2后训练为一步生成器,在GenEval(0.826对0.794)和PickScore(22.76对22.58)上超越原版,仅需90 H200 GPU小时。 图像生成 论文/研究 推荐理由: 这篇论文把MMD重新变成了一流的一步生成目标,用多编码器匹配防止作弊,并把FLUX.2四步模型浓缩成一步,性能不降反升,90 GPU小时就能复现,做视觉生成的人应该仔细看。

图像生成 论文/研究
AI HOT ·

Program-as-Weights:一种面向模糊函数的编程范式

10:34 HuggingFace Daily Papers(社区热门论文) 精选 74 Program-as-Weights (PAW) 提出模糊函数编程范式,将自然语言描述的函数编译为紧凑、可本地执行的神经制品。PAW 使用在 10M 示例数据集 FuzzyBench 上训练的 4B 编译器,为冻结的轻量级解释器输出参数高效适配器。0.6B 的 Qwen3 解释器执行 PAW 程序性能匹敌直接提示 Qwen3-32B,推理内存仅约五十分之一,在 MacBook M3 上达 30 tokens/s。该方法将基础模型从每次输入的求解器重新定义为工具构建器,一次函数定义后生成的制品可离线廉价复用。 推理 数据/训练 论文/研究 部署/工程 推荐理由: 这篇论文把模糊任务从调用大模型API变成了本地轻量函数,0.6B就能跑赢32B,省掉几十倍成本。对需要处理日志、JSON修复等经常性模糊任务的开发者是个真信号。

推理 数据/训练 论文/研究 部署/工程