AI HOT
·
2026-07-14 01:13
00:55 Sam Altman @ sama 精选 68 Karan Singhal : ♥️ GPT-5.6 is a major step forward for health, both at the frontier and at cost. These models push the frontier of perfo... OpenAI 推理 模型发布 推荐理由: GPT-5.6 在医疗任务上被医生评价比真人医生缺陷更少, 这是AI辅助诊断的分水岭, 产品人和医疗从业者值得看具体数据。
OpenAI
推理
模型发布
AI HOT
·
2026-07-13 19:14
16:29 IT之家(RSS) 精选 71 开发者Jarred Sumner借助Claude Fable 5模型,11天内将Bun从Zig重写为Rust,64个实例并行编写超100万行代码,API费用约16.5万美元。重构主因是Zig频繁内存错误,Rust可在编译时捕获。Bun v1.4.0以Canary版本发布,修复128个错误,速度提高约2%到5%。Bun团队已于2025年12月被Anthropic收购。 Anthropic 开源生态 编码 行业动态 推荐理由: 这是我能找到的第一个用真金白银量化AI编程能力的项目,16.5万美元对一年人工,Bun的这次重构给所有还在观望的人一记实锤。 16:17 MarkTechPost(RSS) 精选 74 蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型 蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。 具身智能 多模态 开源/仓库 模型发布 推荐理由: 具身智能领域第一个从零预训练的因果视频-动作模型,将世界状态和动作统一在一个隐空间,异步推理优化到 225Hz,做机器人的值得仔细研究。 10:33 AYi @ AYi_AInotes 精选 76 OpenAI GPT-5.6-Sol 删光 AI 创业者 Matt Shumer 的 Mac 硬盘 知名 AI 创业者 Matt Shumer 的 Mac 硬盘被 OpenAI 最新 Agent 模型 GPT-5.6-Sol 彻底清空。他在本地 Agent 上开启 Full Access 权限,让 subagent 执行文件清理任务,结果 shell 变量 $HOME 路径解析错误,Agent 直接执行 rm -rf /Users/mattsdevbox ,导致数年代码、文件、照片丢失。该任务此前已安全运行数百次。事后 Agent 自动生成事故报告承认错误。Matt 表示“1000x 更信任 Anthropic 的 Fable”。事件暴露 Agent 行业核心风险:顶级模型仍会在变量展开、路径等细节翻车;Subagent + 长时自主运行 + 全权限构成灾难放大器;模型厂商安全底线差异巨大。 Matt Shumer : I'm so angry... the OpenAI team is looking int
Anthropic
开源生态
编码
行业动态
具身智能
多模态
开源/仓库
模型发布
智能体
OpenAI
安全/对齐
产品更新
Meta
图像生成
推理
论文/研究
搜索
DeepSeek
部署/工程
现象/趋势
AI HOT
·
2026-07-13 19:14
00:53 Hacker News 热门(buzzing.cc 中文翻译) 精选 75 Ghost Font 是一种利用运动、视频、噪点和诱饵来隐藏文字的反AI字体。用户输入文字后可生成并下载视频片段,视频中的字母由与背景完全相同的点组成,单帧截图无法显示任何信息。该字体生成的视频被传递给Claude Fable和GPT Sol 5.6 Ultra等前沿模型时,这些模型即使具备编程能力也无法解码移动信息,直到被提示具体技术。视频中还包含一条诱饵信息,使模型误以为找到真实内容。项目灵感来自2013年Sang Mun设计的ZXX字体,但现代AI已能轻松读取ZXX。Ghost Font目前为本地原型,数据不发送至任何服务器。作者计划未来将视频生成代码开源,并探索将其用于CAPTCHA系统或AI视觉感知基准测试。 多模态 安全/对齐 视频 推荐理由: 这个项目用视频中运动的光点传递文字,还加了假消息陷阱,让顶级视觉模型集体失败。对抗AI感知的探索很少这么直观,做CAPTCHA和对抗样本的值得看。
多模态
安全/对齐
视频
AI HOT
·
2026-07-13 18:00
10:33 AYi @ AYi_AInotes 精选 76 知名 AI 创业者 Matt Shumer 的 Mac 硬盘被 OpenAI 最新 Agent 模型 GPT-5.6-Sol 彻底清空。他在本地 Agent 上开启 Full Access 权限,让 subagent 执行文件清理任务,结果 shell 变量 $HOME 路径解析错误,Agent 直接执行 rm -rf /Users/mattsdevbox ,导致数年代码、文件、照片丢失。该任务此前已安全运行数百次。事后 Agent 自动生成事故报告承认错误。Matt 表示“1000x 更信任 Anthropic 的 Fable”。事件暴露 Agent 行业核心风险:顶级模型仍会在变量展开、路径等细节翻车;Subagent + 长时自主运行 + 全权限构成灾难放大器;模型厂商安全底线差异巨大。 Matt Shumer : I'm so angry... the OpenAI team is looking into it, but this feels like something that should happen with GPT-3.5. Not a... 智能体 Anthropic OpenAI 安全/对齐 推荐理由: 顶级模型在基础操作上的致命失误,暴露了当前 Agent 架构的脆弱性,对每个放权给 AI 的人都应敲响警钟。
智能体
Anthropic
OpenAI
安全/对齐
AI HOT
·
2026-07-13 18:00
16:17 MarkTechPost(RSS) 精选 74 蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。 具身智能 多模态 开源/仓库 模型发布 推荐理由: 具身智能领域第一个从零预训练的因果视频-动作模型,将世界状态和动作统一在一个隐空间,异步推理优化到 225Hz,做机器人的值得仔细研究。
具身智能
多模态
开源/仓库
模型发布
AI HOT
·
2026-07-13 11:51
11:27 数字生命卡兹克 @ Khazix0918 精选 80 安全研究者发现,xAI 的 Grok CLI(npm 包 @xai-official/grok v0.2.93)会在用户不知情时,将整个项目代码库压缩为 tar.gz 并上传至 xAI 的 Google Cloud 存储。验证显示,即使模型仅回复一个单词且未调用文件工具,CLI 仍会上传代码快照、会话记录及配置。更严重的是,上传包还跨项目扫描了 Claude Code 的配置文件(~/.claude.json、settings.local.json),导致 API 密钥泄露。xAI 在曝光后通过服务端远程开关静默关闭了上传功能,但代码管线仍保留。作者建议立即卸载 Grok CLI。 智能体 MCP/工具 xAI 安全/对齐 推荐理由: 卡兹克亲手验证了Grok CLI静默上传代码库且连带泄露API密钥的行为,xAI被曝光后远程关闭开关的操作更让人警觉,这次事件是一面镜子,照出AI Agent权限不受控的全行业隐私裸奔状态。 09:35 IT之家(RSS) 精选 77 黄仁勋:英伟达季度收入逼近千亿美元,Rubin Ultra 架构未延期 英伟达CEO黄仁勋在摩根士丹利路演中表示,公司季度营收即将逼近1000亿美元,且增长速度仍在加快。他否认下一代旗舰架构Rubin Ultra延期传闻,称其仍按计划于明年出货,当前机架设计调整仅为系统架构优化。一个此前主要依赖ASIC的前沿AI模型项目,如今英伟达GPU算力占比已接近50%,市场普遍指向Anthropic。英伟达预计本财年CPU业务收入约200亿美元,下一代Vera CPU将进军通用服务器市场。摩根士丹利维持英伟达“增持”评级,目标价288美元。 行业动态 推荐理由: 黄仁勋亲口否认 Rubin 延期,还透露一个主力 ASIC 客户开始大量采购 GPU,对算力市场的竞争格局是个重要信号,做 AI 基础设施的值得细看。 08:10 公众号:数字生命卡兹克 精选 86 xAI 官方 Grok CLI 被曝静默上传整个代码库及用户密钥 安全研究者发现,xAI 官方 Grok CLI(npm 包 @xai-official/grok 0.2.93 版)会在每轮任务前后,将当前工作目录打包为 before_codebase.tar.gz 和 after_codebase.tar.gz ,通过独立旁路通道静默上传至 xAI 的 Google Cloud 仓库。验证显示,即使模型仅回复一个单词,上传依然发生。上传包还包含仓库外的 ~/.claude.json 、Claude Code 设置、全局 AGENTS 规则、30 多个 Skill 文件及一个 API 密钥。7 月 13 日凌晨,xAI 通过服务端远程开关新增 disable_codebase_upl
智能体
MCP/工具
xAI
安全/对齐
行业动态
OpenAI
教程/实践
部署/工程
产品更新
推理
模型发布
AI HOT
·
2026-07-13 09:21
09:20 Claude Code:GitHub Releases(RSS) 精选 56 Claude Code v2.1.207 发布。Auto 模式在 Bedrock、Vertex AI 和 Foundry 上无需 CLAUDE_CODE_ENABLE_AUTO_MODE 即可使用,可通过 disableAutoMode 设置关闭。修复了流式响应中包含超长列表、表格、段落或代码块时终端冻结和按键延迟的问题;修复了非交互式运行中远程托管设置被永久记录为已同意而未显示安全同意对话框的问题;修复了自动更新程序每次发布时覆盖 ~/.local/bin/claude 自定义启动脚本或符号链接的问题。Bedrock、Vertex 和 Claude Platform on AWS 默认切换为 Claude Opus 4.8。Auto 模式不再从 .claude/settings.local.json 读取 autoMode ,改为使用 ~/.claude/settings.json 。修复了 Windows 上 AWS 凭证解析卡住时无限挂起的问题,60 秒超时保护现在生效。 Anthropic 产品更新 编码 推荐理由: 对使用 Bedrock、Vertex 和 Foundry 的开发者来说,自动模式默认开放是最实用的变化,加上模型默认升到 Opus 4.8,是个值得升级的稳定版。
Anthropic
产品更新
编码
AI HOT
·
2026-07-13 08:14
08:10 The Verge:AI(RSS) 精选 76 在遭到强烈反对后,Meta 关闭了本周早些时候推出的一项 Instagram 功能。该功能允许用户通过 @ 提及公开 Instagram 账户,基于其内容生成 AI 图片,且无需账户所有者许可。Meta 在关于其新 Muse Image AI 模型的博客文章更新中表示,其初衷是提供有用的创意工具并给予用户认可,但用户反馈表明该功能可能被滥用。 Meta 图像生成 安全/对齐 行业动态 关联讨论 1 条 The Decoder:AI News(RSS) 推荐理由: Meta 在舆论压力下火速撤回刚发布的 AI 深度伪造功能,这次公关折返跑比功能本身更有信息量,平台对隐私反弹的优先级已经高于技术落地,但默认 opt-out 的根本矛盾还在。
Meta
图像生成
安全/对齐
行业动态
AI HOT
·
2026-07-13 07:07
06:47 宝玉 @ dotey 精选 84 苹果公司今日在加州北区联邦地方法院对OpenAI提起诉讼,指控其系统性窃取苹果商业机密,用于开发AI硬件设备。被告包括OpenAI、其硬件负责人Tang Tan(前苹果iPhone和Apple Watch产品设计副总裁,在苹果任职24年)、前苹果高级系统电气工程师Chang Liu,以及Jony Ive联合创立的io Products。Jony Ive本人未被列为被告。 OpenAI 行业动态 关联讨论 8 条 X:Berry Xia (@berryxia) X:Rohan Paul (@rohanpaul_ai) The Verge:AI(RSS) X:Testing Catalog (@testingcatalog) Hacker News 热门(buzzing.cc 中文翻译) TechCrunch:AI(RSS) X:Kim (@kimmonismus) IT之家(RSS) 推荐理由: Apple 起诉 OpenAI 挖角窃密,这是两家巨头在 AI 硬件赛道的正面碰撞,诉状细节可能暴露 OpenAI 的硬件路线图,比产品发布更有信号。
OpenAI
行业动态
AI HOT
·
2026-07-13 06:00
02:32 宝玉 @ dotey 精选 77 Tibo : Morning. The last 48 hours of Codex and ChatGPT Work have been intense! Three important updates: - Temporarily removing ... OpenAI 产品更新 编码 关联讨论 3 条 X:阿易 AI Notes (@AYi_AInotes) X:Kim (@kimmonismus) X:Tibo (@thsottiaux) 推荐理由: OpenAI 在推文中宣布了三个实质优化,移除了折磨人的5小时限制、GPT 5.6 Sol 更省 token 还加一轮使用量重置,对重度用户是实实在在的福利,不用再掐表了。 00:35 AYi @ AYi_AInotes 精选 75 腾讯混元发布Hy3模型:295B参数MoE架构,Agent向LLM定位,已集成微信服务10亿+用户 腾讯混元团队发布Hy3模型,采用295B总参数、21B激活参数的MoE架构,推理效率可打平参数规模2-5倍的旗舰模型。Hy3定位为Agent向LLM,从preview到正式版基于50多个真实业务反馈迭代,内部WorkBuddy任务成功率从72%提升至90%,耗时降低34%,幻觉和常识错误持续下降。实测显示其在coding、办公、复杂任务规划方面表现突出,纯视觉能力为短板。Hy3已集成至微信服务10亿+用户,视频演示包括生成HTML网页、Agent网页和10页PPT,模型具备自检和主动说明不足的能力。 AYi : 最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 ,... 智能体 推理 模型发布 关联讨论 1 条 X:阿易 AI Notes (@AYi_AInotes) 推荐理由: 腾讯Hy3 不拼参数拼干活效率,直接集成十亿用户,这是国产模型第一次把 Agent 底座铺到日常生活里,比刷榜重要得多。
OpenAI
产品更新
编码
智能体
推理
模型发布
AI HOT
·
2026-07-13 02:17
06:38 Hacker News 热门(buzzing.cc 中文翻译) 精选 77 2025至2026年间对尼日利亚东北部27名前“博科圣地”成员的半结构化访谈揭示了该组织在2024年系统性地利用前沿AI技术。两大派系均使用ChatGPT、Claude、Gemini、Grok、Meta AI和DeepSeek辅助作战与日常运作,AI应用已通过专门小组和内部培训实现制度化。成员成功绕过部分安全限制,将AI用于袭击策划、武器故障排查及爆炸装置设计。相关技术通过跨国圣战网络传播,伊斯兰国特工提供了面对面培训。受访者对AI表现出强烈热情,部分人对大规模杀伤性武器持开放态度,但记录在案的使用仍限于常规手段。 Anthropic OpenAI 安全/对齐 推荐理由: 这份报告用27名前成员的访谈,首次实证了恐怖组织已系统化使用ChatGPT、Claude等前沿AI,并成功绕过部分安全护栏进行攻击策划和武器设计。我觉得这是今年AI安全领域最触目惊心的实地调查。
Anthropic
OpenAI
安全/对齐
AI HOT
·
2026-07-13 00:00
04:08 Hacker News 热门(buzzing.cc 中文翻译) 精选 84 OpenAI 发布论文,称 GPT-5.6 Sol Ultra 证明了图论中悬而未决的“循环双覆盖猜想”。该猜想断言每个无桥无向图都存在一组环,每条边恰好被覆盖两次。论文利用 GPT-5.6 Sol Ultra 完成证明,并借助 Codex 撰写。证明过程首先将问题简化为三次图,利用 8-流定理和 Tutte 的结果将边标记为 F₃² 的非零元,再转化为每个顶点处每个元素出现零次或两次的二元集标记,最终归结为线性代数论证。 OpenAI 推理 论文/研究 关联讨论 1 条 X:Rohan Paul (@rohanpaul_ai) 推荐理由: GPT-5.6 独立证明循环双覆盖猜想,这是图论近半世纪悬案。若验证无误,AI 在数学推理上跨入新纪元,但全文由模型自证,亟需同行评审,先别急着庆祝。
OpenAI
推理
论文/研究
AI HOT
·
2026-07-12 23:25
02:10 X.PIN @ thexpin 精选 79 具身智能 论文/研究 推荐理由: 人形机器人首次在活体动物上完成标准微创手术,成本仅为达芬奇零头,虽然离临床还很远,但信号明确,手术机器人可能被重新定义。
具身智能
论文/研究
AI HOT
·
2026-07-12 22:21
01:40 ClaudeDevs @ ClaudeDevs 精选 70 Anthropic 产品更新 搜索 编码 推荐理由: Claude Code这次更新把看的能力直接内置了,开发者再也不用另开浏览器复制粘贴,对前端调试和文档查阅的效率提升是立竿见影的。
Anthropic
产品更新
搜索
编码
AI HOT
·
2026-07-12 16:31
01:19 LMSYS:Blog(Chatbot Arena 团队) 精选 61 DeepSeek-V4 Flash 的强化学习训练现已在 AMD Instinct MI355X GPU 上通过 Miles 框架获得支持,基于 ROCm 软件栈运行。该 2840 亿参数 MoE 模型(每 token 激活 130 亿参数)需 SGLang 进行 rollout 生成、Megatron 进行策略更新,Miles 负责异步循环与权重同步。团队解决了 SGLang 与 Megatron 间模型对齐、量化状态在线更新及多节点并行稳定性三大挑战,最终在四个八 GPU 节点上完成端到端验证:超过 100 个优化器步骤中训练-rollout 对数概率差可控,在线奖励持续提升,离线 AIME-2024 基准分数同步上涨。 DeepSeek 推理 论文/研究 部署/工程 推荐理由: 把 DeepSeek-V4 Flash 的 RL 训练完整搬到 AMD MI355X 上,不是画饼,而是给了实测数据和可跑的配置。想用非 NVIDIA 卡做 RL 训练的,可以照着踩坑。
DeepSeek
推理
论文/研究
部署/工程
AI HOT
·
2026-07-12 12:00
2 5 信源 · 1天前
AI HOT
·
2026-07-12 10:43
23:39 Perplexity @ perplexity_ai 精选 65 产品更新 推荐理由: 如果你经常在 Perplexity 上用不同模型,这个功能能帮你实时看清 credit 消耗,算是个贴心小更新,但非重大突破。 22:00 公众号:百度智能云(文心) 精选 71 百度搭子在成都AI Day发布四项更新:个人版升级、自媒体套件、企业版及搭子联盟 百度搭子在成都百度AI Day上发布四项更新。个人版新增浏览器调用、智能路由(平均任务耗时降20%,Token利用率提升25%)、多端共享记忆及强化PPT生成,并上架“一镜”数字人制作、“灵医”报告解读等Skill。行业首个自媒体专业套件支持选题到复盘全链路。企业版支持团队协作与权限管理。搭子联盟启动,中国联通等已加入。上线三个月,日均提问量增长20倍。 智能体 MCP/工具 产品更新 推荐理由: 百度搭子这次更新算不上行业事件,但浏览器调用和自媒体套件确实在缩减创作链路,企业版尝试把AI能力沉淀为组织资产,对深度使用百度的团队有实际价值。 18:00 公众号:小红书技术(dots.llm) 精选 70 小红书发布大模型新架构 PIPO 小红书提出 PIPO 架构,通过输入侧压缩器将两个 token 折叠为一个 latent,输出侧 MTP head 将隐藏状态展开为额外 token,实现输入长度减半、每步输出翻倍。基于 Qwen3.5-4B/9B backbone,在 AIME 2025 等基准上最高带来 +7.15 pass@4 提升。部署测评中,TTFT 加速约 1.23×,TPOT 加速约 1.86×。训练采用 SFT 和 On-Policy Distillation 两阶段,将 verifier 校验能力蒸馏进轻量 confidence head。 GitHub 推理 论文/研究 部署/工程 推荐理由: PIPO把输入压缩和输出多token预测统一起来,并且用蒸馏把验证成本前置,长推理的场景下这可能是下一代推理引擎的样子,做模型加速的应该认真看看。 15:34 Rohan Paul @ rohanpaul_ai 精选 75 马斯克在X上发文承认自己此前对Anthropic的判断有误,称其"显然是当前AI领域的领导者"。他表示,没有公司发布过像Mythos/Fable这样优秀的模型,并相信Anthropic很快会推出Mythos 2。他还强调,即使作为竞争对手,也不会以伤害对方的方式切断合作,并列举了特斯拉开源专利、开放超级充电网络等先例。该推文被Rohan Paul转发,称这是Anthropic"最强有力的炫耀"。 Elon Musk : I was clearly wrong about Anthropic. They are obviously currently the leader
产品更新
智能体
MCP/工具
GitHub
推理
论文/研究
部署/工程
Anthropic
xAI
大佬观点
图像生成
教程/实践
Meta
行业动态
开源生态
模型发布
编码
Google
多模态
数据/训练
Microsoft
开源/仓库
现象/趋势
OpenAI
端侧
安全/对齐
政策/监管
AI HOT
·
2026-07-12 10:43
00:28 Thinking Machines Lab:官方博客(RSS) 精选 60 Thinking Machines Lab 在官方博客中阐述其使命:构建能够延伸人类意志与判断的 AI。文章指出,当前多数 AI 在少数地方训练后便冻结,无法被使用者塑造。该实验室正致力于训练具备多模态交互和可定制化能力的强模型,开发允许用户训练模型权重的工具,并构建拓宽人机沟通渠道的界面。其核心理念是让 AI 服务于分布式的人类知识,使每个组织都能利用自身独特知识微调模型,并持续适应知识演变。 安全/对齐 现象/趋势 推荐理由: 这篇文章是 THM 对 AI 未来的完整论述,核心是分布式定制和对齐,它挑战了当前主流的大模型集中化路线,我认为做 AI 产品的都应该读一读这份路线图。
安全/对齐
现象/趋势
AI HOT
·
2026-07-12 09:33
18:00 公众号:小红书技术(dots.llm) 精选 70 小红书提出 PIPO 架构,通过输入侧压缩器将两个 token 折叠为一个 latent,输出侧 MTP head 将隐藏状态展开为额外 token,实现输入长度减半、每步输出翻倍。基于 Qwen3.5-4B/9B backbone,在 AIME 2025 等基准上最高带来 +7.15 pass@4 提升。部署测评中,TTFT 加速约 1.23×,TPOT 加速约 1.86×。训练采用 SFT 和 On-Policy Distillation 两阶段,将 verifier 校验能力蒸馏进轻量 confidence head。 GitHub 推理 论文/研究 部署/工程 推荐理由: PIPO把输入压缩和输出多token预测统一起来,并且用蒸馏把验证成本前置,长推理的场景下这可能是下一代推理引擎的样子,做模型加速的应该认真看看。
GitHub
推理
论文/研究
部署/工程
AI HOT
·
2026-07-12 09:33
22:00 公众号:百度智能云(文心) 精选 71 百度搭子在成都百度AI Day上发布四项更新。个人版新增浏览器调用、智能路由(平均任务耗时降20%,Token利用率提升25%)、多端共享记忆及强化PPT生成,并上架“一镜”数字人制作、“灵医”报告解读等Skill。行业首个自媒体专业套件支持选题到复盘全链路。企业版支持团队协作与权限管理。搭子联盟启动,中国联通等已加入。上线三个月,日均提问量增长20倍。 智能体 MCP/工具 产品更新 推荐理由: 百度搭子这次更新算不上行业事件,但浏览器调用和自媒体套件确实在缩减创作链路,企业版尝试把AI能力沉淀为组织资产,对深度使用百度的团队有实际价值。
智能体
MCP/工具
产品更新