AI HOT
·
2026-06-18 16:42
04:44 Claude:Blog(网页) 精选 65 Workload Identity Federation (WIF) 已在 Claude Platform 上全面可用。WIF 兼容任何 OIDC 身份提供者,覆盖所有 Claude API 端点(包括第一方 SDK 和 Claude Code)。WIF 用短生命期凭证替代静态 API 密钥,并引入服务账户,每个工作负载拥有独立身份、角色和审计日志。Claude Console 提供引导设置流程,支持 Admin API 进行组织管理。API 密钥可并行使用以便逐步迁移。 Anthropic 产品更新 部署/工程 推荐理由: 这个功能真正解决了企业在生产环境中用 Claude 的最大痛点,现在团队可以完全抛掉静态密钥,用现成的身份体系接入,安全审计也变得顺手。
Anthropic
产品更新
部署/工程
AI HOT
·
2026-06-18 15:24
5 4 信源 · 1天前
AI HOT
·
2026-06-18 15:24
4 4 信源 · 13小时前
AI HOT
·
2026-06-18 14:22
5 5 信源 · 1天前
AI HOT
·
2026-06-18 13:11
04:42 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 58 2026 年 6 月,OpenAI 联合 173 位博士级生命科学家发布 LifeSciBench 评测基准,涵盖 750 个真实研究任务,覆盖证据处理、分析、设计优化等七个工作流及七个生物领域。每项任务配有约 25 条细化评分标准(共 19,020 条),评估模型的科学正确性与实用价值。79% 的任务需多步推理,53% 要求解读图表、PDF 等附件数据,旨在衡量 AI 在复杂、不确定的研究任务中的实际能力,而非仅回答结构化问题。 OpenAI 论文/研究 评测/基准 关联讨论 1 条 X:OpenAI (@OpenAI) 推荐理由: OpenAI 这个基准请了 173 位博士级科学家出题,第一次把 AI 评估拉到真实科研决策里。结果很实在:前沿模型在需要结合复杂图表、设计实验的任务上仍然乏力,做 AI for Science 的团队值得拿来校准预期。
OpenAI
论文/研究
评测/基准
AI HOT
·
2026-06-18 12:00
4 5 信源 · 1天前
AI HOT
·
2026-06-18 10:44
04:12 GitHub Blog 精选 61 GitHub 推出一个新的仓库级数据集,采用 CC0-1.0 许可证,旨在帮助研究人员和开发者发现跨 README、Issue 和 Pull Request 的多语言开发者内容,加速多语言 AI 开发。 GitHub 开源/仓库 数据/训练 推荐理由: GitHub 发布了一个多语言开发者内容数据集,CC0 许可,对于训练跨语言代码模型和辅助翻译有直接价值,做多语言 Copilot 的团队应该会关注。
GitHub
开源/仓库
数据/训练
AI HOT
·
2026-06-18 10:44
04:13 AYi @ AYi_AInotes 精选 76 Matt Pocock(Total TypeScript 作者)开源了 skills v1,将技能描述的 Token 成本降低 63%。该工具包将技能分为模型可调用和用户可调用,新增 /codebase-design、/domain-modeling、/grilling 三项技能;重写 /writing-great-skills;将 /diagnose 更新为 /diagnosing-bugs 并改为模型可调用;新增 /ask-matt 路由技能,帮助 AI 自动判断时机触发合适工程流程。主推文评价其将 prompt 从咒语拆解为纪律性流程。 Matt Pocock : Announcing mattpocock/skills v1 - Achieved a 63% reduction in token cost for skill descriptions - Split skills into mode... GitHub MCP/工具 开源/仓库 编码 推荐理由: mattpocock 把资深工程师的编码流程拆成可复用的技能,Token 砍 63% 只是个结果,更有价值的是 AI 自触发技能的设计,vibe coding 进阶者必看。
GitHub
MCP/工具
开源/仓库
编码
AI HOT
·
2026-06-18 09:33
03:43 Replit ⠕ @ Replit 精选 69 Anthropic 产品更新 编码 推荐理由: Replit 打通了 Claude 设计到部署的闭环,虽然算不上技术突破,但对不会写代码的人来说,这是把想法直接变成应用的最短路径,值得一试。
Anthropic
产品更新
编码
AI HOT
·
2026-06-18 09:33
03:48 xAI:News(网页) 精选 61 6 月 17 日,xAI 宣布 Grok 4.3 在 Amazon Bedrock 上全面可用。该模型在前沿模型中达成最低幻觉率,支持 100 万 token 上下文窗口,并提供可配置推理努力(none/low/medium/high)。在 Artificial Analysis Omniscience 基准排名第一,在 Tau2 Telecom 基准评估客服智能体真实工具调用性能排名第一,在 Vals AI Case Law 和 Corporate Finance 基准的复杂文档理解任务排名第一。定价为输入每百万 token 1.25 美元、输出每百万 token 2.50 美元,每美元智能度是其他前沿模型的 2–10 倍。 xAI 推理 模型发布 推荐理由: Grok 4.3 登陆 Bedrock,把极低幻觉率和可配置推理带给了 AWS 用户,价格也摆在了 Pareto 前沿,不过本质上是一次渠道扩展而非模型突破,企业开发者可以尝鲜。
xAI
推理
模型发布
AI HOT
·
2026-06-18 08:22
01:36 MarkTechPost(RSS) 精选 77 Vercel 发布开源 AI 智能体框架 Eve(npm 包,Apache-2.0 许可)。Eve 采用文件系统优先设计:每个智能体对应一个磁盘目录,目录结构直接映射模型、指令、工具、技能、连接、子智能体等能力,无需额外注册代码。内置六大生产级能力:持久执行(每步检查点,崩溃后可恢复)、沙箱计算、人机审批、安全连接(支持 MCP 和 OpenAPI)、多通道(Slack、Discord、Teams 等)以及追踪与评估(OpenTelemetry)。Vercel 内部运行了上百个智能体,包括数据分析工具 d0(月处理超3万查询)、自动销售代理 Lead Agent(年费约5000美元、回报32倍)和支持智能体 Vertex(自主解决92%工单)。 智能体 产品更新 部署/工程 推荐理由: Vercel 把自己跑了 100 多个 agent 的框架开源了,用目录即契约的方式把耐久执行、沙箱、审批等全打包,对想在生产环境跑 agent 的团队是今年最务实的发布之一。
智能体
产品更新
部署/工程
AI HOT
·
2026-06-18 08:22
01:53 LMSYS:Blog(Chatbot Arena 团队) 精选 69 SGLang-JAX现已支持inclusionAI的Ling-2.6-1T(1T稀疏MoE,63B激活参数,256路由专家,top-8路由加共享专家)在TPU v7x上高效推理。团队开发了Fused MoE V2——一个融合scatter、专家FFN和gather的Pallas核,通过将MoE数据移动隐藏在计算中,使MoE预填充延迟从5.16ms降至2.42ms(降幅53%),解码核延迟从0.249ms降至0.211ms(降幅约15%)。仅替换MoE核即提升预填充吞吐量24.8%,解码吞吐量18.5%–35.3%。在SGLang解码基准测试中,16块TPU v7x芯片输出吞吐量达16块H200 GPU的1.29倍(mc=128)至1.77倍(mc=512)。完整上线还包含混合KV/循环内存池、GLA线性注意力和单控制器数据并行支持。 推理 论文/研究 部署/工程 推荐理由: 这是针对TPU上MoE推理的硬核优化复盘,用成本模型定位瓶颈,通过单内核融合把延迟砍半,对做大规模推理工程的团队是高质量参考。
推理
论文/研究
部署/工程
AI HOT
·
2026-06-18 08:22
02:36 Chubby♨️ @ kimmonismus 精选 79 Dario Amodei(Anthropic)与Demis Hassabis(Google DeepMind)在G7闭门会议上呼吁组建美国主导的联盟,为人工智能制定全球规则和标准。Amodei指出,该联盟应以前沿模型和硬件(包括芯片及其他关键组件)的访问权限为手段,将中国排除在外。这一主张被评论为高技术新冷战的开端,竞争方将从根本上被剥夺参与权。 Andrew Curran : Dario Amodei and Demis Hassabis called for a US-led coalition to determine the global standards and rules for AI in a cl... Anthropic DeepMind 政策/监管 现象/趋势 推荐理由: Dario 和 Hassabis 在 G7 闭门会上提出「排除中国」的 AI 联盟,这不是商业竞争而是地缘站队,AI 行业的「两个世界」格局可能从今天开始具象化。
Anthropic
DeepMind
政策/监管
现象/趋势
AI HOT
·
2026-06-18 08:22
08:13 Simon Willison 博客 精选 75 智谱(Z.ai)于6月13日向编码计划订阅者发布GLM-5.2,6月16日以MIT许可证开源完整权重。该模型为753B参数、1.51TB的MoE架构,40个活跃参数,纯文本输入,上下文窗口提升至100万token。在Artificial Analysis Intelligence Index v4.1上以51分领先,超越MiniMax-M3(44)、DeepSeek V4 Pro(max,44)和Kimi K2.6(43)。但每任务输出token消耗达43k,高于同类模型。Code Arena WebDev排行榜位列第二,仅次于Claude Fable 5。通过OpenRouter可获取,多数提供商定价$1.40/百万输入token、$4.40/百万输出token。实测生成SVG动画优秀,但负鼠SVG质量不及GLM-5.1。 图像生成 开源生态 模型发布 编码 推荐理由: Simon 实测 GLM-5.2,这个 753B 开源模型在基准上全面领跑,但生成 SVG 时鹈鹕完美、负鼠翻车——模型能力总在奇怪的地方露馅。 07:14 IT之家(RSS) 精选 70 库克:AI 浪潮引发存储芯片价格暴涨,iPhone 等苹果产品涨价已"不可避免" 苹果CEO库克确认,AI热潮导致存储芯片严重短缺和价格暴涨,苹果产品涨价已“不可避免”。库克未透露涨价具体细节。华尔街日报指出,全球AI巨头大幅增加资本开支,高带宽内存需求激增,挤压消费电子芯片供应。自2024年以来内存和存储芯片价格已翻四倍,涨势预计延续至2027年。研究机构估算,下一代iPhone 18 Pro售价或需增加约270美元。苹果已在上月提高Mac Mini起售价。摩根士丹利预测,今年美国智能手机和PC价格将上涨15%。 现象/趋势 行业动态 推荐理由: 存储芯片价格涨了四倍,从服务器的成本压力终于烧到了手机。库克这句「不可避免」比任何研报都实在,打算换机的人该有心理准备。 07:13 Hacker News 热门(buzzing.cc 中文翻译) 精选 78 泄露文件显示OpenAI年营收130亿但亏损远超收入 OpenAI 2025年营收130.7亿美元(2024年37亿),但研发成本达191.8亿(含向微软支付105.9亿),收入成本(推理计算)75亿,销售营销成本57.3亿,运营亏损209.2亿。2025年净亏损约390亿,扣除约300亿一次性会计费用后约80亿。2025年3月获1220亿融资(估值8520亿)。ChatGPT周活超9亿,付费约5000万。为控制成本已关闭Sora视频模型并削减非核心业务。 OpenAI 行业动态 推荐理由: OpenAI 的财务窟窿比想象的大,2025 年研发成本 191 亿,仅给微软的算力费就花了百亿,这
图像生成
开源生态
模型发布
编码
现象/趋势
行业动态
OpenAI
智能体
Anthropic
产品更新
部署/工程
Google
MCP/工具
教程/实践
论文/研究
评测/基准
GitHub
开源/仓库
数据/训练
xAI
推理
DeepMind
政策/监管
具身智能
语音
AI HOT
·
2026-06-18 07:11
00:08 Google Developers Blog(RSS) 精选 63 Agentic Resource Discovery(ARD)是一项开放规范,用于在Web上发布、发现和验证AI工具、技能与智能体。它基于两个原语:组织在其自有域名下托管catalog描述可用能力,registry作为搜索引擎索引catalog并响应发现请求。ARD支持加密验证,使客户端与端点连接前确认发布者身份,然后直接通过原生协议调用能力。Google Cloud的Gemini Enterprise Agent Platform通过Agent Registry提供企业级支持,包括URN命名、出站策略、工具固定和基于Agent Identity的信任验证。该规范现已发布,开发者可通过托管`ai-catalog.json`文件使其服务可发现。 智能体 Google MCP/工具 行业动态 关联讨论 1 条 Hugging Face:Blog(RSS) 推荐理由: 虽然才刚发布,但 ARD 有可能成为代理网络的“robots.txt”,做 agent 开发的都该看一眼,它解决的是跨组织发现和信任这个真问题。
智能体
Google
MCP/工具
行业动态
AI HOT
·
2026-06-18 07:11
00:32 TechCrunch:AI(RSS) 精选 76 Google推出首款专为Gemini打造的智能音箱Google Home Speaker,售价99.99美元。支持自然语言请求和多步指令,可在说话中途纠正,并具备连续对话功能。内置10种新声音。高级AI功能需订阅Google Home Premium(月费10美元或年费100美元),包括Gemini Live自由对话、Nest摄像头活动摘要等。即日起预售,本月发货。 Google 产品更新 语音 推荐理由: Google 终于把 Gemini 塞进了音箱,多步指令和自然纠错是亮点,但高级功能要订阅 Home Premium。普通用户会觉得方便,智能家居玩家可以观望,AI 从业者不会有多大惊喜。
Google
产品更新
语音
AI HOT
·
2026-06-18 07:11
00:35 Jim Fan @ DrJimFan 精选 81 NVIDIA GEAR实验室推出ENPIRE系统,首次实现物理世界自主研究。系统让8个Codex智能体控制8台机器人,配备GPU和token预算。安全方面采用硬运动极限切断和扭矩受限夹爪两层硬件保障,支持通宵无人运行。奖励函数通过视觉分类器离线固定并冻结,防止智能体作弊。实时监测机器人利用率(MRU)、token利用率(MTU)和GPU利用率,以Tokens-to-Success和Time-to-Success评估效率。ENPIRE自主完成扎带、整理细针、安装GPU等高精度任务,发现8机器人并行探索显著更快。系统将开源。 Jim Fan : Today, we enable AutoResearch in the physical world for the first time! Introducing ENPIRE: we give 8 Codex agents a fle... 智能体 具身智能 论文/研究 推荐理由: Jim Fan团队让8个机器人在真实世界自主研究,从安装GPU到发现物理扩展定律,这是具身智能第一次真正脱离人类监督探索物理任务,比任何虚拟环境的Agent实验都更接近AGI的物理锚点,做机器人的必须关注。
智能体
具身智能
论文/研究
AI HOT
·
2026-06-18 06:00
23:49 Yuchen Jin @ Yuchenj_UW 精选 77 智能体 开源/仓库 编码 推荐理由: Databricks 把内部用来协调多个 AI 编码代理的工具开源了,集合了 Claude Code、Cursor 等,做 agentic coding 的开发者值得上手试试,可能会改变我们组合使用 AI 工具的方式。 23:43 Hugging Face:Blog(RSS) 精选 69 MolmoMotion:语言引导的3D运动预测模型 MolmoMotion基于Molmo 2骨干网络,输入视频帧、物体上的3D点标记及文字动作指令(如“移动并旋转桌上放水果的木碗”),预测未来数秒内这些点的3D轨迹。提供两个变体:自回归的MolmoMotion-AR逐步预测坐标,流匹配的MolmoMotion-FM通过连续空间变换处理多可能性运动。同时发布MolmoMotion-1M数据集(含116万视频的3D点轨迹及动作描述)和PointMotionBench基准测试(2700个人工验证视频片段)。模型权重、数据集和基准测试均已开源。 Hugging Face 具身智能 多模态 模型发布 推荐理由: MolmoMotion把3D运动预测从模板化推到任意物体,百万级数据集和基准让研究门槛大降,做机器人和视频生成的值得认真看,但目前仍是研究阶段,离落地还有距离。 23:32 Google Blog:AI(RSS) 精选 55 Google 医学推理 AI 系统 AMIE 新研究:从诊断迈向长期疾病管理 今日发表在《自然》杂志上的研究展示了 Google 的医学推理 AI 系统 AMIE(Articulate Medical Intelligence Explorer)从单次诊断对话演进到长期疾病管理的能力。AMIE 利用 Gemini 模型的长上下文能力,整合共情对话智能体和深度思考管理推理智能体,可交叉引用数百页临床指南。在盲测中,AMIE 与 21 名初级保健医生相比,在整体管理推理上匹配临床医生,在计划精确性和指南一致性上得分显著更高。 Google 推理 论文/研究 推荐理由: Google 把医疗 AI 从一次诊断推到了长期疾病管理,Nature 上的对照实验显示它在计划精确性上甚至优于初级保健医生,做数字健康的人值得认真读一下。 22:08 Cloudflare Blog 精选 61 Cloudflare 发布 Cloudflare One stack:智能体驱动的部署工具集 6月17日,Cloudflare 推出 Cloudflare One stack,一组可直接赋予 AI 智能体的技能文件,用于自动配置、部署和管理 Zero Trust 环境。工具集包含两个轻量级 skill:`cloudflare-one` 负责通用产品指导(VPN 替换、网络连
智能体
开源/仓库
编码
Hugging Face
具身智能
多模态
模型发布
Google
推理
论文/研究
产品更新
部署/工程
视频
开源生态
OpenAI
行业动态
现象/趋势
端侧
xAI
数据/训练
政策/监管
GitHub
MCP/工具
Anthropic
安全/对齐
图像生成
Microsoft
大佬观点
Meta
DeepSeek
教程/实践
AI HOT
·
2026-06-18 04:29
22:08 Cloudflare Blog 精选 61 6月17日,Cloudflare 推出 Cloudflare One stack,一组可直接赋予 AI 智能体的技能文件,用于自动配置、部署和管理 Zero Trust 环境。工具集包含两个轻量级 skill:`cloudflare-one` 负责通用产品指导(VPN 替换、网络连接、安全策略等),`cloudflare-one-migration` 提供从 Zscaler、Palo Alto Networks 等厂商迁移的明确引导。技能内置决策树与结构化知识,智能体可自动执行云环境评估、网络拓扑生成及 Digital Experience Monitoring 排障。该 stack 基于 Cloudflare 员工数万小时客户经验提炼,降低学习与迁移门槛。 智能体 产品更新 部署/工程 推荐理由: Cloudflare把多年零信任迁移经验打包成agent技能,让AI直接帮你部署和管理安全堆栈,对正忙着切到Zero Trust的团队是个即插即用的省力工具,但仍是垂直领域的效率提升,不算广谱AI大事。
智能体
产品更新
部署/工程
AI HOT
·
2026-06-18 04:29
23:32 Google Blog:AI(RSS) 精选 55 今日发表在《自然》杂志上的研究展示了 Google 的医学推理 AI 系统 AMIE(Articulate Medical Intelligence Explorer)从单次诊断对话演进到长期疾病管理的能力。AMIE 利用 Gemini 模型的长上下文能力,整合共情对话智能体和深度思考管理推理智能体,可交叉引用数百页临床指南。在盲测中,AMIE 与 21 名初级保健医生相比,在整体管理推理上匹配临床医生,在计划精确性和指南一致性上得分显著更高。 Google 推理 论文/研究 推荐理由: Google 把医疗 AI 从一次诊断推到了长期疾病管理,Nature 上的对照实验显示它在计划精确性上甚至优于初级保健医生,做数字健康的人值得认真读一下。
Google
推理
论文/研究