标签

LLM

Kimi K3 实战对标 Fable 5:开源模型为何能在 SWE-bench 上逼近商业模型

来源: oschina.net 36
关于大模型编程能力的讨论,正在从“哪家模型更聪明”转向更具体的问题:在真实软件工程任务里,模型能否稳定地修改代码、运行测试并提交可接受的补丁?Fireworks AI 的一组对照实验给出了一个值得关注的信号:在同一个 agent harness 中,Kimi K3 与 Fable 5 完成了 1030 个真实 agent 任务,开源模型在 SWE-be...

从数小时到 30 分钟:把 Codex 接入企业事件分析流程

来源: openai.com 35
NTT DATA Group 将 ChatGPT Enterprise 与 Codex 推广给约 9,000 名员工,并把事件分析时间压缩到 30 分钟。这个案例的关键不只是“让 AI 看日志”,而是把日志、代码、变更记录和安全边界组织成一条可重复执行的分析链路。 传统事件分析经常消耗在信息搬运上:值班工程师从监控平台复制错误,从代码仓库寻找对应模块,...

物理 AI 仿真的现状:从虚拟训练场到 Sim-to-Real 落地

来源: huggingface.co 42
物理 AI 的目标不是只在屏幕上生成答案,而是让机器人、自动驾驶系统和智能设备理解并作用于真实世界。仿真因此成为关键基础设施:它能低成本制造训练数据、复现危险场景,并在部署硬件之前验证控制策略。但仿真并不是现实世界的完美副本,真正困难的部分是判断哪些物理细节必须准确、哪些差异可以通过训练吸收。 由于来源摘要没有列出具体引擎、产品或评测数据,下面不把某个...

Android Studio Quail 2:并行 AI 会话如何重塑 Android 开发工作流

来源: infoq.com 33
Android Studio Quail 2 已进入稳定版。此次更新重新设计了 Gemini 的 Agent Mode,允许开发者在 IDE 内同时推进多个 AI 会话,并继续强化调试、性能分析与实验性功能探索能力。变化的重点不只是“多开几个聊天窗口”,而是让需求分析、代码修改、测试排错和性能调查不再被迫挤进一条上下文链。 在单会话模式下,开发者经常把...

ChatGPT 小企业计划发布:从 AI 培训到可控的业务自动化

来源: openai.com 39
OpenAI 推出 ChatGPT for Small Businesses 计划,目标是帮助创业者和小型企业建立 AI 技能、自动处理日常工作,并借助 ChatGPT Work 推动业务增长。对资源有限的团队来说,真正的价值不只是获得一个聊天工具,而是把重复、规则相对清晰的工作整理成可执行、可检查的 AI 流程。 小型企业常见的瓶颈往往集中在几个具体...

AlloyDB 如何绕过 PostgreSQL 缓冲区开销,让 pgvector HNSW 搜索提速 4 倍

来源: cloud.google.com 38
向量检索进入生产环境后,团队很快会撞上一道硬约束:提高 HNSW 的搜索深度可以改善召回率,却会消耗更多 CPU 和内存带宽;降低搜索深度能够提高 QPS,又可能让 RAG 漏掉关键文档。AlloyDB 预览中的列式引擎加速 HNSW,试图通过改变索引在内存中的访问方式,缓解这组速度与准确率之间的矛盾。 AlloyDB 是兼容 PostgreSQL 的...

CodeMender 预览:把漏洞扫描、可利用性验证和补丁生成串成一条流水线

来源: cloud.google.com 38
传统代码安全工具通常停在“发现问题”:扫描器产生告警,安全团队判断真假,开发者再编写补丁、运行测试并提交代码。CodeMender 的变化在于,它试图把扫描、漏洞验证、补丁生成和回归测试连接成一个由安全代理执行的闭环,同时保留开发者的最终审批权。 目前 CodeMender 处于预览阶段,可通过 Gemini Enterprise Agent Plat...

用 IAM Conditions 收紧 Google Cloud 权限:从管理员角色到 MCP 工具级控制

来源: cloud.google.com 41
Google Cloud IAM 的常规加固路径,是选择预定义角色或自定义角色,再沿组织、文件夹、项目和具体资源配置 Allow、Deny 策略。但当一个项目由多个团队或工作负载共享,或者服务不支持资源级 IAM 绑定时,仅靠“把角色绑定到更小的资源”并不足以落实最小权限原则。这时,IAM Conditions 可以继续约束角色在什么条件下生效。 以 ...

分析 1,192 次对话后:为什么智能体必须接入文档检索

来源: cncf.io 27
把智能体嵌进产品,只解决了“用户在哪里提问”的问题,并没有解决“智能体依据什么回答”。来源材料提到,一个部署类产品在 Web 应用中上线智能体,并分析了 1,192 次对话。这个场景揭示了一个关键工程事实:当问题涉及产品配置、部署状态和版本差异时,模型的通用知识远远不够,智能体需要在回答前检索产品自己的知识库。 用户不会总按文档标题提问。他们更可能输入...

面向智能体企业的平台工程:统一管理应用、资源与 AI Agent

来源: cncf.io 32
云原生时代的平台工程,最初解决的是 Kubernetes、微服务、GitOps 和分布式架构带来的交付复杂度。随着 AI Agent 进入企业应用,平台面对的对象不再只有容器、数据库和流水线,还包括模型、提示词、工具权限、知识源与运行时策略。平台工程正在从“提供基础设施自助服务”演变为“管理应用、资源和智能体的统一控制面”。 传统内部开发者平台通常围绕...