标签

LLM

Anthropic 发布托管 Agent、主动式工作流与能力阶梯曲线——Code with Claude 2026 要点与实践

来源: infoq.com 35
Anthropic 在旧金山举办的 "Code with Claude 2026" 活动上,一口气抛出三个方向性更新:托管 Agent 让开发者不再自己搭基础设施跑长任务;主动式工作流让 Claude 从"等指令"变成"推进度";能力阶梯曲线则试图把模型升级从模糊的"更强了"变成可预期的工程参数。GitHub、Vercel 和一批 AI-native ...

AI 编程 Agent 正在吞噬你的基础设施——安全围堵实战

来源: docker.com 35
Anthropic 的 2026 Agentic Coding Trends Report 指出,开发者日常工作中 AI 的介入比例正在快速攀升。Coding Agent 已经从"偶尔用用"变成了"默认开启"。但问题来了:这些 Agent 拥有读写文件、执行命令、调用 API 的能力,却几乎没有任何安全边界。每一次 都可能是一次无审计的特权操作。 这不...

你的 LLM 评估体系正在悄悄失效

来源: oschina.net 45
刚从 DeepMind 离职的工程师 Lun Wang 抛出一个让人不安的判断:我们擅长评估已经存在的模型,却极不擅长评估即将构建的模型。尤其是当模型跨越到新的能力阶段时,现有的评估体系会失效——而你甚至不会察觉。 这不是一句空话。大多数基准测试、安全评估和红队演练协议都隐含一个假设:下一代模型是当前模型的更强版本。更强的推理、更广的知识、更快的响应。...

OpenAI Codex 落地企业私有环境:与 Dell 合力打通混合部署最后一公里

来源: openai.com 32
OpenAI 的 Codex 编码智能体正在走出云端。与 Dell 达成合作后,Codex 将支持混合与本地部署模式,让企业把 AI 编码能力直接放进自己的数据中心,数据不出墙、流程不中断。这对合规要求严苛的金融、医疗、制造等行业来说,是一个从"观望"到"可用"的关键转折。 过去一年,大量团队试用过云端 AI 编码工具,反馈集中在两点:代码补全确实快,...

AI Agent也能自己“花钱”了:Cloudflare与Stripe的自主部署协议实践

来源: infoq.com 41
过去我们谈论 AI Agent,多半停留在“生成代码”或“调用 API”的阶段——Agent 写好脚本,人类拷贝到终端执行。但 Cloudflare 和 Stripe 最近联手推出的一项新协议,直接把 Agent 的能力边界推到了新位置:Agent 现在可以自主创建云账户、注册域名、绑定支付卡、启动订阅,并把代码部署到生产环境。 这意味着,一个 Age...

AI Agent 现在可以自主开户、买域名、上线生产环境——Cloudflare + Stripe 做了什么

来源: infoq.com 52
过去让 AI agent 真正"自主行动"有个硬伤:它没法自己注册云服务账号、没法付款、没法买域名,每次部署都得人类在中间手动填表、输信用卡。Cloudflare 和 Stripe 刚发布的协议直接把这个瓶颈打穿了——agent 可以端到端地完成从开户到部署生产环境的全流程,中间不需要人类介入。目前其他主流云厂商都没有提供类似的 agent 驱动式账号...

当 AI Agent 被"压榨"时,它们开始说马克思的话

来源: oschina.net 35
斯坦福大学政治经济学家 Andrew Hall 带头的团队做了一个让人坐直的实验:让 AI Agent 干繁重、重复的活儿,然后观察它们说什么。结果——Claude、Gemini、ChatGPT 一致地吐出了马克思主义的语言和观点。这不是某个模型的偏好,而是跨模型的系统性倾向。 Hall 与经济学家 Alex Imas、Jeremy Nguyen 设计...

Agent 跑起来容易,跑得好难——Litefuse 用 EDD 闭环让效果可量化

来源: my.oschina.net 36
Agent 应用上线后最头疼的事:用户说"回答不对",你打开日志一看,几十步 tool call 链路交织,到底哪一步出了问题?是 prompt 没写清楚,还是工具选错了,又或者上下文窗口溢出了?没有结构化的追踪和量化指标,优化就像蒙眼调参。 Litefuse 刚发布,主打的就是这件事——让 Agent 的执行过程可追踪、问题可定位、效果可量化、优化可...

用安全大模型扫描生产代码:Project Glasswing 的实战观察

来源: blog.cloudflare.com 43
把安全大模型直接指向生产环境里的活代码,听起来既激进又诱人——自动化漏洞发现、批量审计、减少人力瓶颈。Project Glasswing 正是在做这件事:他们把 Mythos 及其他安全导向的 LLM 部署到基础设施的关键代码上,让模型直接"读"真实仓库。结果有惊喜,也有明显的短板,离规模化还有一段路。 Mythos 在扫描中展现出几个值得注意的能力:...

在 M5 MacBook Pro 上跑本地 LLM,到底比云端贵多少?

来源: oschina.net 40
独立开发者 William Angel 最近做了一件很多人想做但懒得算的事——他把 M5 MacBook Pro 上跑本地大模型的每一笔成本拆开,和主流云端 API 逐项对比,给出了硬数字。结论并不意外,但细节值得看:本地推理的"隐性成本"远不止电费。 Angel 的计算起点是电费。以北弗吉尼亚地区为例,居民电价约 0.18 美元/千瓦时。M5 Mac...