标签

LLM

Agent 的"天赋"与"技能":两种能力模型的架构抉择

来源: oschina.net 27
当我们谈论 AI Agent 的能力时,很容易把所有能力混为一谈。但 Solon AI 提出的 Talents(才能)和 Claude Code 定义的 Skills(技能),实际上代表了两种截然不同的能力获取模型。理解这个区别,直接影响你设计 Agent 的架构决策。 Claude Code 的 Agent Skills 强调的是运行时学习。Agen...

How Preply combines AI and human tutors to personalize learning

来源: openai.com 39
{ "title_zh": "Preply 如何用 OpenAI 为每节课生成个性化摘要与练习", "body_zh": "在线语言学习平台 Preply 最近把 OpenAI 的能力嵌入到课后流程里:每次一对一课程结束后,系统自动生成学习摘要、个性化反馈和针对性练习题。这意味着学员不再只靠记忆回顾课堂内容,而是拿到一份结构化的"课后报告"。\n\n#...

用 MCP + Agentic AI 在代码审查中自动对齐安全需求与实现

来源: dropbox.tech 46
安全设计文档写得很完整,代码提交时却悄悄偏离——这是很多团队的真实痛点。威胁模型在 Confluence 里沉睡,PR 里的实现早已走了另一条路。Dropbox 近期公开了他们的做法:用 MCP(Model Context Protocol)把 Dash 内部的安全知识喂给 Agentic AI,让 AI 在代码审查阶段主动比对设计意图与实际代码,把"...

用 Agent-EvalKit 系统化评估你的 AI Agent

来源: aws.amazon.com 41
AI Agent 越来越多,但"它到底好不好用"这件事,大多数团队还在靠手动试几个场景、凭感觉判断。Agent-EvalKit 这个 Apache 2.0 开源工具包,试图把 Agent 评估从"拍脑袋"变成"有流程、有数据、可复现"的工程实践。它已经对接了 Claude Code、Kiro CLI、Kilo Code 等主流 AI 编码助手,并提供了...

智能体驱动的 E2E 测试:不是替代,而是新的一层

来源: slack.engineering 33
端到端测试一直有个矛盾——写得太死,跟不上产品变化;写得太活,又没法稳定复现。AI Agent 进入测试栈后,这个矛盾有了新的解法,但也带来了新的混淆:Agent 该替代传统测试,还是叠加在上面?一支团队跑了 200 多条 agentic E2E workflow,用 Playwright MCP、Playwright CLI 和 Agent 自动生成...

Dapr 1.18:给分布式工作流和 AI Agent 加上"不可伪造"的执行凭证

来源: cncf.io 35
云原生生态花了多年时间解决分布式系统的韧性问题——请求重试、故障恢复、工作流崩溃续跑,这些已经成了基础设施的标配。但一个更棘手的问题长期被搁置:你怎么证明一段执行确实发生了,而且没有被篡改? 当 AI Agent 自主调用外部 API、当工作流跨越多个服务编排长链路业务,"信任执行结果"变得和"保证执行不中断"一样重要。Dapr 1.18 引入的 Ve...

用 Apache Burr 给 AI Agent 加上状态追踪与持久化

来源: oschina.net 40
AI Agent 从 demo 走向生产,最大的坑不是模型能力不够,而是你很快会发现:对话状态散落各处、决策路径无从回溯、用户断线重连后历史全丢。Apache Burr(目前处于 Apache 孵化阶段)就是来填这些坑的——它用一套零依赖的 Python 库,把 Agent 的状态机、执行追踪和持久化做成一件可以直接上手的事。 写一个能跑的 Agent...

AI助手和AI智能体不是同一物种——Perplexity与哈佛的对比实验揭示了什么

来源: oschina.net 28
你问ChatGPT"帮我分析这份财报",它给你一段文字摘要和几条建议。你还得自己打开Excel、拉数据、做图表、写邮件。但如果换成一个真正的AI智能体,它会把财报下载、解析、制图、起草邮件,最后把成品推到你面前——你只需要说"发送"。 Perplexity与哈佛商学院研究团队的最新论文,首次在实际部署场景中对这两种模式做了全面比较。研究对象是Perpl...

当 LLM 能写对账代码,十年领域经验还值多少钱?

来源: oschina.net 29
一位做了十年金融支付系统的工程师突然发现:自己花数年积累的 PCI 合规知识、双复式记账逻辑、银行转账幂等性设计,现在 Claude 和 GPT-4 也能在几分钟内给出相当不错的实现。这种冲击不是幻觉——它正在真实地改变"领域专家"的议价能力。 过去,一个支付系统的核心价值在于工程师对业务规则的深度理解。比如"双复式记账"听起来简单,但真正在支付系统里...

Claude Desktop 的 1.8GB 内存黑洞:Windows 用户到底遇到了什么

来源: oschina.net 39
Anthropic 的 Claude Desktop 本该是本地 AI 助手的优雅入口,但最近 Windows 社区里炸了锅——应用刚启动,还没聊一句话,内存占用就飙到 1.8GB。这不是偶发 bug,而是和 Claude Cowork、Agent 模式绑定的底层机制在悄悄"吃资源"。macOS 用户似乎没受同等影响,问题显然和 Windows 平台的...