标签

LLM

让编码代理拥有你真正掌控的记忆

来源: huggingface.co 24
编码代理可以读取代码、执行命令、修改文件,甚至持续参与一个跨多天的开发任务。但如果每次会话结束后,代理都忘记项目约定、失败原因和关键决策,它就很难从一次性工具变成稳定的工程伙伴。 “给编码代理一份你拥有的记忆”,核心不是简单地把更多文本塞进上下文,而是把记忆从临时会话中抽离出来,存放在开发者能够查看、修改、备份和删除的位置。这样,代理的行为才不会完全依...

用 100 个 GRPO 步骤,让 3.5 亿参数模型更可靠地产生结构化输出

来源: huggingface.co 27
结构化输出的难点通常不在“能不能生成 JSON”,而在于模型能否持续遵守约束:字段完整、类型正确、枚举值合法,并且在输入稍微变化后仍然稳定。这个实验的核心思路,是围绕一个 3.5 亿参数模型设计专门的结构化输出奖励,再用 100 个 GRPO 步骤快速验证微调是否有效。 这里的 100 步更像一个小规模实验预算,而不是适用于所有任务的固定结论。它的价值...

GPT-6 Astra 达到关键级网络能力后,应用团队该如何设计安全边界

来源: openai.com 23
GPT-6 Astra 被描述为目前能力最强、已广泛部署的模型,也是首个在 Preparedness Framework 下达到网络安全能力“关键级”(Critical)的模型。对应用团队来说,这不只是模型能力榜单上的变化:当模型能够更有效地分析系统、生成代码并协助执行复杂任务时,权限控制、人工审批、审计和事件响应都必须成为产品架构的一部分。 这里需要...

Kubernetes v1.37:让 HPA 真正把工作负载缩容到零

来源: kubernetes.io 29
Kubernetes v1.37 将 HPA 缩容到零副本推进到 Beta,并默认启用。对于队列消费者、批处理器这类并非持续接收 HTTP 请求的工作负载,空闲时可以不保留任何 Pod,有任务到来时再自动拉起。 这项能力减少了空闲资源消耗,尤其适合预留专用 CPU 或 GPU 的 Pod。但它也带来明确代价:从零恢复需要重新读取指标、调度 Pod、启动...

从 .NET 代码到可搜索架构图:用 Amazon Bedrock AgentCore 构建自动化文档流水线

来源: aws.amazon.com 37
架构文档最容易在代码变更之后失效。全球银行间经纪商面对的是规模较大的 .NET 代码库、多个团队和持续交付流程,手工维护系统上下文、组件关系和设计说明很快就会变成负担。 一种更可持续的做法,是把架构文档当成软件交付产物:从代码仓库读取事实,用 Amazon Bedrock AgentCore 承载分析代理,生成架构图和说明文档,再通过 Amazon B...

用 Amazon Bedrock 构建面向残障学生的多智能体过渡规划系统

来源: aws.amazon.com 29
对残障学生而言,从学校走向高等教育、职业培训或就业,不只是生成一份普通的学习计划。规划过程需要理解学生的能力、兴趣、支持需求和家庭意见,还要符合美国《残障人士教育法案》(IDEA)中的过渡规划要求。Trinity 的案例展示了一个重要方向:把对话式 AI 从单一问答工具扩展为基于 Amazon Bedrock 的无服务器多智能体系统,为美国各地学区生成...

用 Mantis 构建可复现、可验证的 AI 漏洞发现流程

来源: cloud.google.com 35
AI 模型已经能够在较少人工协助的情况下发现并利用软件漏洞,但“能指出可疑代码”距离“确认真实漏洞并修复”仍有很大差距。Google 开源的 Mantis 将漏洞发现、分诊、复现和修补组织成一套可自动化的流程,重点解决 AI 扫描中常见的误报、缺少上下文和修复不可验证等问题。 单纯让 AI 阅读代码,容易得到看似合理却无法复现的漏洞报告。来源摘要提到,...

企业级 AI Agent 成本优化:从模型选择走向上下文工程

来源: azure.microsoft.com 23
企业级 AI Agent 的成本,通常不只取决于调用了哪个模型。随着 Agent 接入企业知识库、外部工具和长期记忆,检索内容过多、工具选择不准、历史上下文膨胀以及重复推理,都会持续推高 token 消耗和响应延迟。 上下文工程的核心,是让 Agent 在每一步只获得完成当前任务所必需的信息。Microsoft Foundry 相关实践将成本优化延伸到...