标签

云平台

监督微调进阶:用学习曲线、数据筛选与混合策略提升训练集价值

来源: aws.amazon.com 41
监督微调的数据准备并不止于清洗格式和删除重复项。进入进阶阶段后,更重要的问题是:现有数据是否足够、下一批数据应该补什么、合成样本是否真的有增益,以及如何加入新能力而不让模型遗忘原有能力。 这些问题不能只靠数据量回答。更可靠的方法是把学习曲线、子集选择、合成与蒸馏数据、数据源混合放进同一个迭代闭环,并始终用独立评测集验证结果。 学习曲线的做法很直接:从训...

监督微调数据准备:从格式校验到高质量评测集

来源: aws.amazon.com 45
监督微调(SFT)的效果上限,往往在训练开始前就已经确定了。模型并不会自动修复含糊的指令、错误的答案、混乱的对话结构或不一致的工具调用格式;它只会尽可能学习数据中反复出现的模式。 因此,数据准备不应被看成把几段文本转换成 JSONL 的机械步骤,而应当包括质量检查、统一格式、明确推理与工具调用结构,以及构造有代表性的训练集和评测集。 高质量 SFT 数...

用 Google Cloud Fault Injection Testing 把云端故障演练变成可重复实验

来源: cloud.google.com 34
数据库切换、可用区故障和网络路径抖动,往往不是架构图上最难的一部分。真正困难的是证明应用在这些事件发生时会按照预期工作。Google Cloud Fault Injection Testing(FIT)在预览阶段提供了原生的故障注入能力,让开发者和架构师可以用实验模板自动化定义故障、目标资源、持续时间和恢复动作。 在自建数据中心中,团队通常可以直接控制...

Uber 如何用应用感知网络提升可靠性,并为云迁移解除阻塞

来源: cloud.google.com 47
当数据分析、AI 工作负载和分布式应用不断把数据推向云端,网络链路就不再只是“带宽够不够”的问题。对 Uber 这样的全球化平台而言,真正的挑战是:在大规模数据传输制造拥塞时,如何保证订单、实时服务和其他关键业务流量仍然稳定运行。 Uber 与 Google Cloud 合作,成为 Cloud Interconnect 应用感知能力的早期设计伙伴。通过...

不改 Agent 逻辑,先用四个请求级杠杆压低运行成本

来源: azure.microsoft.com 27
Agent 成本优化不一定要从重写工作流、删减工具或修改推理步骤开始。来源摘要指出,Microsoft Foundry 提供了四个作用于每次请求的杠杆,而且这些优化可以发生在 Agent 逻辑执行之前。这意味着团队可以先在统一请求入口控制成本,再决定是否改动业务代码。 摘要没有列出四个杠杆的具体名称。下面不把某组产品配置冒充为原文结论,而是给出一种可以...

用声明式规格编排数据工作流:把数据集接入从处理代码中解耦

来源: infoq.com 44
数据平台接入一个新数据集,真正耗时的往往不是复制文件,而是反复确认字段、分类级别、处理步骤、质量规则和责任人,再把这些要求写进一套专用代码。AWS 介绍的规格驱动组合(specification-driven composition)换了一个切入点:用声明式规格表达意图,把实际处理交给可复用能力,并在执行前完成验证。AWS 报告称,这种方式可以把数据集...

AI 智能体时代的动态容量管理:预订、回退与资源切片

来源: cloud.google.com 46
企业开始把大量 AI 智能体接入业务系统,基础设施面对的已不只是推理流量增长。智能体会持续调用模型、数据库和内部应用,负载既消耗 GPU、TPU 等稀缺资源,又具有明显的突发性。若仍把应用绑定到单一机型、单一区域或整块加速卡,结果通常是两个极端:高峰期申请不到容量,低谷期则有大量资源闲置。 动态容量管理的核心不是无限扩容,而是把需求分成可预测与不可预测...

AI Agent 时代的 FinOps:让创新速度和成本边界同时可控

来源: cloud.google.com 33
AI Agent 开始承担持续运行、批量执行和多步骤协作的任务后,企业面对的成本问题已经不同于传统的软件订阅。业务用户可能每天稳定使用生产力工具,开发团队却可能在发布前集中运行大量代码 Agent,后台 Agent 还会在夜间持续消耗模型推理资源。只按“每个用户多少钱”来管理,往往看不见真实的运行成本,也很难在创新和预算之间取得平衡。 面向 Gemin...