AI 产品的复杂体验,往往来自几种基础机制的组合。围绕“你需要知道的 AI 三种机制”这个主题,可以从工程视角把它们理解为:模型负责生成内容,系统负责检索事实,代理负责采取行动。理解这三层,有助于判断一个功能究竟应该依赖模型能力,还是应该补上数据与工具链。 生成机制的核心,是根据已有上下文预测接下来最可能出现的内容。对大语言模型来说,输入的问题、历史对...
AI 应用一旦进入真实流量场景,成本、延迟和稳定性往往不再只取决于模型本身。大量请求会重复使用相同的系统提示词、知识库片段、工具描述,甚至直接重复提问。理解不同层次的缓存,才能知道哪些内容可以复用、哪些内容绝不能缓存,以及缓存命中后如何避免返回过期或串租户的数据。 “AI 缓存”不是单一技术,至少可以拆成下面几类。 如果用户的问题、模型版本、系统提示词...
当 AI 训练、推理和数据处理开始争夺同一批 GPU,算力就不再只是采购问题,也变成了资源分配问题。谁能获得资源、等待多久、为此支付多少成本,都会影响个人、团队乃至组织参与技术创新的机会。讨论“资源、社会公平与算力”,真正值得工程师追问的是:公平能否从抽象原则变成可检查、可执行的系统规则? 传统调度器通常优化利用率、吞吐量或任务完成时间。这些指标很重要...