标签

Airbnb

用评测驱动生成式 AI 开发:从实验原型走向规模化交付

来源: medium.com 22
生成式 AI 应用最危险的阶段,往往不是模型完全不可用,而是演示效果不错、上线后却无法稳定回答真实问题。传统软件可以用确定性断言判断对错,LLM 输出则同时受到提示词、模型版本、采样参数、上下文和外部工具影响。要控制这种不确定性,评测不能等到发布前才补做,而应成为需求、开发、发布和线上监控共同依赖的工程基础。 由于来源摘要未提供具体实验数据,下面不把任...

从旅客完整旅程中学习:如何构建更懂用户的 Airbnb 搜索个性化

来源: medium.com 21
住宿搜索的难点不只是找出“质量最高”的房源,而是判断某位旅客在当前阶段最可能需要什么。来源没有提供技术摘要,因此无法确认 Airbnb 实际采用的模型、特征或系统架构。仅从标题可以确定一个重要方向:个性化搜索不应只观察当前查询,还要从旅客跨越发现、比较、收藏、预订与入住的完整旅程中学习。 同一句“东京住宿”,在不同旅程阶段可能表达完全不同的需求: 刚开...

把 LLM 评测从数周压缩到一天:一条可持续迭代的工程路径

来源: medium.com 29
LLM 应用真正拖慢迭代的,往往不是模型调用本身,而是准备数据、批量执行、人工复核和汇总结果之间的等待。来源标题给出了一个鲜明结果:评测周期从数周缩短到一天。由于摘要没有披露具体实现,下面不推测原团队的技术栈,而是给出一套可以这样实践的工程方案:让评测集可版本化,让任务并发执行,让失败能够恢复,并把人工判断集中在最有价值的样本上。 一次完整评测通常由多...