标签

Airbnb

Project Lighthouse 第三部分:用 project-lighthouse-anonymize 让数据脱敏可验证

来源: medium.com 42
当一个项目需要处理日志、工单、测试数据或用户反馈时,“把敏感字段删掉”通常只是起点。真正困难的是:哪些字段需要保护,脱敏后是否还能用于调试,以及团队能否稳定地重复这套处理流程。Project Lighthouse 的第三部分引入 ,主题可以概括为把匿名化从一次性的脚本动作,变成可审查、可测试、可接入流水线的工程能力。 删除邮箱、手机号和身份证号,确实能...

当模型终于学会放下疫情:我们如何判断 COVID-19 已经结束

来源: medium.com 48
判断 COVID-19 是否“结束”,并不只是看某一天的感染人数下降。更难的问题是:当世界的行为、数据分布和风险结构都发生变化后,过去训练出来的模型是否仍然在描述现实。 这个问题的关键不在于模型还能不能预测,而在于它是否还在用已经失效的经验预测。疫情期间形成的数据规律可能来自封控、口罩、检测政策、就医行为和媒体关注度。当这些条件改变,模型就必须学会放下...

用评测驱动生成式 AI 开发:从实验原型走向规模化交付

来源: medium.com 43
生成式 AI 应用最危险的阶段,往往不是模型完全不可用,而是演示效果不错、上线后却无法稳定回答真实问题。传统软件可以用确定性断言判断对错,LLM 输出则同时受到提示词、模型版本、采样参数、上下文和外部工具影响。要控制这种不确定性,评测不能等到发布前才补做,而应成为需求、开发、发布和线上监控共同依赖的工程基础。 由于来源摘要未提供具体实验数据,下面不把任...

从旅客完整旅程中学习:如何构建更懂用户的 Airbnb 搜索个性化

来源: medium.com 39
住宿搜索的难点不只是找出“质量最高”的房源,而是判断某位旅客在当前阶段最可能需要什么。来源没有提供技术摘要,因此无法确认 Airbnb 实际采用的模型、特征或系统架构。仅从标题可以确定一个重要方向:个性化搜索不应只观察当前查询,还要从旅客跨越发现、比较、收藏、预订与入住的完整旅程中学习。 同一句“东京住宿”,在不同旅程阶段可能表达完全不同的需求: 刚开...

把 LLM 评测从数周压缩到一天:一条可持续迭代的工程路径

来源: medium.com 43
LLM 应用真正拖慢迭代的,往往不是模型调用本身,而是准备数据、批量执行、人工复核和汇总结果之间的等待。来源标题给出了一个鲜明结果:评测周期从数周缩短到一天。由于摘要没有披露具体实现,下面不推测原团队的技术栈,而是给出一套可以这样实践的工程方案:让评测集可版本化,让任务并发执行,让失败能够恢复,并把人工判断集中在最有价值的样本上。 一次完整评测通常由多...