豆包手机助手消费者版本正式发布,并选择努比亚 NaviX Ultra 作为首个量产载体,于 9 月 16 日开售。相比 5 月上线的预览版,这次发布更值得关注的并不是聊天入口又多了一个,而是 AI 助手开始直接利用当前屏幕上下文,把一句自然语言要求转换为可执行的筛选和操作流程。
演示中的装修场景很典型:用户打开一张装修设计图,直接询问“根据这个装修风格,帮我选一个一米二以内、价格不超过一千元的柜子”。整个过程不要求截图、上传图片或切换应用。对开发者而言,这种体验背后真正困难的是上下文获取、约束提取、跨应用执行和风险控制的组合。
“看见屏幕”只是任务起点
传统聊天机器人通常只处理用户主动提交的文字或图片。手机助手则需要理解三个层次的信息:
- 当前对象:屏幕上是装修图、商品页、聊天记录,还是地图路线。
- 用户意图:用户是在询问、比较、搜索,还是希望助手继续执行操作。
- 明确约束:例如宽度不超过 1.2 米、价格不超过 1000 元,同时风格应与图片接近。
这意味着模型不能只生成一段听起来合理的回答。它需要把自然语言整理成结构化条件,再将条件交给搜索、商品目录或应用内操作能力。例如,上述请求可以抽象为:
{
"task": "search_product",
"category": "cabinet",
"visual_reference": "current_screen",
"constraints": {
"max_width_cm": 120,
"max_price_cny": 1000
},
"sort": ["style_similarity", "price"]
}
这里最关键的变化,是“当前屏幕”成为默认上下文。减少截图和应用切换,不只是少点几次按钮,也缩短了从产生需求到执行任务之间的路径。
量产手机带来的工程考验
预览版可以验证交互方式,量产载体则必须面对真实设备环境。努比亚 NaviX Ultra 的加入,意味着这类能力需要在消费者日常使用中处理权限、电量、网络、应用兼容性和异常恢复等问题。
一个可用的手机助手至少要区分三种动作:
- 只读动作:读取当前页面、总结内容、提取尺寸和价格。
- 可撤销动作:填写搜索条件、打开商品页、生成待发送文本。
- 高风险动作:发送消息、提交订单、支付或修改账户信息。
前两类动作可以追求连贯性,高风险动作则应停下来请求确认。否则,“帮我找一个柜子”很容易越界成“替我购买这个柜子”。对 Agent 产品来说,完成率并不是唯一指标,可见性、可撤销性和权限边界同样重要。
可以这样实践:先把约束过滤做成确定性步骤
下面是一个可直接运行的 Python 示例。它假设上游模型已经把屏幕内容和用户要求转换成结构化参数,再由普通代码完成尺寸、价格过滤和排序。示例不是豆包手机助手的官方接口,而是一种适合原型验证的工作流拆分方式。
将代码保存为 product_filter.py,使用 Python 3 运行即可:
from dataclasses import dataclass
@dataclass(frozen=True)
class Product:
name: str
width_cm: int
price_cny: int
style: str
style_score: float
products = [
Product("白橡木双门柜", 118, 899, "原木奶油风", 0.94),
Product("胡桃木边柜", 110, 999, "中古风", 0.71),
Product("藤编储物柜", 125, 799, "自然风", 0.88),
Product("极简烤漆柜", 100, 1299, "现代简约", 0.82),
]
constraints = {
"max_width_cm": 120,
"max_price_cny": 1000,
}
matches = [
item
for item in products
if item.width_cm <= constraints["max_width_cm"]
and item.price_cny <= constraints["max_price_cny"]
]
matches.sort(key=lambda item: (-item.style_score, item.price_cny))
for item in matches:
print(
f"{item.name}: {item.width_cm}cm, "
f"¥{item.price_cny}, 风格匹配度 {item.style_score:.0%}"
)
运行命令:
python3 product_filter.py
预期输出:
白橡木双门柜: 118cm, ¥899, 风格匹配度 94%
胡桃木边柜: 110cm, ¥999, 风格匹配度 71%
这种设计有两个好处:模型负责理解“像这张图”“一米二以内”等模糊表达,程序负责执行价格和尺寸等硬约束。即使模型给出的风格判断不够稳定,也不应该让超预算或尺寸超限的商品混入结果。
在真实系统中,还应保存每个条件的来源,例如尺寸来自用户原话,风格来自视觉模型,价格来自商品接口。这样当结果不符合预期时,系统能够解释究竟是识图、参数提取,还是商品数据出了问题。
上线前要守住的边界
屏幕上下文提高了便利性,也扩大了隐私和安全风险。手机屏幕可能同时包含验证码、联系人、医疗信息和公司内部数据。产品设计需要明确告知用户当前读取了什么,并对敏感页面采取更严格的限制。
落地时可以重点检查以下事项:
- 屏幕内容是否按任务最小化读取,完成后是否及时清理。
- 密码、验证码、支付信息等敏感字段是否默认屏蔽。
- 搜索、填写、发送和支付是否采用不同权限等级。
- 跨应用操作失败后,是否能停止并说明当前状态。
- 商品价格、库存和尺寸是否来自可追溯的数据源。
- 执行不可逆操作前,是否展示清晰的最终确认信息。
豆包手机助手消费者版的意义,在于手机 AI 从独立聊天应用进一步走向设备级任务入口。真正决定这类产品能否长期使用的,不只是模型能否理解一句复杂要求,而是它能否稳定地把屏幕上下文、用户约束和外部应用连接起来,同时让用户始终知道助手看到了什么、做到了哪一步。