A Scenario Study & Product Exploration
上次面试后了解到,视频生成 Agent 的落地场景之一是座舱萌宠。我把它当成自己的产品,做了一轮从理解、实验到原型的探索。
ACT 01 · Understanding
宠物通常不能真的陪用户开车,但用户想在通勤、独处、等待这些日常片段里保留一点熟悉的陪伴。萌宠把“我家那只”带进车里——在独自开车的时间里,给用户一份低打扰的熟悉陪伴。
它不需要一直主动说话,安静地在场本身就有价值。
用户真正会在意:“它像不像我家的宠物”。
车内体验要克制,情绪表达不能干扰驾驶注意力。
为了补足用户语境,我选择小红书的公开内容做了一轮轻量结构化采集:
观察用户怎么用萌宠、怎么评价结果、哪些人最积极参与。
围绕关键词提取公开标题、搜索联想、互动量和可见文本。
清洗去重后按用户在做什么归类,减少关键词计数的误读。
01 · 行为路径 — 样本呈现出一条清晰的递进
02 · 关键信号
“被戳中”“养宠人懂”说明用户从关系感进入这个产品。
用户拿原图和记忆里的宠物细节做对照,熟悉感是评价核心。
声音、音频素材等表达,提示用户开始关注形象之外的体验层。
任何感官反馈都要短、轻、可控,避免突然和高频打扰。
只分析公开文本与聚合信号,属轻量采集与产品推断,用于确定原型验证方向。
二创/IP 玩法能带来讨论度和可玩性;真实养宠用户更能体现陪伴、人文关怀和科技温度。本次方案优先聚焦后者。
核心期待是熟悉感:看起来像我的宠物,互动起来也保留我熟悉的气质。这个方向更能体现座舱 AI 的陪伴价值和科技温度。
换装和知名 IP 二创能提升分享欲和话题度,适合后续拓展玩法。本次先把声音作为真实宠物个性化的加分项验证。
三个方向里,我先选了多感官反馈中的「声音」。选它有两头依据:调研里,声音线索已经出现在用户的搜索和讨论中(INSIGHT 03);趋势上,它正踩在两条线的交叉点上。
AI 视频过去主要围绕画质、动作和一致性竞争。现在越来越多模型开始把原生音频、对白、音效纳入生成链路,“有声”正在成为下一轮体验差异点。
车内体验正在从导航、控制和信息展示,扩展到更日常的陪伴与个性表达。NOMI、理想同学、小米萌宠都说明,座舱 AI 已经开始承担情绪缓冲和陪伴角色。
旁证:声音在座舱情感体验里的分量,已经被语音助手这一层验证过——蔚来称在 NOMI 的声音上投入大量精力,理想同学靠语音人设承担情感角色。
ACT 02 · Experiments
判断不能停在推理上。我先立好交互规则,再用开源模型亲手试。
xiaomi-research 的公开项目说明小米在相关方向有研究积累,是否接入产品从公开信息无法确认。其中 ControlFoley(视频→音频生成)说明“萌宠声音”有技术探索基础,也是我选这个切口的重要启发。
| 能力领域 | 公开线索 | 和萌宠声音探索的关系 |
|---|---|---|
| 图像 / 视频生成 | Vision Forge 相关公开介绍 | 支撑萌宠形象和动作生成,是现有视觉体验的核心线索。 |
| 视频编辑 / 视觉处理 | SVOR、PROVE | 说明小米在视频处理和评测上有相关积累;和萌宠抠图融合属于相邻能力。 |
| 视频理解 | TimeViper | 对长视频理解有参考意义,和当前萌宠声音探索关系较远。 |
| 音频 / 音效 | ControlFoley(V2A) | 说明小米在视频到音频生成方向有研究积累,是我探索“萌宠声音”的重要启发。 |
萌宠是窄场景生成任务,“我传一张,它活了”的低摩擦是对的,生成前值得保持这份轻。我的探索集中在生成后的互动层:什么时候发声、发什么、什么时候必须安静。
萌宠有了声音,就进入了座舱的声音体系,第一件事是和语音助手分清分工:小爱负责功能对话和安全提醒,萌宠负责情绪陪伴——只用叫声表达、用户主动触发、低频低打扰。由这个定位推出三条发声规则:
限定在明确的场景边界内,目前看好三个:
· 上车 — 表示欢迎
· 互动时 — 即时回应
· 停车后 — 轻声道别
高速行驶、用户静音、尚未停车等注意力敏感场景。
犯困 / 分神这类安全提醒应由车辆原生系统承担。
画面里有清楚的嘴部动作和身体节奏时,V2A 能生成同步自然的音效。这是单样本的方向性验证——结论是“值得继续”,不是“已证明”。
ACT 03 · The Setback
到这里一切顺利。直到我让它生成“有情绪的叫声”。
接着把真实宠物声音作为参考,生成开心、撒娇、告别等情绪版本。参考声音能帮模型贴近音色和节奏,但高频、开心、尖叫类声音仍然容易出现杂音和失真。
没有内部数据与产品链路,开源/公开模型的结果只作参考样本,用来观察哪些声音任务稳定、哪些容易出不确定性。
于是每组只改一个变量做对照。结果指向模型能力边界:杂音与音高、声音形态强相关,与措辞关系弱。
| 我试了什么 | 观察到的结果 | 指向的判断 |
|---|---|---|
| 改情绪词:开心 / 凶 / 委屈 | 杂音更多跟音高和声音形态相关,和措辞关系较弱。 | 排除“只是 prompt 没写好”。 |
| 加 negative prompt 压刺耳感 | 局部减轻,但不能稳定去掉尖锐杂音。 | 系统性问题,不适合靠文案修补。 |
| 加入参考声音 | 音色和节奏更容易贴住,但强情绪、高频片段仍会出问题。 | 真实样本是入口,还需裁切、筛选和适配。 |
| 换物种 / 换情绪 | 高频、短促、强情绪的声音仍然更容易翻车。 | 边界来自任务本身,不能只归因单个样本。 |
问题不在 prompt,
在模型的能力边界。
V2A 的强项是根据画面动作补声音;“表达开心 / 撒娇”需要更多语义和情感信号。
宠物情绪叫声很难标注,真实样本数量也远少于人声。
高频、短促、瞬态的叫声更容易产生刺耳杂音。
所以方案从“生成一个情绪声音”调整为“让 AI 适配用户提供的真实声音”——从 badcase 反推产品方案。
ACT 04 · The Pivot
翻车不是终点——它准确地告诉我,产品方案应该长什么样。
用户上传带情绪的真实声音片段后,模型更容易贴合音色、节奏和动画。让 AI 负责把真实样本变得可用、可控、可适配,比让它独自创造声音更稳。
三层结构:默认精选音库保底体验;用户上传 3 段真实声音实现个性化;AI 做适配器——场景匹配、长度裁切、节奏同步、轻量变形。不把方案押在“AI 从零生成我家宠物的情绪声音”上。
判断基于公开资料、开源模型实验与原型观察;小米内部模型可能已有更多迭代,这组实验仅作外部参考。
Epilogue · Ship It
把“好不好听”变成可评测的维度,然后——亲手试试它。
主观维度靠人评 + 标注规范保证一致性,客观维度尽量自动化做回归看护;badcase 归因到环节——样本、裁切、变形还是播放策略。
| 维度 | 打分标准(示意) | 评法 |
|---|---|---|
| 刺耳度 / 失真 | 高频瞬态处有无爆音、毛刺(0–2 分) | 自动为主(频谱检测)+ 人工抽检 |
| 情绪匹配度 | 声音情绪与场景意图是否一致(欢迎 ≠ 警报) | 人评,配标注规范 |
| 声画同步 | 嘴型开合与音频起止偏差是否可感知 | 自动(时间轴对齐) |
| 音色相似度 | 与用户上传样本的音色接近程度 | 人评 + 声纹相似度参考 |
这个原型演示生成后的互动层:萌宠已创建出来后,系统如何根据行车状态、用户触发和静音选择,决定发声或保持安静。
Recap
如果只记三件事,记这三件。
V2A 能跟着可见的嘴部动作和身体节奏,补出自然的同步音效。
高频、强情绪必出杂音。变量对照后确认:是能力边界,与 prompt 措辞关系弱。
用户录 3 段真实叫声,AI 负责场景匹配、裁切、同步、轻量变形。