Protected · 思考
AI产品探索实验
这是我对 AI 产品的一些思考,目前需要密码查看。
想看的话,欢迎找我要 🙂
 

A Scenario Study & Product Exploration

萌宠产品
理解与探索

上次面试后了解到,视频生成 Agent 的落地场景之一是座舱萌宠。我把它当成自己的产品,做了一轮从理解、实验到原型的探索。

产品理解公开信号机会判断动手实验评测与原型

ACT 01 · Understanding

先认识它

01
Product
Understanding

把“我家的宠物”带进车里

宠物通常不能真的陪用户开车,但用户想在通勤、独处、等待这些日常片段里保留一点熟悉的陪伴。萌宠把“我家那只”带进车里——在独自开车的时间里,给用户一份低打扰的熟悉陪伴

COMPANION陪伴感

它不需要一直主动说话,安静地在场本身就有价值。

IDENTITY识别感

用户真正会在意:“它像不像我家的宠物”。

RESTRAINT分寸感

车内体验要克制,情绪表达不能干扰驾驶注意力。

02
Public
Signals

公开内容里,用户在做什么

为了补足用户语境,我选择小红书的公开内容做了一轮轻量结构化采集:

WHY理解真实使用

观察用户怎么用萌宠、怎么评价结果、哪些人最积极参与。

HOW结构化采集

围绕关键词提取公开标题、搜索联想、互动量和可见文本。

SORT按行为整理

清洗去重后按用户在做什么归类,减少关键词计数的误读。

01 · 行为路径 — 样本呈现出一条清晰的递进

STAGE 1被“宠物上车”击中用户先把它理解成陪伴关系进入车内,功能属性退到第二层。
STAGE 2上传自己的宠物愿意为“我家的宠物”付出操作成本,研究怎么生成成功。
STAGE 3用熟悉感评估结果像不像、毛色、斑纹、眼神、动作自然度是核心评价标准。
STAGE 4主动优化与二创修毛、换装、加配饰、上传热门形象——萌宠具备可玩性。
NEXT →
从“生成结果”,走向“可塑造角色” 路径的下一步指向:人-宠互动、车-宠联动和更多感官反馈,都有了探索空间。

02 · 关键信号

INSIGHT 01情绪价值先于功能价值

“被戳中”“养宠人懂”说明用户从关系感进入这个产品。

INSIGHT 02“像不像”是第一标准

用户拿原图和记忆里的宠物细节做对照,熟悉感是评价核心。

INSIGHT 03感官线索已出现

声音、音频素材等表达,提示用户开始关注形象之外的体验层。

INSIGHT 04车内分寸必须保留

任何感官反馈都要短、轻、可控,避免突然和高频打扰。

只分析公开文本与聚合信号,属轻量采集与产品推断,用于确定原型验证方向。

03
Focus

产品方向探索聚焦

二创/IP 玩法能带来讨论度和可玩性;真实养宠用户更能体现陪伴、人文关怀和科技温度。本次方案优先聚焦后者。

PRIMARY · 本次聚焦真实养宠用户

核心期待是熟悉感:看起来像我的宠物,互动起来也保留我熟悉的气质。这个方向更能体现座舱 AI 的陪伴价值和科技温度。

ADJACENT · 后续拓展二创玩家

换装和知名 IP 二创能提升分享欲和话题度,适合后续拓展玩法。本次先把声音作为真实宠物个性化的加分项验证。

PRODUCT OPPORTUNITY 个性化机会 加深“我家宠物数字版”的熟悉感,用多感官交互和玩法让它更“活”。 1 · 多感官反馈 2 · 人-宠互动 3 · 车-宠联动
04
Why Voice,
Why Now

多感官反馈:视觉+声音

三个方向里,我先选了多感官反馈中的「声音」。选它有两头依据:调研里,声音线索已经出现在用户的搜索和讨论中(INSIGHT 03);趋势上,它正踩在两条线的交叉点上。

TECH TREND视频生成走向“画面 + 声音”

AI 视频过去主要围绕画质、动作和一致性竞争。现在越来越多模型开始把原生音频、对白、音效纳入生成链路,“有声”正在成为下一轮体验差异点。

SCENE TREND座舱体验走向情感陪伴

车内体验正在从导航、控制和信息展示,扩展到更日常的陪伴与个性表达。NOMI、理想同学、小米萌宠都说明,座舱 AI 已经开始承担情绪缓冲和陪伴角色。

旁证:声音在座舱情感体验里的分量,已经被语音助手这一层验证过——蔚来称在 NOMI 的声音上投入大量精力,理想同学靠语音人设承担情感角色。

ACT 02 · Experiments

动手验证

判断不能停在推理上。我先立好交互规则,再用开源模型亲手试。

05
Capability
Clues

公开研究里的一条线索

xiaomi-research 的公开项目说明小米在相关方向有研究积累,是否接入产品从公开信息无法确认。其中 ControlFoley(视频→音频生成)说明“萌宠声音”有技术探索基础,也是我选这个切口的重要启发。

完整能力线索表
能力领域公开线索和萌宠声音探索的关系
图像 / 视频生成Vision Forge 相关公开介绍支撑萌宠形象和动作生成,是现有视觉体验的核心线索。
视频编辑 / 视觉处理SVOR、PROVE说明小米在视频处理和评测上有相关积累;和萌宠抠图融合属于相邻能力。
视频理解TimeViper对长视频理解有参考意义,和当前萌宠声音探索关系较远。
音频 / 音效ControlFoley(V2A)说明小米在视频到音频生成方向有研究积累,是我探索“萌宠声音”的重要启发。
06
Existing
Flow

探索聚焦在生成后的互动层

萌宠是窄场景生成任务,“我传一张,它活了”的低摩擦是对的,生成前值得保持这份轻。我的探索集中在生成后的互动层:什么时候发声、发什么、什么时候必须安静。

07
V1
Rules

定位:助手管功能,萌宠管陪伴

萌宠有了声音,就进入了座舱的声音体系,第一件事是和语音助手分清分工:小爱负责功能对话和安全提醒,萌宠负责情绪陪伴——只用叫声表达、用户主动触发、低频低打扰。由这个定位推出三条发声规则:

SPEAK可以发声

限定在明确的场景边界内,目前看好三个:
· 上车 — 表示欢迎
· 互动时 — 即时回应
· 停车后 — 轻声道别

STAY QUIET保持安静

高速行驶、用户静音、尚未停车等注意力敏感场景。

SAFETY FIRST不抢安全

犯困 / 分神这类安全提醒应由车辆原生系统承担。

08
Experiment
No.1

第一组实验:给看得见的动作配音——成了

画面里有清楚的嘴部动作和身体节奏时,V2A 能生成同步自然的音效。这是单样本的方向性验证——结论是“值得继续”,不是“已证明”。

EXPERIMENT 01 / V2A模型跟着可见动作生成同步音效,声画关系自然

ACT 03 · The Setback

然后,翻车了

到这里一切顺利。直到我让它生成“有情绪的叫声”。

09
Badcase

第二组实验:情绪化叫声撑不住

接着把真实宠物声音作为参考,生成开心、撒娇、告别等情绪版本。参考声音能帮模型贴近音色和节奏,但高频、开心、尖叫类声音仍然容易出现杂音和失真。

BADCASE / HIGH FREQ开心叫:情绪方向对,但尖锐杂音明显
BADCASE / LOW FREQ凶吼:同样出现杂音

没有内部数据与产品链路,开源/公开模型的结果只作参考样本,用来观察哪些声音任务稳定、哪些容易出不确定性。

10
Root
Cause

我以为是 prompt 没写好

于是每组只改一个变量做对照。结果指向模型能力边界:杂音与音高、声音形态强相关,与措辞关系弱。

我试了什么观察到的结果指向的判断
改情绪词:开心 / 凶 / 委屈杂音更多跟音高和声音形态相关,和措辞关系较弱。排除“只是 prompt 没写好”。
加 negative prompt 压刺耳感局部减轻,但不能稳定去掉尖锐杂音。系统性问题,不适合靠文案修补。
加入参考声音音色和节奏更容易贴住,但强情绪、高频片段仍会出问题。真实样本是入口,还需裁切、筛选和适配。
换物种 / 换情绪高频、短促、强情绪的声音仍然更容易翻车。边界来自任务本身,不能只归因单个样本。
Turning Point

问题不在 prompt,
在模型的能力边界

11
Boundary

边界看清了:能补动作声,撑不起情绪声

MISMATCH任务错配

V2A 的强项是根据画面动作补声音;“表达开心 / 撒娇”需要更多语义和情感信号。

DATA SCARCITY数据稀缺

宠物情绪叫声很难标注,真实样本数量也远少于人声。

ACOUSTICS声学困难

高频、短促、瞬态的叫声更容易产生刺耳杂音。

所以方案从“生成一个情绪声音”调整为“让 AI 适配用户提供的真实声音”——从 badcase 反推产品方案。

ACT 04 · The Pivot

转向:AI 不当声源,当适配器

翻车不是终点——它准确地告诉我,产品方案应该长什么样。

12
Key
Insight

更稳的方向:真实声音样本 + AI 适配

用户上传带情绪的真实声音片段后,模型更容易贴合音色、节奏和动画。让 AI 负责把真实样本变得可用、可控、可适配,比让它独自创造声音更稳。

STEP 1用户上传开心叫、撒娇/低哼、普通叫声 3 段短样本
STEP 2系统理解识别音色、情绪、音高、节奏和可用片段
STEP 3AI 适配按场景裁切、同步、轻量变形,降低从零生成的不确定性
STEP 4互动播放根据行车状态和用户触发决定发声或保持安静
13
V2
Decision

V2 方案:三段真实叫声,三个座舱场景

三层结构:默认精选音库保底体验;用户上传 3 段真实声音实现个性化;AI 做适配器——场景匹配、长度裁切、节奏同步、轻量变形。不把方案押在“AI 从零生成我家宠物的情绪声音”上。

V2 先收敛到 3 个高频、低风险的座舱场景——上车欢迎、轻抚互动、到达提醒,每个场景对应一类情绪声音(开心叫、撒娇/低哼、轻柔提示)。既保留真实宠物声音的熟悉感,也让 AI 在可控范围内提升适配效率。

判断基于公开资料、开源模型实验与原型观察;小米内部模型可能已有更多迭代,这组实验仅作外部参考。

Epilogue · Ship It

落地前的最后两件事

把“好不好听”变成可评测的维度,然后——亲手试试它。

14
Evaluation
Design

先把主观感受变成可评测的维度

主观维度靠人评 + 标注规范保证一致性,客观维度尽量自动化做回归看护;badcase 归因到环节——样本、裁切、变形还是播放策略。

维度打分标准(示意)评法
刺耳度 / 失真高频瞬态处有无爆音、毛刺(0–2 分)自动为主(频谱检测)+ 人工抽检
情绪匹配度声音情绪与场景意图是否一致(欢迎 ≠ 警报)人评,配标注规范
声画同步嘴型开合与音频起止偏差是否可感知自动(时间轴对齐)
音色相似度与用户上传样本的音色接近程度人评 + 声纹相似度参考
15
Interactive
Prototype

最后,亲手试试它

这个原型演示生成后的互动层:萌宠已创建出来后,系统如何根据行车状态、用户触发和静音选择,决定发声或保持安静。

设计原则:萌宠默认是安静的陪伴,只在「用户主动发起 / 明确场景边界」时发声。安全提醒交给车机原生系统,行车安全永远高于互动萌感。
P · 停车中

01 / 行车状态

02 / 触发场景(点一下试试)

03 / 一键静音

萌宠的反应 & 为什么(产品逻辑)

点上面的场景按钮看看 👆
左侧是车机,右侧调状态、点场景,萌宠会按设计逻辑发声或克制。

V2 / 上传 3 段真实声音样本

声音由用户真实样本驱动,AI 负责适配。原型已预置 3 段示例音效,也可以上传文件替换成真实宠物声音。

Recap

探索带回来的三个结论

如果只记三件事,记这三件。

FINDING 01✔ 动作配音——成立

V2A 能跟着可见的嘴部动作和身体节奏,补出自然的同步音效。

FINDING 02✘ 情绪叫声纯生成——不稳

高频、强情绪必出杂音。变量对照后确认:是能力边界,与 prompt 措辞关系弱。

FINDING 03→ 转向:真实样本 + AI 适配

用户录 3 段真实叫声,AI 负责场景匹配、裁切、同步、轻量变形。

萌宠产品理解与探索 · V4 · 胡柳 市场调研 / 开源模型实验 / 交互原型 · Claude Code vibe-coded