Behavioral Cohort(行为 cohort,按行为组成的一群用户)最重要的用途不是“找一批人去触达”,而是把一个平均数拆成可以验证的增长问题:哪些人做过什么、在什么情境下,后来得到不同结果?AI 可以快速扫描很多路径并提出 cohort,但“某行为和留存同时出现”仍不等于该行为造成留存。对 Momcozy APP,先把 cohort 当作调查与实验对象,再把它当作运营人群,能避免系统把相关性自动放大成打扰。
为什么需要 cohort?因为总体数字会把完全不同的旅程压成一个平均值。假设 1,000 位用户里有 600 位完成设备绑定,总体绑定完成率是 60%。这个数字没有告诉我们:首次就成功的人、连续失败后成功的人、看过帮助后仍失败的人,以及根本没有开始绑定的人,是否面对同一个问题。若直接优化“60%”,我们甚至不知道该修连接、改帮助、补埋点,还是保持不动作。
Behavioral Cohort(行为 cohort),大白话是:按照用户在产品里“做过或没做过的一串动作”组成一群人,再比较这群人与另一群人的后续结果。生活类比是研究一批学员为什么通过驾照考试。只按年龄或城市分组,可能看不到关键差异;按“是否完成夜间练习、是否在第一次模拟考后针对性复练”分组,更接近实际学习过程。
Momcozy APP 的待验证例子可以是:“首次绑定中连续失败至少两次、打开过对应帮助、24 小时内仍未稳定连接”的用户,与“同样连续失败两次、但后来稳定连接”的用户。两组不是为了立即分别发消息,而是为了追问:设备或系统版本是否不同?帮助是否出现在正确步骤?错误码是否可诊断?是否有人其实已经在 APP 外解决?
这里必须守住一条因果边界。若“首日与 AI 助手完成一次真实交流”的用户 30 天留存更高,只能先说两者 associated(相关)。可能是助手创造了价值,也可能是本来就更有需求、更愿意探索的人更容易使用助手。要判断“让更多合格用户完成交流”是否真的提高留存,还需要随机实验、自然实验或其他更强证据。Behavioral cohort 是发现假设的显微镜,不是自动证明因果的机器。
HYBRD:找到 4 倍留存信号之后,真正的问题才刚开始
把 Agent 质量事件与真实产品结果放在一起,能发现高价值行为;但观察到“使用者留存更高”之后,仍需验证是产品作用还是人群差异。
HYBRD 的 AI 教练 Brain 会根据目标、日程和身体状态调整训练计划。团队发现一些用户必须重复要求,Agent 才会调用工具,于是建立 evaluator(评估器)回看一周会话;抽样中约 25% 出现“第二次提醒才调用工具”,Prompt 修复后该比例下降。更意外的是,文章称与 Brain 互动的运动者,其留存和转化是未互动者的 4 倍以上。这个发现改变了团队优先级:Brain 被放进 onboarding(新手引导),调整训练也默认经过它。
荷兰铁路 NS:同一信息,放在不同旅程时刻会产生相反结果
cohort 不只要描述“谁”,还要描述用户正处在哪个任务与时间点;脱离情境的“最佳内容”并不存在。
NS 把行为分析与实验连接起来,每年运行约 60 个实验。其复盘称,约 25% 的测试带来正向结果,另有约 15% 属于 loss preventer(损失阻止者):测试提前发现方案上线后可能伤害行为或收入。一个具体例子是购票限制信息:在购买流程较早阶段展示会改善结果,但把同一信息放到结账后段却降低转化。团队也测试电子票加载说明、onboarding、二维码帮助等,文章称相关努力每年减少约 13,000 次电子票客服请求;过去两年,实验避免约 180 万欧元潜在收入损失,成功测试每年带来约 240 万欧元业务价值。
先认识这次新增的机制
Amol Avasare 是 Anthropic 的 Head of Growth,之前在 Mercury 与 MasterClass 做增长。我们已经拆过 CASH 的四阶段、分阶段 Eval,以及 70/30 大赌注组合;今天只新增一件事:AI 如何扩大“发现机会”的观察面。 访谈披露,增长工作流可让 Claude 一次读取约 20–25 张图,寻找异常、断点和潜在实验机会。
过去通常怎样做
传统分析常依赖某个人定期打开几张熟悉的 dashboard(看板):总注册、激活漏斗、留存、收入。问题不是人不认真,而是注意力有限。一个总体指标稳定时,某个设备版本、路径顺序或小 cohort 的变化可能已经很大;等投诉集中出现,机会发现已经滞后。
AI 改变的第一步,是把“持续扫描”变便宜:它可以比较多个时间窗、不同 cohort 和指标之间的同步变化,生成类似这样的线索:“总体绑定完成稳定,但连续失败两次后打开帮助的 cohort,本周稳定连接下降;变化集中在某些版本,且相同主题 VOC 增加。”这比自动写周报更进一步,因为它提出了一个可调查的问题和下一批证据。
最容易误解的地方
看更多图不等于看懂业务。20–25 张图若共享错误埋点,AI 只会把同一个错误重复 25 次;若系统不断尝试切分人群,也会产生偶然相关和“看起来很有故事”的小样本。更关键的是,图表告诉我们“哪里不同”,不自动告诉我们“为什么不同”,更不证明把某个行为推给所有人会改善结果。
因此,机会发现至少要输出四样东西:观察到的差异、分母与样本量、两到三个竞争解释、最小验证动作。涉及母婴、儿童、健康和设备安全时,还要先判断这个问题是否允许普通增长实验。AI 可以建议查哪条旅程;人必须定义什么值得优化、哪些数据可用、哪些风险不能试。
我们能借什么
最值得借的不是立刻造一个会读全公司看板的 Agent,而是先给它一张窄而可信的“行为 cohort 对照卡”。例如只比较两类绑定旅程,要求系统联合事件与脱敏 VOC,写出差异和反证,再由人决定补数据、修产品还是设计低风险实验。自动扫描看板属于 AI-assisted Operations;持续提出 cohort、经过验证后更新机会排序,并在明确权限内运行可回滚实验,才开始接近 AI-native。
以“行为 cohort 机会发现 Agent”为例:
系统读取什么:经过授权、口径统一且最小化的注册、绑定步骤、错误码、帮助曝光、稳定成功、AI 助手任务结果、人工接管、脱敏 VOC、客服主题和历史实验结果;还要读取事件版本、缺失率和样本量。母婴、儿童、健康与设备数据不能因为“分群更准”就默认跨场景拼接。
形成什么判断:先识别总体变化,再生成可解释的对照 cohort,例如“同样出现两次失败,后续稳定成功”与“同样失败但未成功”;检查两组分母、时间窗、版本和资格是否可比;列出“产品兼容问题、指导时机不对、结果事件丢失”等竞争解释,并标记相关而非因果。
能做什么:自动生成查询、抽取代表性旅程、聚合同类 VOC、提出补埋点或离线原型,并为低风险问题准备处理组与留出组草案。它可以把最有信息量的 10–20 条旅程交给人看,但未经明确授权,不发送 Push、EDM、站内信,不根据敏感阶段自动画像,也不修改生产策略。
如何看结果并更新策略:若补数据后差异消失,记录为测量问题;若差异仍在但实验无增量,记录为相关性或不可干预信号;若低风险实验改善任务成功且护栏稳定,才提高该机制的置信度。系统随后更新 cohort 定义、机会优先级和不动作条件,而不是只保存一张“胜利图”。
何时交给人:小样本、事件口径变化、无法解释的新异常、健康或儿童语境、连续设备故障、隐私风险、强烈负面情绪、任何真实触达与生产上线,都交给人。HYBRD 目前展示的是 AI-assisted 诊断加观察性 cohort;NS 是人主导的分析—实验闭环;CASH 更接近半自动机会—实验系统,但重大判断与放权仍属于人。
场景一:AI 助手首次价值。 待验证假设是,“首日完成一次有效助手交流”的用户后续更可能持续使用 APP。但不能先把聊天过的人与没聊过的人直接比较,再把差异全算给助手。前者可能本来就更有明确需求。可以借 HYBRD 的方法,把任务类型、工具是否正确调用、是否解决、重复追问和后续行为连起来;最先需要的证据是“有效交流”能否被人工校准地定义。随后只在低风险、合格场景中验证:让入口更容易被发现,是否真正增加任务解决,而非增加无意义对话。高风险内容必须正确转人工,不能以自动解决率压过安全。
场景二:设备绑定与首次稳定使用。 待验证假设是,总体绑定率掩盖了“连续失败 → 看帮助 → 仍未稳定”的具体 cohort。可以先定义两个可比旅程,联合设备与 APP / 系统版本、错误码、帮助出现时点和最终结果,抽看少量真实记录。不能照抄 NS 的“信息提前”:某些权限提示适合提前,某些错误只有发生后才有意义。最先需要的证据是帮助曝光、重试与稳定成功是否可靠串联,以及结果未知是否被误算成失败。
场景三:BBM/VOC 与沉默失败。 待验证假设是,公开差评或主动联系客服的人只是一部分;另一部分用户可能反复失败后直接离开。Agent 可以寻找“有行为卡点但没有反馈”的 cohort,再用匿名化路径与已有 VOC 形成原因假设。不能据此给个人贴“脆弱阶段”或“流失风险”标签并自动触达;先确认数据授权、最小必要性和问题是否可由产品修复。没有足够证据时,不动作是合格结论。
- Behavioral Cohort|行为 cohort:按做过或没做过的一串行为组成的人群。Momcozy 例子:连续绑定失败两次、看过帮助、24 小时内仍未稳定连接的旅程。
- Segmentation|分群:把总体拆成更可比较的部分;它是分析方法,不自动等于营销名单。Momcozy 例子:先按绑定路径找问题,不是立刻对每组发不同消息。
- Association|相关性:两个现象同时出现,但尚未证明谁造成谁。Momcozy 例子:使用 AI 助手的人留存更高,可能来自助手价值,也可能来自原本更强的需求。
- Confounder|混杂因素:同时影响“是否发生某行为”和“后续结果”的第三个原因。Momcozy 例子:高意愿用户既更愿意使用助手,也更可能持续使用 APP。
- Contrast Cohort|对照 cohort:为了回答一个问题而刻意设计的可比人群。Momcozy 例子:两组都经历相同次数绑定失败,只比较后续是否稳定成功,减少把不同起点混在一起。
- 用“谁在什么时间窗内做过 / 没做过什么”写出目标 cohort;
- 写一个起点尽量相同的对照 cohort;
- 写一个想比较的真实结果,以及两个可能同时造成行为和结果的混杂因素;
- 写下若只看到相关性,下一步是补数据、人工看 10 条旅程,还是设计低风险实验。
产出物是一页 cohort—对照—结果—反证卡。完成后能更新的判断是:我们发现的是一个值得验证的增长机制,还是只找到了一群“本来就更可能成功的人”?最后只回答一个具体问题:Momcozy APP 里,哪一个“高留存用户常做的行为”最容易被误当成留存原因?