十次浏览,可能只是一件事
匿名用户A在午休时连续打开十款跑鞋,查看尺码、比较价格,又回到最早的商品。第一眼看,运动兴趣已经很明显。但如果他正在替朋友挑礼物,这十次行为反映的是一次采购任务,而非长期生活方式。如果页面反复加载还产生了重复事件,所谓十次甚至不是十个有效选择。AI用户画像大模型首先要辨认发生了什么,再讨论这些事实支持怎样的结论。
这里的误区是把行为次数直接当成兴趣强度。Browse只是接触,Search包含主动表达,Favorite意味着暂时保留选项,Cart接近决策,Purchase提供交易结果,Repeat Purchase则可能支持跨周期偏好。它们有不同含义,却不是一条永远有效的强弱排行榜。购买赠礼不能证明自用偏好;连续搜索“轻便、防水、四百以内”反而可能比半年前的一次购买更能说明此刻需求。
权重应当解释证据,而不是制造标签
一个可讨论的画像结构,应保存事件类型、发生时间、商品与类目、会话来源、重复程度、显式约束及信号置信度。先清理重复记录,再将同一任务内的连续行为组合起来。十次近似浏览可以使用有上限的频次贡献,避免刷新页面就把一个兴趣无限放大。Recency反映证据距离现在多远,Frequency反映是否反复出现,但仍要结合行为是否跨越了不同日期与独立会话。
随后区分短期兴趣与长期偏好。会话行为(Session Behavior)可立即提示用户正在比较跑鞋,并让推荐围绕鞋型、尺码与预算展开。长期层则需要更谨慎的更新,例如观察他在后续不同时间是否仍主动搜索相关商品,是否出现合理的复购或内容互动。系统保存的是有时间范围的推断,不应把“本周选礼物”写成永久运动人群,更不应凭商品兴趣推断健康或家庭身份。
画像可以暂时不确定。保留不确定性,比过早确定一个错误身份更有用。
将一条行为链放回购物场景
假设用户先搜索跑鞋,随后收藏两款,再加购其中一款,最后删除购物车。若只读取加购事件,系统可能不断催促购买;若读取完整序列,就应重新检查价格、尺码和替代选择。删除也不等于讨厌跑鞋,可能只是换了尺码或决定到实体店试穿。技术上应区分正向结果、撤销状态和未知原因,避免把没有购买一律当负反馈。
长期收藏却没有购买同样有多种解释:用户在等待补货、比较预算、保存灵感,或者已经在别处完成交易。比较合理的响应是降低过度确信的购买预测,保留少量相关选项,并提供“暂不需要”等明确控制。当用户主动标记不感兴趣时,这种直接反馈应及时影响当前列表;历史证据可以保留来源记录,但不应继续压过他的当前选择。
怎样检验画像是否读错了人
离线分析可按时间切分数据,用过去行为预测未来独立会话,避免把同一次购物的后半段泄漏给训练。还要分别查看新用户、共享账号和低频访客,检查错误推荐是否集中出现。线上则观察用户是否更快找到合适商品,以及重复曝光和拒绝是否下降。任何权重都需要根据任务验证,本文的信号堆栈是一种分析框架,并非尊龙凯时已上线模型的参数表。行为能够提供证据,真正的兴趣仍是一种需要不断修正的推断。