视频动画技术

泛标签不如细标签:“宝妈”不如“跳绳 2 个月没瘦的女生”圈得准

👤 为我痴狂 👁 3 阅读 ❤ 0 点赞 ➦ 0 分享 📅 2026-10-10
首页› 视频动画› 视频动画技术› 正文
泛标签不如细标签:“宝妈”不如“跳绳 2 个月没瘦的女生”圈得准

从标签信息熵到意图匹配度:一套可落地的细颗粒度人群标签工程方法论

摘要

“宝妈”是一个泛标签,覆盖数千万人,投放成本高、转化率低;“跳绳2个月没瘦的女生”是一个细标签,人数少但意图明确、痛点清晰、转化路径短。本文提出一条贯穿全文的分析主线:标签价值 = 信息熵 × 意图匹配度 ÷ 触达成本。围绕这条主线,文章从信息论、用户意图建模、数据采集、语义聚类、意图分层、AB验证、合规治理七个层面,系统拆解细标签的工程化构建路径。核心结论是:标签颗粒度不是越细越好,而是要在“可识别、可触达、可转化”三者之间找到最优解。本文给出可复用的操作步骤、评估指标与代码示例,并附60余篇参考文献与数据集预处理说明。

关键词:细颗粒度标签;用户意图建模;信息熵;人群定向;转化率优化;隐私合规

1. 问题的提出:为什么“宝妈”圈不准

在广告投放和用户运营中,“宝妈”几乎是出现频率最高的标签之一。它看起来精准——有孩子、女性、有一定消费能力。但实际投放中,这个标签的点击率、转化率往往低于预期。原因并不复杂:“宝妈”描述的是身份,不是需求。身份相同的人,需求可能完全不同。一个刚生完孩子的宝妈关心的是产后修复,一个孩子上小学的宝妈关心的是辅导班,一个孩子已经工作的宝妈关心的是健康和旅游。把她们放进同一个标签池,等于没有分层。

“跳绳2个月没瘦的女生”则不同。这个标签同时包含了行为(跳绳)、时长(2个月)、结果(没瘦)和性别(女生)。它描述的不是身份,而是一个具体的、正在发生的困境。处于这个困境中的人,需求高度一致:为什么没瘦?怎么调整?要不要换运动方式?要不要控制饮食?这种一致性,才是转化的基础。

1.1 泛标签的三大成本

泛标签的问题可以用三个成本来概括。第一是筛选成本:人群池越大,噪声越多,系统需要更多的曝光才能找到真正有意向的人。第二是创意成本:泛标签对应的创意只能写得很泛,比如“宝妈必看”,这种文案对任何人都没有强刺激。第三是信任成本:用户看到“宝妈必看”时,第一反应是“又在推销”,而不是“这说的就是我”。

本文评述:泛标签并非一无是处。在冷启动阶段,泛标签可以帮助系统快速积累样本;在品牌曝光场景,泛标签可以保证覆盖量。问题在于,很多团队把泛标签用在了效果投放上,用错了场景。细标签的价值,恰恰体现在效果投放的精细化阶段。

1.2 一个真实的对比场景

假设某健身品牌要推广一款“跳绳减脂课程”。用“宝妈”标签投放,系统可能覆盖5000万人,点击率0.8%,转化率0.3%。用“跳绳2个月没瘦的女生”标签投放,系统可能只覆盖80万人,但点击率2.5%,转化率1.8%。从绝对量看,泛标签带来的订单更多;从成本看,细标签的获客成本可能只有泛标签的三分之一。这就是细标签的工程价值:不是覆盖更多人,而是更准地覆盖对的人。

需要说明的是,上述数字为模拟示例,用于说明量级差异,不代表任何真实平台数据。真实投放中,具体数值会因行业、平台、创意、出价策略而大幅波动。

2. 理论主线:标签价值公式与信息熵

为了让“细标签更好”这个直觉变成可计算、可优化的工程问题,本文提出一条贯穿全文的分析主线:

标签价值 = 信息熵 × 意图匹配度 ÷ 触达成本

这个公式不是严格的数学定理,而是一个工程化的思考框架。它把标签价值拆成三个可观测、可优化的部分。下面逐项解释。

2.1 信息熵:标签的区分能力

信息熵(Information Entropy)由香农在1948年提出,用于衡量一个随机变量的不确定性。熵越大,不确定性越高;熵越小,区分能力越强。在标签场景中,如果一个标签把人群分成均匀的两半,它的区分能力最强;如果一个标签把99%的人分到同一类,它的区分能力很弱。

“宝妈”这个标签的问题在于,它覆盖的人群内部差异极大,标签本身对“是否购买跳绳课程”这个目标变量的区分能力很弱。而“跳绳2个月没瘦的女生”对目标变量的区分能力很强:处于这个状态的人,对“为什么没瘦”的答案有强烈需求。

本文评述:信息熵是评估标签质量的第一把尺子。在实际工程中,可以用标签与目标变量的互信息(Mutual Information)来量化这种区分能力。互信息越高,标签越有价值。互信息的计算不需要复杂的模型,用简单的分箱统计即可实现。

2.2 意图匹配度:标签与需求的契合程度

信息熵高,只说明标签有区分能力,不说明区分出来的群体有购买意图。一个标签可能把人群分成“喜欢红色”和“不喜欢红色”,这对卖跳绳课程没有意义。意图匹配度衡量的是:标签所描述的群体,与产品或服务的核心需求之间的契合程度。

“跳绳2个月没瘦的女生”之所以匹配度高,是因为它直接指向了一个未解决的问题。用户搜索、讨论、求助的行为,本身就是意图信号。相比之下,“宝妈”只是一个身份描述,不包含任何问题或需求信号。

2.3 触达成本:标签的可触达性

再好的标签,如果无法触达,价值也是零。触达成本包括:平台是否支持该标签定向、标签覆盖人数是否足够、触达频次是否合理、触达渠道是否匹配。细标签的覆盖人数通常较少,这是它的天然劣势。因此,细标签的工程目标不是无限细分,而是在覆盖人数和精准度之间找到平衡点。

笔者认为,标签价值公式的三个因子存在权衡关系。信息熵和意图匹配度越高,标签越精准,但覆盖人数往往越少,触达成本越高。工程上的最优解,通常出现在“覆盖人数刚好够用、意图匹配度足够高”的位置,而不是越细越好。

3. 细标签的四个维度:行为、场景、意图、阶段

细标签不是随便加限定词。一个有效的细标签,通常同时包含多个维度的信息。本文把细标签的构成维度归纳为四个:行为、场景、意图、阶段。这四个维度可以组合使用,形成高区分度的标签。

维度 含义 示例 数据来源
行为 用户做过什么 跳绳、搜索减脂餐、收藏健身视频 站内日志、搜索记录
场景 在什么条件下发生 晚上9点后、居家、无器械 时间戳、设备、地理位置
意图 用户想解决什么问题 为什么没瘦、怎么调整 搜索词、评论、客服对话
阶段 处于决策的哪个环节 刚遇到瓶颈、正在找方案、准备购买 行为序列、停留时长

“跳绳2个月没瘦的女生”这个标签,实际上同时命中了行为(跳绳)、阶段(2个月,遇到瓶颈)、意图(没瘦,想解决)三个维度。场景维度可以进一步补充,比如“居家跳绳”“无器械”。维度越多,标签越细,覆盖人数越少。工程上需要根据业务目标选择维度组合。

3.1 行为维度:最可靠但最稀疏

行为数据是最可靠的意图信号。用户搜索了什么、点击了什么、停留了多久、是否加购,这些行为比任何问卷都真实。但行为数据的问题是稀疏:真正跳绳2个月的人,在总用户中占比很低。如果只依赖行为数据,标签覆盖人数可能不足以支撑投放。

解决稀疏问题的常用方法有两种。一是行为泛化:把“跳绳”泛化为“居家有氧运动”,把“2个月”泛化为“持续运动一段时间”。二是多行为组合:把跳绳、搜索减脂餐、收藏健身视频等行为组合起来,提高覆盖人数。两种方法都会降低精度,需要根据业务容忍度选择。

3.2 场景维度:提升相关性的关键

场景维度常常被忽略,但它对转化率影响很大。同样是想减脂的人,晚上9点在家的用户和中午12点在办公室的用户,需求完全不同。前者可能需要居家运动方案,后者可能需要饮食控制方案。场景维度可以从时间、地点、设备、网络环境等数据中提取。

本文评述:场景维度的价值在于,它让标签从“描述用户是谁”升级为“描述用户此刻的处境”。处境比身份更能预测行为。一个“宝妈”在晚上10点搜索“跳绳没瘦”,和一个“宝妈”在下午3点浏览育儿文章,需求完全不同。前者是减脂需求,后者是育儿需求。

3.3 意图维度:从关键词到问题图谱

意图维度是细标签的核心。用户的搜索词、评论、客服对话中,包含了大量意图信号。工程上可以把这些文本转化为“问题图谱”:用户遇到了什么问题、尝试了什么方案、卡在了哪里、需要什么帮助。问题图谱越细,标签越精准。

以“跳绳2个月没瘦”为例,可以拆解出一组子问题:跳绳频率是否足够?饮食是否控制?体重是否进入平台期?是否肌肉量增加导致体重不变?每个子问题对应不同的解决方案,也对应不同的内容或产品。这种拆解,就是意图维度的工程化落地。

3.4 阶段维度:决策漏斗的精细化

阶段维度把用户放在决策漏斗中观察。同样是“跳绳没瘦”的人,有的刚遇到问题,还在困惑;有的已经搜索了很多方案,在比较;有的已经决定购买课程或更换运动方式。不同阶段需要不同的触达策略:困惑期适合科普内容,比较期适合对比评测,决策期适合优惠和保障。

阶段维度的数据来源包括:行为序列(先搜索什么、后搜索什么)、停留时长、页面访问深度、加购行为、客服咨询记录。这些数据可以组合成阶段评分,用于标签分层。

4. 数据采集与预处理:从原始日志到候选标签

细标签的构建,第一步是数据采集与预处理。没有干净、结构化的数据,后续的聚类和建模都是空中楼阁。本节给出一个可落地的数据采集与预处理流程。

4.1 数据源盘点

细标签构建常用的数据源包括以下几类。第一类是站内行为日志:页面浏览、点击、搜索、收藏、加购、下单、停留时长。第二类是搜索与查询日志:用户主动输入的搜索词,是意图最直接的表达。第三类是内容互动数据:评论、点赞、分享、弹幕。第四类是客服与问卷数据:客服对话、售后反馈、问卷调研。第五类是第三方数据:在合规前提下,可以接入平台提供的兴趣标签、行业数据。

需要强调的是,第三方数据的接入必须严格遵守相关法律法规和平台协议。本文后续章节会专门讨论合规问题。

4.2 数据清洗与标准化

原始日志通常包含大量噪声:爬虫流量、测试账号、重复记录、时间戳异常、字段缺失。预处理的第一步是清洗。常用规则包括:过滤已知爬虫UA、剔除内部测试账号、去重、修正时间戳时区、填充或丢弃缺失字段。

第二步是标准化。把不同来源的数据统一到同一套用户ID体系下,把时间统一到同一时区,把行为类型统一到同一套编码。标准化做得好不好,直接决定后续标签的质量。

4.3 数据集预处理说明(模拟数据示例)

为便于读者复现,本文给出一个模拟数据集的预处理说明。该数据集为模拟数据,仅用于方法演示,不代表任何真实平台数据。

处理步骤 操作 输出
去重 按 user_id + timestamp + event_type 去重 去除约3%重复记录
过滤 剔除爬虫UA、测试账号、停留时长小于1秒的记录 去除约8%噪声
时间标准化 统一为UTC+8,按小时分箱 新增 hour_bin 字段
文本清洗 去除HTML标签、表情符号、特殊字符,统一繁简体 干净的搜索词和评论文本
分词与标注 使用jieba分词,人工标注500条意图样本 意图分类训练集

上述预处理流程可以用Python实现。以下是一个简化的代码示例,用于演示去重和过滤逻辑:

import pandas as pd

# 读取原始日志(模拟数据)
df = pd.read_csv("raw_events.csv")

# 1. 去重
df = df.drop_duplicates(subset=["user_id", "timestamp", "event_type"])

# 2. 过滤爬虫和测试账号
crawler_uas = ["spider", "bot", "crawler"]
df = df[~df["user_agent"].str.lower().str.contains("|".join(crawler_uas), na=False)]
df = df[~df["user_id"].str.startswith("test_")]

# 3. 过滤异常停留时长
df = df[(df["dwell_time"] >= 1) | (df["dwell_time"].isna())]

# 4. 时间标准化
df["timestamp"] = pd.to_datetime(df["timestamp"], utc=True).dt.tz_convert("Asia/Shanghai")
df["hour_bin"] = df["timestamp"].dt.hour

# 5. 文本清洗
import re
def clean_text(s):
    if pd.isna(s):
        return ""
    s = re.sub(r"<[^>]+>", "", s)
    s = re.sub(r"[^\w\s\u4e00-\u9fff]", "", s)
    return s.strip()

df["clean_query"] = df["query"].apply(clean_text)

print(df.shape)

这段代码只是演示,实际工程中还需要考虑分布式处理、增量更新、数据版本管理等问题。对于大规模数据,建议使用Spark或Flink进行批流一体处理。

5. 语义聚类与标签生成:工程化方法

有了干净的数据,下一步是把原始文本转化为结构化标签。核心方法是语义聚类:把表达相似意图的搜索词、评论、对话聚在一起,形成候选标签。

5.1 文本向量化

语义聚类的第一步是把文本转化为向量。常用方法有两类。第一类是传统词向量:TF-IDF、Word2Vec、GloVe。这类方法计算快、可解释性好,但对同义词和上下文的理解有限。第二类是预训练语言模型:BERT、RoBERTa、Sentence-BERT、以及国内的中文预训练模型。这类方法语义表达能力强,但计算成本高。

本文评述:对于标签工程,Sentence-BERT类模型通常是性价比最高的选择。它专门为句子级语义相似度优化,生成的向量可以直接用于聚类和检索。如果数据量不大,也可以用TF-IDF加同义词词典作为轻量方案。

5.2 聚类算法选择

向量化之后,用聚类算法把相似文本聚在一起。常用算法包括K-Means、DBSCAN、层次聚类、HDBSCAN。K-Means需要预先指定簇数量,适合对业务有先验认知的场景;DBSCAN和HDBSCAN可以自动发现簇数量,适合探索性分析。

在标签工程中,通常采用两阶段策略:先用HDBSCAN做粗聚类,发现主要意图簇;再对每个簇内部用K-Means细分,形成候选标签。这种策略兼顾了探索性和可控性。

5.3 标签命名与人工审核

聚类结果只是数字簇,需要转化为人类可读的标签。常用方法是提取每个簇的高频词和代表性文本,由运营或产品人员命名。命名时要遵循三个原则:具体、可理解、可触达。具体是指标签要描述清楚行为或意图;可理解是指业务人员能看懂;可触达是指平台支持该标签的定向。

人工审核是必要环节。聚类算法可能把不相关的文本聚在一起,也可能把同一意图拆成多个簇。人工审核可以发现这些问题,并进行合并或拆分。

5.4 一个完整的聚类示例

假设我们收集了10万条与减脂相关的搜索词和评论。经过向量化和HDBSCAN聚类,得到以下主要簇(模拟数据,用于演示):

簇编号 代表性文本 候选标签 占比
C1 跳绳两个月没瘦、每天跳绳为什么不瘦 跳绳瓶颈期女生 12%
C2 减脂餐怎么做、低卡食谱 减脂饮食搜索者 18%
C3 产后怎么减肥、剖腹产多久能运动 产后减脂妈妈 15%
C4 跑步膝盖疼、运动损伤恢复 运动损伤困扰者 9%
C5 体重不变但围度变小、肌肉增加体重 平台期困惑者 8%

从表中可以看出,“跳绳瓶颈期女生”这个标签,比“宝妈”精准得多。它直接指向了一个具体问题,而且这个问题有明确的解决方案。运营人员可以针对这个标签,制作“跳绳没瘦的5个原因”这类内容,转化率会显著高于泛泛的“宝妈减脂”内容。

6. 意图分层:从“跳绳没瘦”到购买决策

细标签解决了“圈对人”的问题,但圈对人之后,还需要理解用户处于决策的哪个阶段,才能匹配正确的触达策略。这就是意图分层。

6.1 意图分层的三层模型

本文提出一个三层意图模型:问题层、方案层、决策层。问题层用户刚遇到问题,处于困惑状态;方案层用户已经知道问题,正在寻找解决方案;决策层用户已经比较过方案,准备购买或行动。

层级 用户状态 典型行为 触达策略
问题层 刚发现问题,困惑 搜索“跳绳为什么不瘦” 科普内容、原因分析
方案层 寻找解决方案 搜索“跳绳没瘦怎么办”“换什么运动” 方案对比、课程推荐
决策层 准备购买或行动 搜索“跳绳课程推荐”“减脂课多少钱” 优惠、保障、用户评价

意图分层的价值在于,它让同一标签下的用户得到不同的触达。如果对所有“跳绳没瘦”的用户都推课程,问题层用户会觉得“我还没搞清楚原因,你就让我买课”,转化率低。如果先推科普内容,再推课程,转化路径更自然。

6.2 意图分层的工程实现

意图分层可以用规则和模型两种方式实现。规则方式简单直接:根据搜索词中的关键词判断层级。比如包含“为什么”“原因”的归入问题层,包含“怎么办”“方法”的归入方案层,包含“推荐”“价格”的归入决策层。

模型方式更灵活:用标注数据训练一个分类模型,输入用户的行为序列和文本,输出意图层级。常用模型包括逻辑回归、XGBoost、以及基于BERT的文本分类模型。模型方式可以捕捉更复杂的模式,但需要标注数据。

本文评述:在实际工程中,建议先用规则快速上线,积累数据后再训练模型。规则方式虽然简单,但在意图分层这种场景下,效果往往不差。关键是规则要持续迭代,根据转化数据调整关键词和权重。

6.3 从意图分层到内容匹配

意图分层之后,需要把层级映射到具体内容。问题层用户需要“原因分析”类内容,方案层用户需要“方案对比”类内容,决策层用户需要“购买理由”类内容。这个映射关系可以用内容标签体系来管理。

内容标签体系包括:内容类型(科普、对比、评测、优惠)、内容主题(跳绳、饮食、平台期)、内容形式(图文、视频、直播)。把用户标签和内容标签做匹配,就可以实现个性化触达。

7. AB验证与效果评估:指标与实验设计

细标签是否有效,不能靠直觉判断,必须用AB实验验证。本节给出细标签AB实验的设计方法和评估指标。

7.1 实验设计原则

细标签AB实验的核心原则是:只改变标签,其他变量保持一致。实验组用细标签定向,对照组用泛标签定向,创意、出价、落地页、投放时间保持一致。只有这样才能把效果差异归因到标签上。

实验前需要确定样本量。样本量取决于基线转化率、预期提升幅度、显著性水平和统计功效。常用工具是在线样本量计算器,输入基线转化率、最小可检测效应、α和β,即可得到所需样本量。

7.2 核心评估指标

细标签的评估指标可以分为三层:触达层、互动层、转化层。触达层指标包括曝光量、触达人数、触达频次;互动层指标包括点击率、停留时长、互动率;转化层指标包括转化率、获客成本、ROI。

层级 指标 含义 优化方向
触达层 触达人数 标签覆盖的独立用户数 保证足够样本
互动层 点击率 点击人数/触达人数 提升相关性
互动层 停留时长 落地页平均停留时间 提升内容匹配度
转化层 转化率 转化人数/点击人数 提升意图匹配度
转化层 获客成本 总花费/转化人数 降低触达成本

7.3 实验注意事项

细标签AB实验有几个常见坑。第一是样本量不足:细标签覆盖人数少,实验可能跑不出显著性。解决方法是延长实验周期,或者放宽标签条件。第二是辛普森悖论:细标签在某个渠道效果好,在另一个渠道效果差,合并看可能被平均掉。解决方法是分渠道分析。第三是新奇效应:新标签刚上线时效果可能虚高,需要观察一段时间再下结论。

笔者认为,细标签实验应该采用“小步快跑”的策略:先用小预算快速验证,有效果再放量。不要一上来就大规模投放,否则试错成本太高。

8. 合规与隐私:细标签的边界

细标签越精准,涉及的隐私数据越多。合规问题不是可选项,而是必选项。本节讨论细标签工程中的合规边界。

8.1 主要法规框架

国内主要法规包括《个人信息保护法》《数据安全法》《网络安全法》。其中《个人信息保护法》对个人信息的收集、存储、使用、加工、传输、提供、公开、删除等环节都有明确规定。欧盟的GDPR、美国的CCPA/CPRA也是重要的参考框架。

本文评述:细标签工程最容易踩的合规红线有三个。第一是超范围收集:收集了与业务无关的个人信息。第二是未告知使用:用户不知道自己的数据被用于标签定向。第三是敏感信息处理不当:健康、金融、行踪等敏感信息需要单独同意。

8.2 合规操作要点

合规操作可以从五个方面入手。第一,最小必要:只收集与标签目标直接相关的数据。第二,告知同意:在隐私政策中明确说明数据用途,获取用户同意。第三,匿名化处理:标签计算尽量在匿名化或去标识化数据上进行。第四,权限控制:标签数据的访问要有严格的权限管理。第五,删除机制:用户注销或要求删除时,及时删除相关数据。

8.3 敏感标签的特殊处理

健康、金融、性取向、宗教、政治倾向等属于敏感信息。基于这些信息构建的标签,需要特别谨慎。一般原则是:能不建就不建;必须建时,要单独同意、加密存储、严格权限、定期审计。

以“跳绳2个月没瘦的女生”为例,这个标签涉及健康信息(体重、运动),属于敏感范畴。如果要在投放中使用,需要确保用户已同意相关数据的收集和使用,并且标签本身不直接暴露用户的健康状态。

9. 前沿预判:大模型时代的标签工程

大语言模型(LLM)正在改变标签工程的很多环节。本节讨论三个可能的方向。

9.1 标签生成自动化

传统标签生成依赖人工命名和审核,成本高、周期长。LLM可以自动从聚类结果中提取代表性文本,生成候选标签名称,甚至自动判断标签的意图层级。这可以大幅降低人工成本。

本文评述:LLM生成的标签需要人工审核,不能直接上线。LLM可能生成不准确、不合规、或不符合业务语境的标签。人工审核仍然是必要环节,但审核效率可以提升。

9.2 意图理解深度化

传统意图分类只能识别粗粒度类别。LLM可以理解更复杂的意图,比如用户的情绪状态、决策障碍、潜在顾虑。这对于细标签的意图分层非常有价值。

比如,用户说“跳绳2个月没瘦,是不是我不适合跳绳”,传统模型可能只识别到“跳绳”和“没瘦”。LLM可以进一步识别出“自我怀疑”和“寻求认同”的意图,从而匹配更合适的内容。

9.3 隐私保护的挑战

LLM的强大理解能力也带来了隐私风险。模型可能从看似无害的数据中推断出敏感信息。比如,从用户的运动记录和饮食记录中,推断出用户的健康状况。这要求标签工程在数据使用上更加谨慎。

笔者认为,大模型时代的标签工程,核心矛盾是“理解能力”和“隐私保护”之间的张力。理解越深,隐私风险越大。工程上需要在两者之间找到平衡,可能的方向包括联邦学习、差分隐私、同态加密等技术。

10. 操作路径总结与检查清单

把前面的内容串起来,细标签工程可以归纳为一条可落地的操作路径。

10.1 七步操作路径

  1. 明确目标:确定标签用于什么场景(投放、推荐、运营),目标指标是什么(点击率、转化率、ROI)。
  2. 盘点数据:列出可用的数据源,评估数据质量、覆盖度、合规性。
  3. 数据预处理:清洗、去重、标准化、分词、标注。
  4. 语义聚类:向量化、聚类、提取代表性文本。
  5. 标签命名与审核:人工命名、合并拆分、评估覆盖人数。
  6. 意图分层:用规则或模型把标签分为问题层、方案层、决策层。
  7. AB验证:设计实验、跑数据、评估效果、迭代优化。

10.2 检查清单

检查项 通过标准
标签是否描述具体行为或意图 不是身份描述,而是问题或行为描述
标签覆盖人数是否足够 满足实验最小样本量要求
标签是否可触达 平台支持该标签定向
标签是否合规 不涉及敏感信息,或已获单独同意
标签是否经过AB验证 有实验数据支撑,效果显著

10.3 拓展学习资源

以下资源可以帮助读者进一步学习标签工程、用户意图建模和AB实验方法:

11. 参考文献与资料

本文参考了以下文献和资料。文献总数60篇,其中近三年(2022—2024)文献占比超过50%。以下列出主要参考文献8篇,其余以列表形式呈现。

主要参考文献

  1. Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379–423.
  2. Reimers, N., & Gurevych, I. (2019). Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of EMNLP 2019.
  3. McInnes, L., Healy, J., & Astels, S. (2017). hdbscan: Hierarchical density based clustering. Journal of Open Source Software, 2(11), 205.
  4. Kohavi, R., Tang, D., & Xu, Y. (2020). Trustworthy Online Controlled Experiments. Cambridge University Press.
  5. Chen, T., & Guestrin, C. (2016). XGBoost: A Scalable Tree Boosting System. Proceedings of KDD 2016.
  6. Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. Proceedings of NAACL 2019.
  7. 中华人民共和国个人信息保护法. (2021). 全国人民代表大会常务委员会.
  8. Blei, D. M., Ng, A. Y., & Jordan, M. I. (2003). Latent Dirichlet Allocation. Journal of Machine Learning Research, 3, 993–1022.

扩展参考文献(52篇)

  1. Aggarwal, C. C. (2018). Machine Learning for Text. Springer.
  2. Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press.
  3. Jurafsky, D., & Martin, J. H. (2023). Speech and Language Processing (3rd ed. draft).
  4. Provost, F., & Fawcett, T. (2013). Data Science for Business. O'Reilly Media.
  5. Mayer-Schönberger, V., & Cukier, K. (2013). Big Data. Houghton Mifflin Harcourt.
  6. Kumar, V., & Reinartz, W. (2018). Customer Relationship Management (3rd ed.). Springer.
  7. Wedel, M., & Kamakura, W. A. (2000). Market Segmentation (2nd ed.). Springer.
  8. Smith, W. R. (1956). Product Differentiation and Market Segmentation as Alternative Marketing Strategies. Journal of Marketing, 21(1), 3–8.
  9. Wind, Y. (1978). Issues and Advances in Segmentation Research. Journal of Marketing Research, 15(3), 317–337.
  10. Dibb, S., & Simkin, L. (2008). Market Segmentation Success. Routledge.
  11. Mikolov, T., Sutskever, I., Chen, K., Corrado, G., & Dean, J. (2013). Distributed Representations of Words and Phrases. Proceedings of NIPS 2013.
  12. Pennington, J., Socher, R., & Manning, C. D. (2014). GloVe: Global Vectors for Word Representation. Proceedings of EMNLP 2014.
  13. Vaswani, A., et al. (2017). Attention Is All You Need. Proceedings of NIPS 2017.
  14. Brown, T. B., et al. (2020).
🔒 复制本站文章内容需登录并达到 L3。当前:未登录

分享到

💬
微信
📷
朋友圈
🐧
QQ好友
🌐
QQ空间
👁
微博
📌
钉钉
🔗
复制链接
📑
复制图文

微信扫一扫分享

打开微信「扫一扫」,扫描二维码后在微信中分享给好友或朋友圈。

💬 评论 (0)

评论功能已关闭

⏸️ 本站暂未开放评论功能,不能进行评论,此为规划的后续开发预留
首页| 关于本网| 网站声明| 联系我们| 网站纠错| 服务| 网站地图
黔ICP备19010680号-1  |  邮箱:six528528@163.com
贵公网安备 52010302001819号
Copyright 2019-2026 http://www.databrush.com/ All rights reserved.
QQ
QQ扫一扫
Logo
DBN数据刷