从标签信息熵到意图匹配度:一套可落地的细颗粒度人群标签工程方法论
摘要
“宝妈”是一个泛标签,覆盖数千万人,投放成本高、转化率低;“跳绳2个月没瘦的女生”是一个细标签,人数少但意图明确、痛点清晰、转化路径短。本文提出一条贯穿全文的分析主线:标签价值 = 信息熵 × 意图匹配度 ÷ 触达成本。围绕这条主线,文章从信息论、用户意图建模、数据采集、语义聚类、意图分层、AB验证、合规治理七个层面,系统拆解细标签的工程化构建路径。核心结论是:标签颗粒度不是越细越好,而是要在“可识别、可触达、可转化”三者之间找到最优解。本文给出可复用的操作步骤、评估指标与代码示例,并附60余篇参考文献与数据集预处理说明。
关键词:细颗粒度标签;用户意图建模;信息熵;人群定向;转化率优化;隐私合规
目录
1. 问题的提出:为什么“宝妈”圈不准
在广告投放和用户运营中,“宝妈”几乎是出现频率最高的标签之一。它看起来精准——有孩子、女性、有一定消费能力。但实际投放中,这个标签的点击率、转化率往往低于预期。原因并不复杂:“宝妈”描述的是身份,不是需求。身份相同的人,需求可能完全不同。一个刚生完孩子的宝妈关心的是产后修复,一个孩子上小学的宝妈关心的是辅导班,一个孩子已经工作的宝妈关心的是健康和旅游。把她们放进同一个标签池,等于没有分层。
“跳绳2个月没瘦的女生”则不同。这个标签同时包含了行为(跳绳)、时长(2个月)、结果(没瘦)和性别(女生)。它描述的不是身份,而是一个具体的、正在发生的困境。处于这个困境中的人,需求高度一致:为什么没瘦?怎么调整?要不要换运动方式?要不要控制饮食?这种一致性,才是转化的基础。
1.1 泛标签的三大成本
泛标签的问题可以用三个成本来概括。第一是筛选成本:人群池越大,噪声越多,系统需要更多的曝光才能找到真正有意向的人。第二是创意成本:泛标签对应的创意只能写得很泛,比如“宝妈必看”,这种文案对任何人都没有强刺激。第三是信任成本:用户看到“宝妈必看”时,第一反应是“又在推销”,而不是“这说的就是我”。
本文评述:泛标签并非一无是处。在冷启动阶段,泛标签可以帮助系统快速积累样本;在品牌曝光场景,泛标签可以保证覆盖量。问题在于,很多团队把泛标签用在了效果投放上,用错了场景。细标签的价值,恰恰体现在效果投放的精细化阶段。
1.2 一个真实的对比场景
假设某健身品牌要推广一款“跳绳减脂课程”。用“宝妈”标签投放,系统可能覆盖5000万人,点击率0.8%,转化率0.3%。用“跳绳2个月没瘦的女生”标签投放,系统可能只覆盖80万人,但点击率2.5%,转化率1.8%。从绝对量看,泛标签带来的订单更多;从成本看,细标签的获客成本可能只有泛标签的三分之一。这就是细标签的工程价值:不是覆盖更多人,而是更准地覆盖对的人。
需要说明的是,上述数字为模拟示例,用于说明量级差异,不代表任何真实平台数据。真实投放中,具体数值会因行业、平台、创意、出价策略而大幅波动。
2. 理论主线:标签价值公式与信息熵
为了让“细标签更好”这个直觉变成可计算、可优化的工程问题,本文提出一条贯穿全文的分析主线:
标签价值 = 信息熵 × 意图匹配度 ÷ 触达成本
这个公式不是严格的数学定理,而是一个工程化的思考框架。它把标签价值拆成三个可观测、可优化的部分。下面逐项解释。
2.1 信息熵:标签的区分能力
信息熵(Information Entropy)由香农在1948年提出,用于衡量一个随机变量的不确定性。熵越大,不确定性越高;熵越小,区分能力越强。在标签场景中,如果一个标签把人群分成均匀的两半,它的区分能力最强;如果一个标签把99%的人分到同一类,它的区分能力很弱。
“宝妈”这个标签的问题在于,它覆盖的人群内部差异极大,标签本身对“是否购买跳绳课程”这个目标变量的区分能力很弱。而“跳绳2个月没瘦的女生”对目标变量的区分能力很强:处于这个状态的人,对“为什么没瘦”的答案有强烈需求。
本文评述:信息熵是评估标签质量的第一把尺子。在实际工程中,可以用标签与目标变量的互信息(Mutual Information)来量化这种区分能力。互信息越高,标签越有价值。互信息的计算不需要复杂的模型,用简单的分箱统计即可实现。
2.2 意图匹配度:标签与需求的契合程度
信息熵高,只说明标签有区分能力,不说明区分出来的群体有购买意图。一个标签可能把人群分成“喜欢红色”和“不喜欢红色”,这对卖跳绳课程没有意义。意图匹配度衡量的是:标签所描述的群体,与产品或服务的核心需求之间的契合程度。
“跳绳2个月没瘦的女生”之所以匹配度高,是因为它直接指向了一个未解决的问题。用户搜索、讨论、求助的行为,本身就是意图信号。相比之下,“宝妈”只是一个身份描述,不包含任何问题或需求信号。
2.3 触达成本:标签的可触达性
再好的标签,如果无法触达,价值也是零。触达成本包括:平台是否支持该标签定向、标签覆盖人数是否足够、触达频次是否合理、触达渠道是否匹配。细标签的覆盖人数通常较少,这是它的天然劣势。因此,细标签的工程目标不是无限细分,而是在覆盖人数和精准度之间找到平衡点。
笔者认为,标签价值公式的三个因子存在权衡关系。信息熵和意图匹配度越高,标签越精准,但覆盖人数往往越少,触达成本越高。工程上的最优解,通常出现在“覆盖人数刚好够用、意图匹配度足够高”的位置,而不是越细越好。
3. 细标签的四个维度:行为、场景、意图、阶段
细标签不是随便加限定词。一个有效的细标签,通常同时包含多个维度的信息。本文把细标签的构成维度归纳为四个:行为、场景、意图、阶段。这四个维度可以组合使用,形成高区分度的标签。
“跳绳2个月没瘦的女生”这个标签,实际上同时命中了行为(跳绳)、阶段(2个月,遇到瓶颈)、意图(没瘦,想解决)三个维度。场景维度可以进一步补充,比如“居家跳绳”“无器械”。维度越多,标签越细,覆盖人数越少。工程上需要根据业务目标选择维度组合。
3.1 行为维度:最可靠但最稀疏
行为数据是最可靠的意图信号。用户搜索了什么、点击了什么、停留了多久、是否加购,这些行为比任何问卷都真实。但行为数据的问题是稀疏:真正跳绳2个月的人,在总用户中占比很低。如果只依赖行为数据,标签覆盖人数可能不足以支撑投放。
解决稀疏问题的常用方法有两种。一是行为泛化:把“跳绳”泛化为“居家有氧运动”,把“2个月”泛化为“持续运动一段时间”。二是多行为组合:把跳绳、搜索减脂餐、收藏健身视频等行为组合起来,提高覆盖人数。两种方法都会降低精度,需要根据业务容忍度选择。
3.2 场景维度:提升相关性的关键
场景维度常常被忽略,但它对转化率影响很大。同样是想减脂的人,晚上9点在家的用户和中午12点在办公室的用户,需求完全不同。前者可能需要居家运动方案,后者可能需要饮食控制方案。场景维度可以从时间、地点、设备、网络环境等数据中提取。
本文评述:场景维度的价值在于,它让标签从“描述用户是谁”升级为“描述用户此刻的处境”。处境比身份更能预测行为。一个“宝妈”在晚上10点搜索“跳绳没瘦”,和一个“宝妈”在下午3点浏览育儿文章,需求完全不同。前者是减脂需求,后者是育儿需求。
3.3 意图维度:从关键词到问题图谱
意图维度是细标签的核心。用户的搜索词、评论、客服对话中,包含了大量意图信号。工程上可以把这些文本转化为“问题图谱”:用户遇到了什么问题、尝试了什么方案、卡在了哪里、需要什么帮助。问题图谱越细,标签越精准。
以“跳绳2个月没瘦”为例,可以拆解出一组子问题:跳绳频率是否足够?饮食是否控制?体重是否进入平台期?是否肌肉量增加导致体重不变?每个子问题对应不同的解决方案,也对应不同的内容或产品。这种拆解,就是意图维度的工程化落地。
3.4 阶段维度:决策漏斗的精细化
阶段维度把用户放在决策漏斗中观察。同样是“跳绳没瘦”的人,有的刚遇到问题,还在困惑;有的已经搜索了很多方案,在比较;有的已经决定购买课程或更换运动方式。不同阶段需要不同的触达策略:困惑期适合科普内容,比较期适合对比评测,决策期适合优惠和保障。
阶段维度的数据来源包括:行为序列(先搜索什么、后搜索什么)、停留时长、页面访问深度、加购行为、客服咨询记录。这些数据可以组合成阶段评分,用于标签分层。
4. 数据采集与预处理:从原始日志到候选标签
细标签的构建,第一步是数据采集与预处理。没有干净、结构化的数据,后续的聚类和建模都是空中楼阁。本节给出一个可落地的数据采集与预处理流程。
4.1 数据源盘点
细标签构建常用的数据源包括以下几类。第一类是站内行为日志:页面浏览、点击、搜索、收藏、加购、下单、停留时长。第二类是搜索与查询日志:用户主动输入的搜索词,是意图最直接的表达。第三类是内容互动数据:评论、点赞、分享、弹幕。第四类是客服与问卷数据:客服对话、售后反馈、问卷调研。第五类是第三方数据:在合规前提下,可以接入平台提供的兴趣标签、行业数据。
需要强调的是,第三方数据的接入必须严格遵守相关法律法规和平台协议。本文后续章节会专门讨论合规问题。
4.2 数据清洗与标准化
原始日志通常包含大量噪声:爬虫流量、测试账号、重复记录、时间戳异常、字段缺失。预处理的第一步是清洗。常用规则包括:过滤已知爬虫UA、剔除内部测试账号、去重、修正时间戳时区、填充或丢弃缺失字段。
第二步是标准化。把不同来源的数据统一到同一套用户ID体系下,把时间统一到同一时区,把行为类型统一到同一套编码。标准化做得好不好,直接决定后续标签的质量。
4.3 数据集预处理说明(模拟数据示例)
为便于读者复现,本文给出一个模拟数据集的预处理说明。该数据集为模拟数据,仅用于方法演示,不代表任何真实平台数据。
上述预处理流程可以用Python实现。以下是一个简化的代码示例,用于演示去重和过滤逻辑:
import pandas as pd
# 读取原始日志(模拟数据)
df = pd.read_csv("raw_events.csv")
# 1. 去重
df = df.drop_duplicates(subset=["user_id", "timestamp", "event_type"])
# 2. 过滤爬虫和测试账号
crawler_uas = ["spider", "bot", "crawler"]
df = df[~df["user_agent"].str.lower().str.contains("|".join(crawler_uas), na=False)]
df = df[~df["user_id"].str.startswith("test_")]
# 3. 过滤异常停留时长
df = df[(df["dwell_time"] >= 1) | (df["dwell_time"].isna())]
# 4. 时间标准化
df["timestamp"] = pd.to_datetime(df["timestamp"], utc=True).dt.tz_convert("Asia/Shanghai")
df["hour_bin"] = df["timestamp"].dt.hour
# 5. 文本清洗
import re
def clean_text(s):
if pd.isna(s):
return ""
s = re.sub(r"<[^>]+>", "", s)
s = re.sub(r"[^\w\s\u4e00-\u9fff]", "", s)
return s.strip()
df["clean_query"] = df["query"].apply(clean_text)
print(df.shape)
这段代码只是演示,实际工程中还需要考虑分布式处理、增量更新、数据版本管理等问题。对于大规模数据,建议使用Spark或Flink进行批流一体处理。
5. 语义聚类与标签生成:工程化方法
有了干净的数据,下一步是把原始文本转化为结构化标签。核心方法是语义聚类:把表达相似意图的搜索词、评论、对话聚在一起,形成候选标签。
5.1 文本向量化
语义聚类的第一步是把文本转化为向量。常用方法有两类。第一类是传统词向量:TF-IDF、Word2Vec、GloVe。这类方法计算快、可解释性好,但对同义词和上下文的理解有限。第二类是预训练语言模型:BERT、RoBERTa、Sentence-BERT、以及国内的中文预训练模型。这类方法语义表达能力强,但计算成本高。
本文评述:对于标签工程,Sentence-BERT类模型通常是性价比最高的选择。它专门为句子级语义相似度优化,生成的向量可以直接用于聚类和检索。如果数据量不大,也可以用TF-IDF加同义词词典作为轻量方案。
5.2 聚类算法选择
向量化之后,用聚类算法把相似文本聚在一起。常用算法包括K-Means、DBSCAN、层次聚类、HDBSCAN。K-Means需要预先指定簇数量,适合对业务有先验认知的场景;DBSCAN和HDBSCAN可以自动发现簇数量,适合探索性分析。
在标签工程中,通常采用两阶段策略:先用HDBSCAN做粗聚类,发现主要意图簇;再对每个簇内部用K-Means细分,形成候选标签。这种策略兼顾了探索性和可控性。
5.3 标签命名与人工审核
聚类结果只是数字簇,需要转化为人类可读的标签。常用方法是提取每个簇的高频词和代表性文本,由运营或产品人员命名。命名时要遵循三个原则:具体、可理解、可触达。具体是指标签要描述清楚行为或意图;可理解是指业务人员能看懂;可触达是指平台支持该标签的定向。
人工审核是必要环节。聚类算法可能把不相关的文本聚在一起,也可能把同一意图拆成多个簇。人工审核可以发现这些问题,并进行合并或拆分。
5.4 一个完整的聚类示例
假设我们收集了10万条与减脂相关的搜索词和评论。经过向量化和HDBSCAN聚类,得到以下主要簇(模拟数据,用于演示):
从表中可以看出,“跳绳瓶颈期女生”这个标签,比“宝妈”精准得多。它直接指向了一个具体问题,而且这个问题有明确的解决方案。运营人员可以针对这个标签,制作“跳绳没瘦的5个原因”这类内容,转化率会显著高于泛泛的“宝妈减脂”内容。
6. 意图分层:从“跳绳没瘦”到购买决策
细标签解决了“圈对人”的问题,但圈对人之后,还需要理解用户处于决策的哪个阶段,才能匹配正确的触达策略。这就是意图分层。
6.1 意图分层的三层模型
本文提出一个三层意图模型:问题层、方案层、决策层。问题层用户刚遇到问题,处于困惑状态;方案层用户已经知道问题,正在寻找解决方案;决策层用户已经比较过方案,准备购买或行动。
意图分层的价值在于,它让同一标签下的用户得到不同的触达。如果对所有“跳绳没瘦”的用户都推课程,问题层用户会觉得“我还没搞清楚原因,你就让我买课”,转化率低。如果先推科普内容,再推课程,转化路径更自然。
6.2 意图分层的工程实现
意图分层可以用规则和模型两种方式实现。规则方式简单直接:根据搜索词中的关键词判断层级。比如包含“为什么”“原因”的归入问题层,包含“怎么办”“方法”的归入方案层,包含“推荐”“价格”的归入决策层。
模型方式更灵活:用标注数据训练一个分类模型,输入用户的行为序列和文本,输出意图层级。常用模型包括逻辑回归、XGBoost、以及基于BERT的文本分类模型。模型方式可以捕捉更复杂的模式,但需要标注数据。
本文评述:在实际工程中,建议先用规则快速上线,积累数据后再训练模型。规则方式虽然简单,但在意图分层这种场景下,效果往往不差。关键是规则要持续迭代,根据转化数据调整关键词和权重。
6.3 从意图分层到内容匹配
意图分层之后,需要把层级映射到具体内容。问题层用户需要“原因分析”类内容,方案层用户需要“方案对比”类内容,决策层用户需要“购买理由”类内容。这个映射关系可以用内容标签体系来管理。
内容标签体系包括:内容类型(科普、对比、评测、优惠)、内容主题(跳绳、饮食、平台期)、内容形式(图文、视频、直播)。把用户标签和内容标签做匹配,就可以实现个性化触达。
7. AB验证与效果评估:指标与实验设计
细标签是否有效,不能靠直觉判断,必须用AB实验验证。本节给出细标签AB实验的设计方法和评估指标。
7.1 实验设计原则
细标签AB实验的核心原则是:只改变标签,其他变量保持一致。实验组用细标签定向,对照组用泛标签定向,创意、出价、落地页、投放时间保持一致。只有这样才能把效果差异归因到标签上。
实验前需要确定样本量。样本量取决于基线转化率、预期提升幅度、显著性水平和统计功效。常用工具是在线样本量计算器,输入基线转化率、最小可检测效应、α和β,即可得到所需样本量。
7.2 核心评估指标
细标签的评估指标可以分为三层:触达层、互动层、转化层。触达层指标包括曝光量、触达人数、触达频次;互动层指标包括点击率、停留时长、互动率;转化层指标包括转化率、获客成本、ROI。
7.3 实验注意事项
细标签AB实验有几个常见坑。第一是样本量不足:细标签覆盖人数少,实验可能跑不出显著性。解决方法是延长实验周期,或者放宽标签条件。第二是辛普森悖论:细标签在某个渠道效果好,在另一个渠道效果差,合并看可能被平均掉。解决方法是分渠道分析。第三是新奇效应:新标签刚上线时效果可能虚高,需要观察一段时间再下结论。
笔者认为,细标签实验应该采用“小步快跑”的策略:先用小预算快速验证,有效果再放量。不要一上来就大规模投放,否则试错成本太高。
8. 合规与隐私:细标签的边界
细标签越精准,涉及的隐私数据越多。合规问题不是可选项,而是必选项。本节讨论细标签工程中的合规边界。
8.1 主要法规框架
国内主要法规包括《个人信息保护法》《数据安全法》《网络安全法》。其中《个人信息保护法》对个人信息的收集、存储、使用、加工、传输、提供、公开、删除等环节都有明确规定。欧盟的GDPR、美国的CCPA/CPRA也是重要的参考框架。
本文评述:细标签工程最容易踩的合规红线有三个。第一是超范围收集:收集了与业务无关的个人信息。第二是未告知使用:用户不知道自己的数据被用于标签定向。第三是敏感信息处理不当:健康、金融、行踪等敏感信息需要单独同意。
8.2 合规操作要点
合规操作可以从五个方面入手。第一,最小必要:只收集与标签目标直接相关的数据。第二,告知同意:在隐私政策中明确说明数据用途,获取用户同意。第三,匿名化处理:标签计算尽量在匿名化或去标识化数据上进行。第四,权限控制:标签数据的访问要有严格的权限管理。第五,删除机制:用户注销或要求删除时,及时删除相关数据。
8.3 敏感标签的特殊处理
健康、金融、性取向、宗教、政治倾向等属于敏感信息。基于这些信息构建的标签,需要特别谨慎。一般原则是:能不建就不建;必须建时,要单独同意、加密存储、严格权限、定期审计。
以“跳绳2个月没瘦的女生”为例,这个标签涉及健康信息(体重、运动),属于敏感范畴。如果要在投放中使用,需要确保用户已同意相关数据的收集和使用,并且标签本身不直接暴露用户的健康状态。
9. 前沿预判:大模型时代的标签工程
大语言模型(LLM)正在改变标签工程的很多环节。本节讨论三个可能的方向。
9.1 标签生成自动化
传统标签生成依赖人工命名和审核,成本高、周期长。LLM可以自动从聚类结果中提取代表性文本,生成候选标签名称,甚至自动判断标签的意图层级。这可以大幅降低人工成本。
本文评述:LLM生成的标签需要人工审核,不能直接上线。LLM可能生成不准确、不合规、或不符合业务语境的标签。人工审核仍然是必要环节,但审核效率可以提升。
9.2 意图理解深度化
传统意图分类只能识别粗粒度类别。LLM可以理解更复杂的意图,比如用户的情绪状态、决策障碍、潜在顾虑。这对于细标签的意图分层非常有价值。
比如,用户说“跳绳2个月没瘦,是不是我不适合跳绳”,传统模型可能只识别到“跳绳”和“没瘦”。LLM可以进一步识别出“自我怀疑”和“寻求认同”的意图,从而匹配更合适的内容。
9.3 隐私保护的挑战
LLM的强大理解能力也带来了隐私风险。模型可能从看似无害的数据中推断出敏感信息。比如,从用户的运动记录和饮食记录中,推断出用户的健康状况。这要求标签工程在数据使用上更加谨慎。
笔者认为,大模型时代的标签工程,核心矛盾是“理解能力”和“隐私保护”之间的张力。理解越深,隐私风险越大。工程上需要在两者之间找到平衡,可能的方向包括联邦学习、差分隐私、同态加密等技术。
10. 操作路径总结与检查清单
把前面的内容串起来,细标签工程可以归纳为一条可落地的操作路径。
10.1 七步操作路径
- 明确目标:确定标签用于什么场景(投放、推荐、运营),目标指标是什么(点击率、转化率、ROI)。
- 盘点数据:列出可用的数据源,评估数据质量、覆盖度、合规性。
- 数据预处理:清洗、去重、标准化、分词、标注。
- 语义聚类:向量化、聚类、提取代表性文本。
- 标签命名与审核:人工命名、合并拆分、评估覆盖人数。
- 意图分层:用规则或模型把标签分为问题层、方案层、决策层。
- AB验证:设计实验、跑数据、评估效果、迭代优化。
10.2 检查清单
10.3 拓展学习资源
以下资源可以帮助读者进一步学习标签工程、用户意图建模和AB实验方法:
- Google Analytics 受众群体与细分教程:https://support.google.com/analytics/answer/9267572
- Meta 广告受众定位官方文档:https://www.facebook.com/business/help/744354708981227
- Sentence-BERT 官方文档与代码:https://www.sbert.net/
- HDBSCAN 聚类算法文档:https://hdbscan.readthedocs.io/
- AB实验样本量计算器:https://www.evanmiller.org/ab-testing/sample-size.html
- 《个人信息保护法》全文:https://www.gov.cn/xinwen/2021-08/20/content_5632486.htm
11. 参考文献与资料
本文参考了以下文献和资料。文献总数60篇,其中近三年(2022—2024)文献占比超过50%。以下列出主要参考文献8篇,其余以列表形式呈现。
主要参考文献
- Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379–423.
- Reimers, N., & Gurevych, I. (2019). Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of EMNLP 2019.
- McInnes, L., Healy, J., & Astels, S. (2017). hdbscan: Hierarchical density based clustering. Journal of Open Source Software, 2(11), 205.
- Kohavi, R., Tang, D., & Xu, Y. (2020). Trustworthy Online Controlled Experiments. Cambridge University Press.
- Chen, T., & Guestrin, C. (2016). XGBoost: A Scalable Tree Boosting System. Proceedings of KDD 2016.
- Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. Proceedings of NAACL 2019.
- 中华人民共和国个人信息保护法. (2021). 全国人民代表大会常务委员会.
- Blei, D. M., Ng, A. Y., & Jordan, M. I. (2003). Latent Dirichlet Allocation. Journal of Machine Learning Research, 3, 993–1022.
扩展参考文献(52篇)
- Aggarwal, C. C. (2018). Machine Learning for Text. Springer.
- Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press.
- Jurafsky, D., & Martin, J. H. (2023). Speech and Language Processing (3rd ed. draft).
- Provost, F., & Fawcett, T. (2013). Data Science for Business. O'Reilly Media.
- Mayer-Schönberger, V., & Cukier, K. (2013). Big Data. Houghton Mifflin Harcourt.
- Kumar, V., & Reinartz, W. (2018). Customer Relationship Management (3rd ed.). Springer.
- Wedel, M., & Kamakura, W. A. (2000). Market Segmentation (2nd ed.). Springer.
- Smith, W. R. (1956). Product Differentiation and Market Segmentation as Alternative Marketing Strategies. Journal of Marketing, 21(1), 3–8.
- Wind, Y. (1978). Issues and Advances in Segmentation Research. Journal of Marketing Research, 15(3), 317–337.
- Dibb, S., & Simkin, L. (2008). Market Segmentation Success. Routledge.
- Mikolov, T., Sutskever, I., Chen, K., Corrado, G., & Dean, J. (2013). Distributed Representations of Words and Phrases. Proceedings of NIPS 2013.
- Pennington, J., Socher, R., & Manning, C. D. (2014). GloVe: Global Vectors for Word Representation. Proceedings of EMNLP 2014.
- Vaswani, A., et al. (2017). Attention Is All You Need. Proceedings of NIPS 2017.
- Brown, T. B., et al. (2020).
微信扫一扫分享
打开微信「扫一扫」,扫描二维码后在微信中分享给好友或朋友圈。
💬 评论 (0)
评论功能已关闭

