词频统计
词频统计,是指把一段中文或英文文本自动切分成词,统计每个词出现了多少次、占全文多大比例,再按次数从高到低列成一张表;在小鹿tools,分词与计数都在浏览器本地完成、文本不上传,原文一字不改。内置按词、按单字、按 N 元组三种统计口径,停用词表可查也可撤销,专有名词写进自定义词典就不会被切开。中文分词用浏览器自带的 Intl.Segmenter,不下载任何词典文件,结果可排序、复制并导出 CSV。
粘进来就能用:默认按词分词 + 基础停用词 + 至少 2 个字。分词用浏览器内置的 Intl.Segmenter,不下载任何词典文件,原文一个字都不会被改动。
🔒 分词与计数全部在你的浏览器本地用 JS 完成,文本不上传任何服务器,也不下载任何词典文件, 关闭页面即清除;本地只记住你的参数偏好,不保存文本内容与自定义词典。 本工具只读不改原文:上面输入框里的文字一个字都不会被改动,结果是新产生的一张词频表。 分词用的是浏览器内置的 Intl.Segmenter(ICU),locale 固定为 zh-Hans-CN,所以换一台电脑、换一个系统语言, 同一段文字切出来的词也完全一样。
如何使用词频统计
粘贴文章,或拖入 .txt / .md / .csv / .log / .srt 纯文本文件(单文件 5 MB 以内,按 UTF-8 读取)。Word 文档请先用「文档字数统计」或「Word 转 TXT」取出正文再粘过来。粘完 250 毫秒内就出结果,10 万字以内全程实时。
选口径和停用词档位:想省事就直接点预设,「文章高频词」看主题词、「汉字字频」看单字、「固定搭配(N 元)」找口头禅。停用词有「不过滤 / 基础 / 严格」三档,内置词表可以在页面上完整查看,也可以自己追加,或者用「取消内置停用词」把某个词捞回来。专有名词被切开就写进自定义词典。
看统计条与词频表:每个词的次数、占比、词长、类型、首次出现位置和分布在几行都在表里,点「定位」能跳回原文核对。对结果有疑问就看下面的「被滤除的词」清单,每个没进表的词都写明了原因。最后复制 TSV / Markdown / JSON,或下载带 BOM 的 CSV。
关于词频统计的常见问题
- 词频统计会上传我的文章吗
- 不会上传。分词、计数、排序全部在你的浏览器里用 JavaScript 完成,页面没有任何一次把内容发往服务器的请求,关闭或刷新页面即全部清除,断网状态下同样能用。本页也不把文本写进 localStorage,只记住你选了哪个口径、哪档停用词这类参数偏好。自定义词典同样不保存——词典里常有公司内部的产品名、项目代号和人名,留在浏览器里并不合适,所以刷新后需要重新粘贴。另外本工具是只读的:输入框里的原文一个字都不会被改动,结果是新产生的一张词频表。
- 词频统计怎么统计文章中每个词出现的次数
- 把文章粘贴进输入框就行,工具会自动中文分词,然后列出一张表:每个词、出现次数、占比、词长、字符类型、首次出现在第几行第几列,以及它分布在多少个不同的行里。默认按次数从高到低排,也可以改成按次数从少到多、按首次出现顺序、按词长或按字典序。10 万字以内是边打边出结果的,超过之后会切换成点「开始统计」再分片计算,带进度条、可以随时取消。
- 中文词频统计和英文词频统计有什么不一样
- 英文有空格天然分词,中文没有,必须先做分词,这是两者最大的区别。本工具的中文分词用浏览器内置的 Intl.Segmenter(ICU),不需要下载任何词典文件;英文和数字则是在交给分词器之前就用正则先挖走的,按字母串切分,it’s、well-known 算一个词,与本站「在线字数统计」的英文词数口径完全一致,有交叉单测钉住不许漂移。这样处理还有个好处:中英混排的「小鹿tools」会自然切成「小鹿 + tools」两个词。
- 词频统计怎么过滤的了是这些停用词
- 用停用词功能,默认就开着「基础」档,会滤掉中文虚词代词(的、了、是、在、和、这、那、我们…)和英文常见虚词(the、a、of、and、to…)。还有更狠的「严格」档,会连量词、时间词、程度副词、公文虚化名词(个、些、年、月、已经、非常、进行、方面、情况…)一起滤掉。内置词表可以在页面上点「查看内置词表」完整看到并复制,也可以在「再追加停用词」里自己加。反过来,如果你做的是古文分析、需要保留「之、乎、者、也」,用「取消内置停用词」把它们捞回来就行——只给追加不给撤销的停用词就是黑箱。
- 词频统计时专有名词被切开了怎么办
- 把它写进「自定义词典」,一行一个,工具会在分词之前先按最长优先把这些词整体挖出来,不再交给分词器切。公司名、产品名、行业术语、人名、译名都适用,词典里的词还会优先于停用词(同时写进两边时以词典为准,页面会提示这个冲突)。如果懒得一个个加,也可以切到「按 N 元组」口径,直接统计连续 2 到 4 个字的固定搭配,反过来去发现哪些词被切坏了。还有一个相反的开关:分词器把不该粘的粘一起时,写进「强制拆分」按字拆开。
- 词频统计按词、按单字、按 N 元有什么区别
- 按词是默认口径,用 Intl.Segmenter 自动分词,适合看文章关键词;按单字是逐个汉字统计次数,适合诗词用字、教材字频、书法选字;按 N 元是把连续 2 到 4 个字(英文是连续 2 到 4 个单词)当一个单位滑动统计,完全不依赖分词器,适合找固定搭配和口头禅。N 元的结果天然重叠——「人民共和」和「人民共和国」都会出现,所以页面默认开了子串剪枝,把被更长组合完全包含且次数相同的那些剪掉,并告诉你剪了多少条。页面正文里有三种口径在同一句话上的完整对照表。
- 词频统计里的占比是怎么算出来的
- 占比 = 该词出现次数 ÷ 过滤之后的总词次,不是除以全文字数,也不是除以过滤前的词数。举个例子:一段话切出 6210 个词,滤掉停用词和短词之后还剩 3105 个,那么分母就是 3105。三种分母算出来能差好几倍,所以页面在统计卡下面明确写出了本次的分母是多少、切出多少、滤除多少。要注意它是用来横向比较词与词之间轻重的,不等于 SEO 里说的关键词密度,本页也不给任何「密度应该在百分之几」这类建议。
- 词频统计能当关键词提取工具用吗
- 能当第一步用,但两者不是一回事。搜「文本关键词提取在线」找过来的人,多半以为这两件事是一件。词频统计回答的是「这篇里哪些词出现得多」,把停用词开到严格档、再把专有名词加进自定义词典,Top 20 基本就是这份材料的主题词,做公文、论文、聊天记录的快速摸底够用了。短板在于它只看本篇的次数,不知道某个词在别的文章里是不是也一样常见——「工作、问题、情况、方面」几乎篇篇高频,却往往不是这一篇的重点。专业的关键词提取会再用 TF-IDF、TextRank 之类的算法压一次权重,本工具不做这一步,也不给所谓的「关键词得分」。想更接近关键词的效果,可以先切到 N 元口径找出被切开的长词,加进词典后再回按词口径看一遍。
- 词频统计结果里少了几个词是漏了吗
- 没漏。任何一个被滤掉的词都会出现在「被滤除的词」清单里,并写明原因:命中停用词表、词太短、词太长、出现次数不够、字符类型没勾选,或者是被 N 元剪枝剪掉的。这张清单默认就展示在页面上而不是折叠起来,可以逐条核对。要注意两个数字的口径不同:统计卡里的滤除数是全量的「词次」,而清单最多列前 50 个「词」,所以清单条数通常小于滤除数。另外纯标点和空白从来不算词,也不计入总词数。
- 词频统计能统计汉字出现的次数吗
- 能,把统计口径切到「按单字」,或者直接点「汉字字频」预设即可,会逐个汉字统计次数与占比,并且只统计汉字。这一档预设默认把停用词关掉,因为做字频分析时「的、了、是」本身就是要看的对象。切分按字素簇进行,emoji 和带组合符号的字符会按一个整体计 1,不会被拆坏,代理对也不会被劈开。做诗词用字、教材生字表、书法选字都用这一档。
- 词频统计时英文大小写和单复数会合并吗
- 大小写默认合并:Apple、APPLE、apple 算同一个词,显示成出现次数最多的那种写法(并列时取首次出现的),表里还会用小字列出被合并掉的写法,不会默默把 Apple 显示成 apple。单复数和时态不合并,run 和 running 分开计数——半吊子的词形还原会把 bus 变成 bu、analysis 变成 analysi,比不做更糟,所以本工具老实不做,需要词干还原请用专业的 NLP 工具。另外还有全角半角合并(AI = AI)和剥掉粘连标点(「发展。」算作「发展」)两个开关,默认都开着。
- 词频统计能把繁体和简体合并计数吗
- 能,打开「繁简合并」开关,電腦 和 电脑 会合并成一行计数,显示成出现更多的那种写法,展开还能看到被合并的写法。要说明两点:一是它只影响计数,不会把你的原文转换掉,要整篇转换请用本站的「简繁转换」;二是这里用的是站内的常用汉字对照表,覆盖常用字,生僻字可能合不上。开启这个开关时分词也会先按简体形去切,所以「電腦」不会被切成两个单字。这个开关默认是关的,只有简繁混排的语料才需要。
- 词频统计导出 Excel 和做词云怎么操作
- 词频统计导出 Excel 有两条路:赶时间就点「复制 TSV」直接粘进 Excel,会自动分成八列(排名、词、次数、占比、词长、类型、首次出现、出现行数);要留档就下载 UTF-8 带 BOM 的 CSV,双击用 Excel 打开中文不乱码,含逗号引号的词按 RFC4180 转义,下载后还能接着用本站的 CSV 转 Excel 做透视表和图表。要用词频统计做词云则复制 JSON 最省事,形状固定是 [{"word":"发展","count":42}],任何词云工具都能直接吃。还有一种是复制 Markdown 表格,词里含竖线已转义,粘进文档表格不会破。
- 词频统计能统计 Word 文档的词频吗
- 本页只吃纯文本。做 txt 词频统计直接把文件拖进来就行,txt、md、csv、log、srt、json、sql 这几类都收,单个 5 MB 以内,一律按 UTF-8 读取。拖进来的如果是 docx,页面会专门提示你先用本站的「文档字数统计」或「Word 转 TXT」把正文取出来再粘过来——这样也能顺手确认取出的正文对不对。如果拖进来的是 GBK 编码或改了扩展名的二进制文件,页面会明确提示「该文件不是 UTF-8 纯文本」,而不是给你一堆乱码词。粘贴这条路没有格式限制,只受 200 万字上限约束。
- 词频统计免费吗有没有字数限制
- 完全免费,不用注册、不用下载软件,也不加水印,三种统计口径、六个预设、自定义词典、被滤除清单这些功能都不分免费版付费版。原因很实在:统计全部由你自己的浏览器算完,站点不承担计算成本,而且中文分词用的是浏览器自带的 Intl.Segmenter,连词典文件都不用下载。限制只来自浏览器性能:建议单个文件 5 MB、单次 200 万字以内,超过 10 万字后改成点「开始统计」再分片计算,带进度、可以随时取消,触到上限时页面会明确写出已统计到哪里,不会静默丢内容。
- 手机上能用词频统计工具吗
- 能,用手机浏览器打开本页粘贴文字就能统计,不用装 App、不用注册,分词同样在手机本地完成、文字不上传。移动端做过适配:预设按钮会自动换行排开,参数区在窄屏下一行一项铺满、标签在上控件在下互不挤压,词频表和被滤除清单可以横向滚动看完各列,两个文本框纵向堆叠。从微信、备忘录、笔记 App 里复制过来的文字,正好用默认的「文章高频词」预设一眼看出反复出现的是哪些词。
词频统计、词频分析、字频统计工具有什么区别
在搜索框里敲「一篇文章哪个词出现最多」的人,和敲「词频统计器」的人要的是同一张表。 但再往下走,几个近义叫法要的结果就不一样了:有人只要排在最前面的二十个词, 有人要按字看,有人要的是能代表全文的关键词。下面把常见叫法对应到本页的口径上, 免得一上来就选错档。
| 常见叫法 | 通常指什么 | 本页对应哪一档 |
|---|---|---|
| 词频统计 / 词频统计器 / 在线词频统计 / 词频统计在线 | 最常见的叫法,单位是「词」:先把句子切成词,再数每个词出现了多少次 | 页面默认口径,粘进来就是这一档 |
| 词频分析 / 词频分析工具 / 文本高频词分析工具 | 除了次数还要看分布——这个词是贯穿全文,还是挤在某一段里反复出现 | 看结果表的「出现行数」这一列,它就是为这件事准备的 |
| 高频词统计 / 文章高频词提取 / 文本词频统计 / 词语频率统计 | 只要排在前面的那几十个词,长尾不关心;「词语频率统计」是论文与教材里的正式写法 | 把「只要前 N 名」调到 20,停用词开到严格档 |
| 字频统计工具 / 汉字字频统计 / 单字出现次数统计 | 单位是「字」不是「词」,一个汉字算一条,和分词完全无关 | 切到「按单字」口径,或直接点「汉字字频」预设 |
| 中文分词词频统计 | 强调的是中文得先分词这一道工序,英文靠空格天然分好,没有这一步 | 本页用浏览器内置的 ICU 分词器完成,不下载词典文件 |
| 文本关键词提取在线 | 要的是「哪些词能代表这篇」,需要跨文档的权重,不只是本篇的次数 | 本页只给次数不算权重,两者的差别见下面的常见问题 |
词频统计怎么用:粘贴之后先调这三个地方
怎么统计文章里的高频词?粘贴全文、把停用词开到「基础」或「严格」、看表的前 20 行, 三步就完。真正需要动手的只有三个地方:停用词档位决定「的、了、是」 在不在表里,最小词长决定单字进不进表(默认 1,做主题词分析时调到 2 会干净很多),只要前 N 名决定这张表有多长。 统计一段文字里的高频词通常几秒就出结果,花时间的是回头把被切坏的专有名词 加进词典再看第二遍——这一遍才是能拿去用的。
词频统计的英文叫法有哪些
英文界面里的同类工具一般叫 word frequency counter online,落点在「数次数」这个动作; text word frequency analysis 语气更偏分析,通常连词云、共现一起做; count word occurrences online 是最口语的问法,等同于中文的 「统计文章中每个词出现的次数」。要注意 chinese word frequency 是单独一类—— 英文语料靠空格就分好了词,中文得先过一道分词,麻烦和误差也都在这一步。
词频统计三种口径:按词、单字、N 元有什么区别
「词频」这个词本身就有三种口径,选错口径,统计出来的表自然对不上。下面这张表用同一句 示例 我国新能源汽车产业发展迅速 把三种切法摆在一起,页面上的统计就按表里写的切。
| 统计口径 | 中文怎么切 | 英文怎么切 | 示例句的切分结果 | 适用场景 |
|---|---|---|---|---|
| 按词(中文自动分词) | 用浏览器内置的 Intl.Segmenter(ICU)自动分词 | 按字母串切分,it’s、well-known 记 1 个(与在线字数统计同口径) | 我国 / 新 / 能源 / 汽车 / 产业 / 发展 / 迅速 | 文章关键词、报告高频词、稿件用词检查 |
| 按单字(汉字字频) | 逐个汉字(按字素簇,emoji 与组合字不会被拆坏) | 逐个字母 | 我 / 国 / 新 / 能 / 源 / 汽 / 车 / 产 / 业 / 发 / 展 / 迅 / 速 | 汉字字频、诗词用字分析、书法选字、教材用字统计 |
| 按 N 元组(2~4 字固定搭配) | 连续 N 个汉字滑窗,不跨标点、不跨换行、不跨字符类 | 连续 N 个单词滑窗 | 我国 / 国新 / 新能 / 能源 / 源汽 / 汽车 / 车产 / 产业 / 业发 / 发展 / 展迅 / 迅速 | 找固定搭配、找被分词切坏的专有名词、找口头禅 |
这张表还顺手回答了一个常见疑惑:为什么同一段话在不同工具里统计出来的词不一样。 因为口径不同,结果本来就该不同。按词是「这篇文章在讲什么」,按单字是「这些字用了多少次」, 按 N 元是「哪几个字总是连在一起出现」。
按 N 元这一档在语言学里叫 N 元语法统计(n-gram),它不问「哪几个字算一个词」, 只把窗口在文本上滑一遍。最常用的是二元词组统计,也就是把连续两个字当一个单位数, 找口头禅、找套话、找固定搭配靠的都是它;窗口开到 3 到 4 个字, 就能把「新能源汽车」这类被切坏的行业词整个捞出来。
N 元口径的结果天然是重叠的,这里用一个具体的数字说清楚:假设一段材料里「人民共和国」 出现 12 次,那么 2 元组的「人民」「民共」「共和」「和国」和 4 元组的「人民共和」 也都至少各有 12 次。子串剪枝剪掉的正是「人民共和」这种被更长组合完全包住、 次数又完全一样的条目,只留下「人民共和国」。反过来,如果「人民」在别处还单独 出现过 5 次、合计 17 次,它就不会被剪——次数对不上,说明它有独立的出现。 剪了多少条,统计卡下面会写出来。
还有一层实用价值:按单字和按 N 元完全不依赖分词器, 所以它们同时也是老浏览器上的降级路径。万一你的浏览器不支持内置分词, 页面顶部会挂出黄条明确告诉你「已按 2 元组统计、结果会有重叠」, 而不是悄悄给你一份不一样的结果。
词频统计的六个一键预设分别统计什么
| 预设 | 一整套参数 | 典型场景 |
|---|---|---|
| 文章高频词(默认) | 按词分词 + 基础停用词 + 至少 2 个字 + 只算中英文 + Top 100 | 稿件、公文、报告的关键词概览 |
| 汉字字频 | 按单字统计 + 不过滤停用词 + 只算汉字 + Top 200 | 诗词用字、教材字频、书法选字 |
| 英文词频 | 按词分词 + 英文停用词 + 忽略大小写 + 只算拉丁词 | 英文作文、论文的重复用词检查 |
| 固定搭配(N 元) | 按 2/3/4 元滑窗 + 至少出现 3 次 + 开启子串剪枝 | 找专有名词、口头禅、公文套话 |
| 词云取词 | 按词分词 + 严格停用词 + 至少 2 字 2 次 + Top 200 | 给词云工具喂一份干净的 [{word,count}] 数据 |
| 不做任何过滤 | 停用词关 + 最小次数 1 + 最小词长 1 + 全字符类 + 全部输出 | 想自己看原始分布、做语言学研究 |
词频统计结果表的每一列是什么意思
- 次数:该词在全文出现了多少次(归一化合并之后的总次数)。
- 占比:次数 ÷ 过滤之后的总词次,详见下面「占比的分母是什么」。
- 类型:字符类型(中文 / 英文 / 数字 / 其他),不是词性。本工具不做名词动词形容词的判定——内置分词器不提供词性, 自造一张词性表准确率不可控,宁可不做也不做错。
- 出现行数:这个词分布在多少个不同的行里。 「次数 30 但只出现在 2 行」通常意味着某一段的局部堆砌, 「次数 30 分布在 25 行」才是真正贯穿全文的主题词。查客服记录、查小说口头禅时, 先看这一列再看次数,判断会准得多。
- 首次出现:行号:列号,点右边的「定位」能跳回原文核对。
排序一共 5 种:次数从多到少、次数从少到多、按首次出现顺序、词从长到短、按字典序。 同次数时一律以首次出现的位置作二级键、以 Unicode 码点作三级键, 所以同一段文字跑两次的结果是完全一样的,不会因为内部顺序变化而漂移。
中文分词难在哪,词频统计时专有名词为什么被切开
英文单词之间有空格,数词就行。中文没有空格,「哪几个字算一个词」本身就是要猜的——分词器只能靠词典和统计规律去猜边界。 这也是词频统计里所有麻烦的根源。
拿本页的示例句 我国新能源汽车产业发展迅速 来说,浏览器内置分词器给出的结果是我国 / 新 / 能源 / 汽车 / 产业 / 发展 / 迅速。可以看到「新能源汽车」被切成了三段。 这不是 bug,是词典里没有这个较新的行业词而已。下面是几个典型的例子:
| 原词 | 实际切法 | 为什么会这样 | 本页怎么解决 |
|---|---|---|---|
新能源汽车 | 新 / 能源 / 汽车 | 「新能源汽车」是近十年才固定下来的行业词,通用分词词典里往往只有「能源」「汽车」 | 写进自定义词典,或切到 N 元口径直接统计 5 字组合 |
高质量发展 | 高质量 / 发展 | 两个词各自都成立,分词器没有理由把它们粘起来 | 写进自定义词典;做公文分析时这类搭配值得单独建一份词典 |
小鹿tools | 小鹿 / tools | 中英混排的品牌名,中文段与拉丁段分属两套切分规则 | 写进自定义词典后整体保留,并按「中文」归类 |
之乎者也 | 之乎者也 | 反过来的情况:成语被当成一个词,做古文用字分析时反而想拆开 | 写进「强制拆分」,按字拆成 之 / 乎 / 者 / 也 |
人民共和国 | 人民 / 共和国 | 这个切法多数场景是对的,但统计国名出现次数时就不对了 | 写进自定义词典,或用 N 元口径看 5 字组合的次数 |
词频统计分词不准怎么办:三个补救办法
- 自定义词典分词:一行一个,工具在分词之前就按最长优先把这些词整体挖出来, 根本不交给分词器。词典项会在表里标上「词典」两个字,位置和次数都准确。
- 切到 N 元口径:完全绕过分词器,直接统计连续 2 到 4 个字的组合。 这一条还能反过来用——N 元表里排名靠前又不在词典里的组合, 往往正是被切坏的专有名词,看完再加进词典。
- 切到按单字口径:分词这一步干脆不做,只看字。
最后一句实话:本工具用的是浏览器内置的 ICU 分词器,不承诺任何分词准确率。 分词是启发式的,不同版本的浏览器切法可能略有差异。与其在页面上拍胸脯说切得有多准, 不如把切法如实摆出来,再把补救手段交给你。要在已知某个词的前提下数它出现几次或做替换,用批量查找替换更快; 本页解决的是你还不知道哪些词重要的那一半问题。
为什么词频统计不下载词典文件也能做中文分词
大多数在线中文分词工具走的是两条路:要么把文本传到服务器上用 jieba 之类的库处理, 要么在前端加载一个 jieba-wasm 或 segmentit,先下载 1 到 10 MB 的词典文件。 前者意味着你的文章离开了本机,后者意味着首屏要等一段可观的下载。
本页走的是第三条路:Intl.Segmenter。它是 ECMAScript 国际化标准的一部分, 底层就是 ICU 的分词器,已经装在你的浏览器里了, 调用它不需要下载任何额外资源,也不需要联网。所以这个页面打开之后断网照样能用。
词频统计 100 万字要跑多久
在 Node 24 上实测:100 万汉字的分词耗时约 0.17 秒, 加上聚合、过滤、排序在内的完整词频统计约 0.7 秒。 所以 10 万字以内本页是边打边出结果的(250 毫秒防抖), 超过 10 万字才切换成点按钮 + 分片计算 + 进度条 + 可取消, 避免一次性长时间占住主线程让页面卡住。
中文分词的 locale 为什么必须写死成 zh-Hans-CN
这是本工具最隐蔽的一个坑。Intl.Segmenter 的第一个参数是 locale, 如果传 undefined,它会用系统默认语言—— 于是同一段中文,在中文系统、英文系统、日文系统上会被切成不同的词,而且不会报任何错。用户 A 看到「新能源」,用户 B 看到「新 / 能源」, 谁也说不清谁对,也没法复现。
所以本页把 locale 硬编码成 zh-Hans-CN,统计卡下面也把它显示出来。 换一台电脑、换一个系统语言,同一段文字切出来的词完全一样。 (顺带一提:算「一个字」用的字素簇切分反而应该用系统默认,因为字素簇边界与语言无关, 这两处刻意不一致,代码里专门写了注释防止后人「统一」掉。)
哪些浏览器不支持内置分词,词频统计会受影响吗
主流浏览器从 2022 年起陆续支持 Intl.Segmenter, Firefox 是最晚的一批。万一你的浏览器不支持,本页不会假装没事: 页面顶部会挂出一条黄色提示,明确写着「当前浏览器不支持内置分词,中文已按 2 元组统计 (结果会有重叠)」,并建议你改用「按单字」口径。而英文词与数字串本来就是用正则先挖走的, 完全不受影响;「按单字」和「按 N 元」两种口径也根本不依赖分词器,结果一模一样。
词频统计的停用词该不该滤,滤到什么程度
不滤停用词的中文词频表,Top 10 永远是「的、了、是、在、和、我们、这、那」, 没有任何信息量——它们能占到全文词次的两成以上。所以本页默认就开着「基础」档的停用词过滤, 有人干脆直接搜「去掉的、了、是统计词频」,说的就是这一步。 但滤多滤少是有取舍的,下面把三档分别滤了什么摊开说。
| 档位 | 滤掉什么 | 规模 |
|---|---|---|
| 不过滤 | 一个词都不滤,想自己看原始分布时用 | 0 个 |
| 基础(默认) | 滤掉中文虚词代词与英文常见虚词,「的、了、是、the、a」不会再霸榜 | 中文 136 个 + 英文 107 个 |
| 严格 | 在基础之上再滤掉量词、时间词、程度副词与连接词,只留下真正的实义词 | 在基础档之上再加中文 99 个及若干英文连接副词 |
词频统计的停用词表为什么是有立场的
一个具体的例子:不 和 没有。 做关键词提取时它们是纯噪音,应该滤掉; 做情感分析时它们极其重要——「不好」和「好」是相反的意思, 滤掉「不」等于把结论反过来了。同一张词表不可能同时对两种任务都正确。
本站的取舍是:按「关键词提取」这个绝对主力场景收词,所以基础档里含「不」; 同时必须给出撤销通道——「取消内置停用词」输入框可以把任何一个被内置表 滤掉的词捞回来。做古文分析要保留「之、乎、者、也」,做情感分析要保留「不、没有」, 一行一个填进去即可。只给追加不给撤销的停用词功能就是黑箱,这是这类工具最常被吐槽的点。
词频统计的内置停用词表能完整查看吗
页面上点「查看内置词表」会展开三个只读文本框,里面是三档词表的全部词, 可以全选复制走。你不必相信我们说滤了什么,直接看就行。
词频统计还有哪些词会被过滤掉
除了停用词,还有四类:词长不在设定区间内的、出现次数达不到「最小出现次数」的、 字符类型没被勾选的(默认只统计 中文和英文,数字与其他默认不统计),以及 N 元口径下被子串剪枝剪掉的。这四类连同停用词,每一条都会出现在「被滤除的词」清单里并写明原因, 清单默认就展开在页面上。静默过滤等于工具坏了—— 用户问「我明明写了 20 个『的』,怎么表里没有」,答案必须在页面上找得到。
词频统计的占比,分母到底是什么
这是最容易被误用的一个数字,所以单独拿一节说清楚。 同一个词,用三种不同的分母算出来的占比能差好几倍:
| 分母口径 | 算法 | 本页是否采用 |
|---|---|---|
| 过滤之后的总词次 | 该词次数 ÷ 真正进入统计的词次总数(如 3105) | ✔ 本页采用 |
| 过滤之前的总词次 | 该词次数 ÷ 切出来的全部词次(如 6210,含「的、了、是」) | ✘ 不采用,会被大量虚词稀释 |
| 全文字数 | 该词次数 ÷ 总字符数(如 12480) | ✘ 不采用,词与字不是一个单位 |
页面的统计卡下面会把本次的三个数字都写出来:切出多少个词、滤除多少个词次、 分母是多少,随时可以自己验算。表里所有词的占比加起来正好是 100% (把「只要前 N 名」切到「全部」时)。
一句必要的提醒:这个占比不等于 SEO 里说的关键词密度。 关键词密度通常按全文字数或全部词数算,而且是给定几个目标词去诊断, 本页是全量发现(我不知道哪些词多,列给我看)。所以本页只给数字,不给任何「密度应该在百分之几」的建议, 也不设所谓的合理区间——那种结论脱离了具体搜索意图就是误导。
词频统计一般用来做什么:7 个真实场景
- 公文高频词统计:材料在反复说什么:整篇粘进来,保持默认的「文章高频词」预设,几秒内就能看到这份材料到底在反复说什么。基础停用词已经把「的、了、是、在」滤掉,剩下的 Top 20 基本就是这篇稿子的主题词。想更干净就切到「严格」档,连「进行、通过、方面、情况」这类公文虚化词一起滤掉。
- 论文重复用词检查:哪个词被写了几十遍:中文稿件用默认预设跑一遍,按次数降序看前 30 行,就知道有没有哪个词被翻来覆去用了几十遍。配合「出现行数」一起看更准:次数 40 却只分布在 6 行,说明是某一节里的局部堆砌,改那一节就行;次数 40 分布在 35 行,那是全文的主线词,动它要通盘改。
- 英文作文重复用词检查怎么做:点「英文词频」预设做英文单词词频统计,大小写自动合并,一眼就能看出 important、good、very 这类词是不是超标了。注意本工具不做词形还原,run 和 running 分开计数——这恰恰是检查重复用词时想要的,因为改稿要改的是具体那一处写法。
- 小说高频词统计:人物出场与口头禅:把人物名写进自定义词典(尤其是三字以上的名字和外国译名),再切到「固定搭配(N 元)」预设找口头禅和套话。哪个角色出场最多、哪句话被写了 30 遍,一张表就说清楚了。
- 诗词用字频率统计与教材生字表:点「汉字字频」预设,逐个汉字统计次数与占比,停用词默认关闭。做书法选字、教材生字表、诗词用字分析都靠这一档。emoji 和组合字符按整簇计 1,不会被拆坏。
- 聊天记录高频词里藏着真正的问题:把导出的客服聊天记录粘进来,先用严格停用词过一遍,再把产品名和功能名加进自定义词典。哪些词次数高又分布在很多行,就是真正被反复问到的问题;次数高但只集中在两三行的,多半是某一次长对话里的重复。
- 词频统计导出 Excel 接着做图表:结果可以复制成 TSV 直接粘进 Excel 分列,也可以下载带 BOM 的 CSV 用 CSV 转 Excel 继续做透视表和柱状图。想用词频统计做词云就复制 JSON,形状是 [{"word":"发展","count":42}],任何词云工具都能直接吃。
只想知道有多少字、多少段、读完要几分钟,用在线字数统计—— 它回答「一共有多少字」,本页回答「哪些词出现得最多」,一个是总量一个是分布。 要统计 Word 文档或一次统计好几个文件的字数,用文档字数统计取出正文再粘过来。 已经知道要找哪个词、想数它或替换它,用批量查找替换。 要按行去重、排序、改大小写,用文本处理工具箱—— 它的单位是「行」,本页的单位是「词」,「去重行」和「词频去重」完全是两回事。 要把整篇文章简繁转换(而不只是合并计数),用简繁转换。 导出结果继续做表做图,用 CSV 转 Excel。