富文本清理

富文本清理是免费在线粘贴去格式工具:把从 Word、网页、PDF、微信公众号复制的内容粘进来,一键去掉字体、颜色、加粗、超链接等全部格式,得到干净的纯文本。它还会清掉看不见却会出事的粘贴污染——零宽字符、不间断空格、全角空格、行尾空格、Word 自动编号,也能把 PDF 复制下来每行都断开的文字接回完整段落。可保留段落也可压成一段,每项改动都逐条报数。全程在浏览器本地完成,粘贴的内容不上传。

直接 Ctrl+V 粘贴,拖入 .txt / .md / .log
粘贴内容不上传 · 浏览器本地去格式 · 也可拖入纯文本文件 · 单文件 ≤ 10 MB
来源:纯文本

手机和不少 App 的剪贴板只提供纯文本,格式可能已经由系统去掉;本页仍会清理隐形字符、多余空白与断行, 并在上面的徽章里如实标注这次到底拿到了什么。

选一个场景(点了就用,不用逐项勾)

默认设置:去格式、清隐形字符、压掉多余空行、自动判断要不要接回硬换行,文字本身一个字不改。

全部 17 项清理器:去格式 / 不可见污染 / 行与段 / 列表与编号 / 字符规范
这 17 项分别在清什么、从哪来、不清会出什么问题

去格式

  • 去掉 HTML 标签与样式粘到别处带着字体、字号、颜色、背景、行距,贴进 CMS 或表单还会带一堆 class 与内联样式
  • 丢弃脚本、样式表与注释用正则 <[^>]*> 粗暴去标签会把 CSS 规则和 JS 代码原样倒进结果,是最典型的「粘出来一堆样式代码」
  • 超链接默认粘贴会带蓝色下划线样式;直接丢掉又会丢失出处
  • 图片纯文本里塞不下图片,粘过去要么是空白要么是一串 base64
  • 表格直接去标签会把整行单元格挤成一串没有分隔的文字,列全糊在一起

不可见污染

  • 不间断空格与全角空格看起来就是个空格,但搜索、匹配、导入数据库时对不上,Excel 里的查找也找不到
  • 零宽字符与 BOM完全看不见,却让两段「一模一样」的文字比对不相等、搜索搜不到、账号密码粘过去登录失败
  • 软连字符平时不显示,一旦复制出来就成了单词里的隐形字符,拼写检查和搜索全对不上
  • 控制字符与行分隔符导入数据库或 JSON 解析时直接报错,编辑器里显示成方块或干脆看不见

行与段

  • 行尾统一同一份文本里混着两种行尾,diff 会整篇标红,脚本按 \n 切行会留下一堆 \r
  • 行尾多余空白看不见,但会让每行末尾多出字符,拼 SQL、比对、导入时对不上
  • 多余空行粘出来段落之间隔着五六个空行,看着像没排版
  • 断行合并(会改动文字)复制出来每行都断开,重新排版时段落全乱,中间还夹着断开的单词

列表与编号

  • 项目符号(会改动文字)复制过来是 •、·、▪ 这些死符号,样式不统一,贴进 Markdown 也不成列表
  • 自动编号残留(会改动文字)这些数字不再自动重排,删掉中间一条后面的编号就全错了

字符规范

  • 弯引号与排版符号(会改动文字)从文档里抄的代码粘进编辑器直接报语法错误,命令行里也粘不出正确的参数
  • emoji 与图形符号(会改动文字)入库、打印、生成正式文档时不需要,有些系统还会存成乱码

🔒 剪贴板里的富文本只在你的浏览器里被当成字符串解析取文字,全程不渲染、不上传任何服务器, 也不写入本地存储(只记住你选的场景与清理项),关闭页面即清除。复制结果时只写入纯文本, 再粘到 Word 也不会带回格式。

如何使用富文本清理

1

光标点进「粘贴区」,直接按 Ctrl+V(Mac 是 Command+V)粘贴从 Word、WPS、网页、PDF 或公众号复制的内容。页面会同时读取剪贴板里的富文本与纯文本,并在粘贴区上方用徽章如实标注这次拿到的是「富文本(HTML)」还是「纯文本」。也可以直接打字,或拖入 .txt / .md / .log / .csv / .srt 纯文本文件(单文件 10 MB 以内,按 UTF-8 读取);.html 文件不收,那是 HTML 源码不是粘贴内容。

2

点一个场景:网页复制 / Word、WPS / PDF、论文 / 微信、公众号 / 代码、终端 / 只要纯文本 / 只去格式。每个场景下面写清了它会额外做什么,点完还能展开 17 项清理器逐个调;改动任意一项会自动切到「自定义」,不会被场景悄悄覆盖。输出方式有保留段落、轻结构、压成一段三档。

3

看右边的清理台账:每一项改了什么、改了几处、首个命中的前后对照都列出来,0 处的项也会列出来证明查过了。确认没问题就点「复制为纯文本」(写进剪贴板的只有纯文本,再粘到 Word 也不会带回格式)或「下载 .txt」;想再清一轮就点「回填再清一次」,结果不会变——本工具是幂等的。

关于富文本清理的常见问题

富文本清理会上传我粘贴的内容吗
不会上传。读取剪贴板、解析富文本、去格式与清理全部在你的浏览器里用 JavaScript 完成,页面没有任何一次把内容发往服务器的请求,关闭或刷新页面即全部清除,断网状态下同样能用。剪贴板里的原始 HTML 只存在于内存中,不写入本地存储;本页只记住你选的场景与清理项这些参数偏好。所以处理合同、客户资料、内部文档也可以放心使用。
从 Word 复制的文字怎么去掉格式变成纯文本
打开本页,在粘贴区直接按 Ctrl+V。工具会取出剪贴板里那份带样式的 HTML,只把文字提取出来,字体、字号、颜色、背景、加粗、超链接、段落间距全部丢掉,右边就是纯文本。选「Word / WPS」场景还会顺手去掉 Word 自动编号复制过来的死数字,并把项目符号统一成「- 」。最后点「复制为纯文本」,再粘到任何地方都不会带格式。
网页上复制的文字粘贴过去带一堆样式怎么办
那是因为剪贴板里同时存了一份 HTML,目标软件优先用了它。本工具只读取这份 HTML 里的文字、丢掉全部标签与样式表——包括 script、style 和注释里的内容,一个字符都不会漏进结果,所以不会出现「粘出来一堆 CSS 代码」那种情况。它还会顺手删掉网页里常见的零宽字符和不间断空格,贴进 CMS 或表单就不会再带样式。
PDF 复制的文字每行都断开怎么接成段落
选「PDF / 论文」场景就行。PDF 是版式文件,换行是排版产物而不是段落,所以复制出来每行都断开。工具会按句末标点、行长度、是否列表行或表格行来判断哪些换行该接回去:中文直接相接、英文补一个空格,被连字符断开的英文单词(inter- 换行 national)也会拼回 international。如果原文本来就是诗歌、地址或代码,把「合并断行」改成「不合并」,台账里也会写明接回了多少处。
粘贴过来的文字里有看不见的字符怎么清掉
零宽空格、零宽连接符、BOM、软连字符、不间断空格、全角空格、方向控制符与 C0/C1 控制字符都会被清理,并在结果区逐项告诉你删了几个、分别是哪个码点(例如 U+200B×2、U+FEFF×1)。这类字符正是「看着一模一样却搜不到、对不上、导入报错」的原因。组成 emoji 的零宽连接符受保护,全家福表情不会被拆成三个人。
从文档抄的代码粘贴到编辑器就报错怎么解决
多半是 Word 或网页把直引号自动替换成了弯引号“ ”,或者混进了全角空格、不间断空格和零宽字符。选「代码 / 终端」场景,工具会把弯引号、破折号、省略号还原成 ASCII 字符并清掉隐形空白,同时不合并断行、不动你的空行与缩进。要调试正则用正则测试,要检查 JSON 用 JSON 格式化。
Ctrl+Shift+V 和在线粘贴去格式工具有什么区别
Ctrl+Shift+V(粘贴为纯文本)由目标软件自己实现,各家行为不一致:有的仍保留部分样式,有的在网页输入框里被网站接管,而且它只去样式,不会处理零宽字符、不间断空格、PDF 硬换行、Word 自动编号这些问题,更不会告诉你它做了什么。本工具按场景一次性处理这 17 类污染,并逐项列出改了什么、改了几处。
粘贴到 Word 不带格式怎么设置
Word 里点「开始 - 粘贴 - 只保留文本」就是一次性的不带格式粘贴;想以后按 Ctrl+V 默认如此,进「文件 - 选项 - 高级」,把「粘贴自其他程序」改成「仅保留文本」,WPS 的位置类似。要提醒的是这个设置只解决样式:从网页或 PDF 带过来的零宽字符、不间断空格、行尾空白和断开的行,照样会原样进入 Word 文档,只是你看不见。要连这些一起清干净,就先粘到本页处理完,再复制到 Word。
粘贴去格式会不会把我的文字内容改掉
默认只删格式和不可见字符,不改文字本身:中英文标点、全角标点、大小写一律不动,中文的全角逗号句号更是永远不碰(要转标点请用中英标点转换)。对照表里标了「会改动文字」的一共五项,其中弯引号 ASCII 化、删 emoji、去掉项目符号、去掉自动编号这四项默认全部关闭,只有你手动勾选或选了明确带上它们的场景才生效;第五项「合并断行」默认是保守的「自动判断」,只接回它有把握的排版换行,不满意随时改成「不合并」。每一项都会在结果区写明改了几处并给出前后对照。
富文本清理能保留段落和列表还是压成一段
三种输出都有。默认「保留段落」把段落分行原样保留,连续空行压成一个;「轻结构」在此基础上把列表统一成「- 」、表格用制表符分列,适合转手贴进笔记;「压成一段」把所有换行去掉合成一整段,中文直接相接、英文补空格,适合填表单和发消息。注意本页产出的始终是纯文本,不会输出 Markdown 的加粗和链接语法,要完整 Markdown 请用 HTML 转 Markdown。
复制表格粘贴过来会变成什么格式
HTML 表格默认转成制表符分隔的纯文本:每行一条,单元格之间是一个 Tab,可以直接粘进 Excel 或 Numbers 自动分列。也可以改成用空格分列,或者选「丢弃表格」把表格里的文字整体去掉。单元格之间的换行与缩进不会变成多余的尾随空格,所以粘进表格后每一列都是干净的。
微信公众号复制的文字粘贴后乱码乱排版怎么办
这些渠道的富文本里塞了大量 section 嵌套、内联样式和零宽字符,很多编辑器直接把它们原样吃下去,看起来就像乱码或排版全乱。选「微信 / 公众号」场景,工具只取文字、压掉多余空行、重点清掉零宽字符,链接地址可以选择保留在文字后面。真正的编码乱码(文件不是 UTF-8)本页会明确提示,请另存为 UTF-8 再来。
粘的是 HTML 源码能用富文本清理去标签吗
本页处理的是「复制粘贴过来的带格式内容」,也就是剪贴板里真的带了一份 HTML 的情况。如果你手上是一串 HTML 源码字符串(像 <p>你好</p> 这样能直接看见标签的文本),本页只会提示你、不会擅自解析——因为那样会把正文里正常的 a < b、泛型 List<int> 一起吃掉。这种需求要用专门的「去除 HTML 标签」工具(本站文本处理分类里就有);如果你想连标题、链接和加粗一起保留成 Markdown,现在就可以用 HTML 转 Markdown。
手机上粘贴去格式还能用吗有什么不一样
能用,页面在窄屏上会自动纵向堆叠。要说明的是:手机和不少 App 的剪贴板只提供纯文本,格式可能已经由系统去掉了,这时页面上的徽章会如实标成「来源:纯文本」,而不是假装完成了去格式。即便只拿到纯文本,工具仍会清理隐形字符、多余空白、行尾空格和断行,这些问题在手机上同样存在。
富文本清理免费吗支持多大的文本和哪些文件格式
完全免费、无需注册、不加水印。粘贴的纯文本建议 500 万字以内,剪贴板富文本 1000 万字符以内,超过会明确提示已处理多少而不是静默截断;超过 20 万字会切换成「点按钮处理 + 进度条 + 可取消」的模式,避免卡住页面。文件方面支持拖入 .txt / .md / .log / .csv / .srt 等 UTF-8 纯文本,单文件 10 MB 以内;.html 文件不收,非 UTF-8 文件会提示另存为 UTF-8 后重试。

复制的文字带格式怎么去掉:9 种症状速查

先按你看到的现象找,比按「这属于第几类污染」找快得多。 下面九行覆盖了粘贴出问题时最常见的九种样子:左边是症状,中间是它真正的成因, 右边是本页对应的处理。找到自己那一行,照着选场景就行。

粘出来的症状真正的原因本页怎么处理
想把 Word 复制粘贴去掉格式,样式是没了,编号却还在,删掉中间一条后面全错Word 的自动编号是域,复制到别处时被固化成普通数字,从此不再自动重排选「Word / WPS」场景。word 自动编号复制过来怎么去掉,靠的是「去掉自动编号」这一项:行首的死数字整段删掉,项目符号统一成「- 」
网页复制文字去格式没做干净,粘贴到 CMS 带一堆样式,有时还粘出一段 CSS网页复制会同时往剪贴板写 HTML 与纯文本两份,编辑器优先吃 HTML;有的编辑器还会把 style 标签里的样式代码当正文吐出来本页只从这份 HTML 里取文字,script、style 与注释整段丢弃,样式代码一个字符都漏不进结果
粘贴到表单格式乱,看着和原文一样,提交时却报字段超长或校验不通过表单里混进了不间断空格、零宽字符和行尾空格——它们都算长度,也会让后台的精确匹配对不上默认场景就会清掉这几类;要连空行一起压干净就选「只要纯文本(最狠)」
微信复制文字格式怎么去掉一直没弄明白,公众号里复制的段落粘出来空行成片、字号忽大忽小微信编辑器用大量 section 嵌套做排版,还会插入零宽字符,很多编辑器原样吃下去选「微信 / 公众号」场景。公众号复制文字去格式的重点是清零宽字符、压掉排版空行,链接地址可以选择留在文字后面
PDF 复制粘贴换行怎么去掉:一段话被切成十几行,粘到哪里都是断的PDF 是版式文件,换行是按行宽切出来的排版产物,不是作者的段落选「PDF / 论文」场景,按下面一节的五条规则把排版换行接回去,诗歌与代码不会被误接
复制文字有隐藏字符:站内搜索搜不到、两边比对对不上、导入数据库还报错零宽空格、BOM、软连字符这些字符不占位置也不显示,肉眼根本没法排查结果区按码点逐个报数(形如 U+200B×2),删了哪几个、各几处一目了然
复制的文字有看不见的空格,用 Excel 或脚本一比对就是不相等全角空格 U+3000 与不间断空格 U+00A0 显示得和普通空格一模一样,但码点不同两者都会被换成普通半角空格;至于 nbsp 怎么去掉,靠的就是这一项
粘贴代码引号报错,逐字对了半小时也看不出哪里不一样文档的智能引号把直引号换成了弯引号,缩进里还混进了全角空格选「代码 / 终端」场景,把中文引号变直引号、破折号还原成连字符,同时不合并断行、不动缩进
复制表格到文本粘出来挤成一坨,分不清哪个字属于哪一列HTML 表格的单元格边界在转成纯文本时丢了,就只剩一串连续文字默认转成制表符分隔:一行一条、单元格之间一个 Tab,直接粘进 Excel 或 Numbers 就能分列

九种症状里有六种的根子是同一件事:剪贴板里存的从来不止你看见的那些字。 Word 存的是带 mso 类名的 HTML,网页存的是整棵 DOM 的片段,微信还会顺手塞进零宽字符。 目标软件拿到这份 HTML 就照单全收,于是样式、隐形字符、行尾空格一起进了你的文档。 本页的做法是绕开这一步:把那份 HTML 当字符串解析、只取文字,再按场景清理。

复制粘贴过来的文字有哪些格式污染:17 类对照

「粘出来不对劲」从来不只是字体和颜色的问题。真正让人抓狂的是那些看不见却会出事的东西:搜索搜不到、比对对不上、导入报错、代码粘进去就报语法错误。 下面这张表把本页会处理的每一类污染都写清楚了:它从哪来、不清会造成什么问题、本工具怎么处理。 表格与页面上的清理台账共用同一份数据,实现改了这里就会跟着改,不会出现说明与实际不符。

表里最值得单拎出来说的是两类。一类是零宽字符:它宽度为零、不显示、也搜不出来, 所以「零宽字符怎么删除」没法靠肉眼加退格键解决,只能按码点扫。本页按 U+200B、U+200C、 U+200D、U+2060、U+FEFF 这些码点逐个识别并报数,唯独放过组成 emoji 的那个零宽连接符—— 删了它,一家三口的全家福表情会当场散成三个人。 另一类是行尾空格:复制的文字行尾有空格几乎不可能被看见,却会让 Markdown 多出一个硬换行、 让 diff 整行标红、让配置文件的值莫名其妙多一截。本页默认逐行清掉行尾空白,行首缩进一律不动——代码与 YAML 的层级不会被破坏。

污染类型从哪来不清会怎样本工具怎么处理
去掉 HTML 标签与样式从 Word、WPS、网页、公众号复制时,剪贴板里同时存了一份带样式的 HTML粘到别处带着字体、字号、颜色、背景、行距,贴进 CMS 或表单还会带一堆 class 与内联样式把剪贴板里的 HTML 当字符串做词法扫描、只取文字,全程不渲染、不建 DOM 节点
丢弃脚本、样式表与注释整页复制时必然带上 script、style、noscript、head、title 和 HTML 注释用正则 <[^>]*> 粗暴去标签会把 CSS 规则和 JS 代码原样倒进结果,是最典型的「粘出来一堆样式代码」扫描器进入这些块后整段丢弃;连未闭合的 script 也一直丢到文档末尾,一个字符都不进输出
超链接网页正文里的 a 标签默认粘贴会带蓝色下划线样式;直接丢掉又会丢失出处三档可选:只留锚文本(默认)、锚文本后附上地址、整条链接文字都去掉;javascript: 这类地址永不附加
图片网页与公众号正文里的 img纯文本里塞不下图片,粘过去要么是空白要么是一串 base64默认整个去掉;需要说明文字时可以选「保留 alt 文字」
表格HTML 表格,以及从 Excel、飞书表格复制的区域直接去标签会把整行单元格挤成一串没有分隔的文字,列全糊在一起默认单元格之间放制表符、每行一条,可以直接粘进 Excel 分列;也可以改成空格或整体丢弃
不间断空格与全角空格&nbsp; 是网页排版占位的常客;U+3000 全角空格来自中文输入法与 Word 的首行缩进看起来就是个空格,但搜索、匹配、导入数据库时对不上,Excel 里的查找也找不到不间断空格换成普通空格;全角空格可选择换成空格、删除或保留,并逐项报数
零宽字符与 BOM微信、公众号、小红书、部分在线编辑器与「防复制」脚本会往文字里插零宽字符完全看不见,却让两段「一模一样」的文字比对不相等、搜索搜不到、账号密码粘过去登录失败按码点逐个删除并给出 U+200B×2 这样的明细;组成 emoji 的零宽连接符受保护,不会把表情拆开
软连字符PDF、Word 为了在行末断词插入的 U+00AD平时不显示,一旦复制出来就成了单词里的隐形字符,拼写检查和搜索全对不上整体删除,并在台账里单独报数
控制字符与行分隔符从终端、日志、老系统与部分 PDF 复制时混进来的 C0/C1 控制字符、U+2028/U+2029导入数据库或 JSON 解析时直接报错,编辑器里显示成方块或干脆看不见删除控制字符(保留制表符与换行);U+2028/U+2029 转成换行而不是删掉,否则两段会粘成一段
行尾统一Windows 与 Mac、网页与文档混着来的 CRLF / CR同一份文本里混着两种行尾,diff 会整篇标红,脚本按 \n 切行会留下一堆 \r统一成 LF;需要给 Windows 记事本用时可以在输出时改回 CRLF
行尾多余空白网页排版、表格复制、手动换行时留下的行尾空格与制表符看不见,但会让每行末尾多出字符,拼 SQL、比对、导入时对不上逐行清掉行尾空白,行首缩进一律不动(代码与 YAML 的层级不会被破坏)
多余空行网页里的空 p 标签、公众号排版里的占位行粘出来段落之间隔着五六个空行,看着像没排版默认把连续空行压成一个(保留段落感),也可以全部保留或全部删除;口径与「去空行空格」完全一致
断行合并(会改动文字)PDF、论文、邮件、老论坛正文每 40~80 个字符就硬换一行复制出来每行都断开,重新排版时段落全乱,中间还夹着断开的单词按句末标点、行长度、是否列表行或表格行判断哪些换行是排版产物并接回;中文直接相接、英文补一个空格、被连字符断开的英文单词拼回原样
项目符号(会改动文字)Word、WPS 的项目符号列表,以及网页 ul/li复制过来是 •、·、▪ 这些死符号,样式不统一,贴进 Markdown 也不成列表默认统一成 Markdown 的「- 」,也可以原样保留或整体删掉;已经是「- 」的行不会被加成「- - 」
自动编号残留(会改动文字)Word 的自动编号、有序列表复制出来变成的死数字这些数字不再自动重排,删掉中间一条后面的编号就全错了可选删除行首的 1. / 1) / 一、/ ① 等编号;默认不动,且只认三位以内的数字,2026. 那一年 不会被当成编号
弯引号与排版符号(会改动文字)Word、网页会把直引号自动替换成 “ ”,破折号变成 — –,省略号变成 …从文档里抄的代码粘进编辑器直接报语法错误,命令行里也粘不出正确的参数可选把 “ ” ‘ ’ 还原成 " ',— – 还原成 -,… 还原成 ...;默认关闭,只有「代码 / 终端」等预设会打开
emoji 与图形符号(会改动文字)聊天记录、社媒文案里的表情入库、打印、生成正式文档时不需要,有些系统还会存成乱码可选整簇删除(不会把一个表情拆成几个残片);默认保留

标了「会改动文字」的五项默认全部关闭或需要你显式选择场景, 其余的只删格式与不可见字符,不动任何一个可见的字。这是本页的底线: 静默改字的工具,用户第二次就不敢用了。想单独精修纯文本里的空行与空格, 用去空行空格;想做去重、排序、大小写, 用文本处理工具箱

记事本中转和 Ctrl+Shift+V 去格式有什么区别

大部分人已经知道两个土办法:按 Ctrl+Shift+V「粘贴为纯文本」, 或者先粘进记事本再复制出来。它们都能去掉样式,但都只解决了问题的一半。

方式它做了什么它没做什么
Ctrl+Shift+V(粘贴为纯文本)由目标软件决定怎么处理剪贴板,多数情况下只丢样式各家软件行为不一致:有的仍保留部分样式,有的在网页输入框里直接被网站接管;只去样式,不会碰零宽字符、不间断空格、PDF 硬换行、Word 自动编号,也不会告诉你它到底做了什么
记事本 / 便签中转一遍粘进纯文本编辑器再复制出来,格式确实没了多一次来回,而且只解决样式:隐形字符原样带过去,PDF 的每行断开还是断开,行尾空格照旧,Word 的死编号照旧;中文全角空格也一个不少
本页的富文本清理直接读剪贴板里的 text/html,当字符串解析取文字,再按你选的场景清 17 类粘贴污染按场景一次处理完,并逐项列出「改了什么、改了几处、前后长什么样」;会改动文字的选项默认关闭,需要时才由你或场景预设打开

使用建议:日常在 Word、聊天窗里粘一句话,Ctrl+Shift+V 就够了; 一旦是「要入库、要发布、要和别的数据比对、要粘进代码编辑器」这几种情况, 就值得多开一个页面——因为出问题的往往不是样式,而是那几个看不见的字符。 本页与两个土办法最大的差别是它会告诉你它改了什么: 哪一类、几处、首个命中长什么样,全部列在结果区。

PDF 复制的文字为什么每行都断开,怎么接回段落

PDF 是版式文件:它记录的是「哪个字画在纸面的哪个位置」, 而不是「这段话有几个自然段」。排版软件在生成 PDF 时按行宽把文字切开, 于是复制出来就是一行一行的短句——那些换行是排版产物,不是作者的段落。 论文、扫描件、分栏排版的期刊尤其严重,有些还会在行末插一个看不见的软连字符把英文单词断开。

所以「pdf 复制粘贴换行怎么去掉」这个问题,准确的答法不是把换行全删掉。 PDF 复制的文字怎么合并成段落,取决于相邻两行到底是不是同一句话—— 删光换行会把诗歌、地址、歌词和代码一起改坏,留着又读不成段。

本页的「合并断行」就是在还原这件事。它不是无脑把所有换行都删掉—— 那会把诗歌、地址、代码、歌词全部改坏。判定依据一共五条,两行同时满足才会接起来:

判定规则为什么这么定
上一行以句末标点结尾就不合并。!?;…以及右引号、右括号意味着这句话说完了,后面多半是真正的新段落
上一行短于 24 个字符就不合并标题、地址、诗句、表单项天生就短,短行接起来最容易把原文改坏
列表行与含制表符的表格行都不参与「- 甲」「1. 乙」是新条目,含 Tab 的行是表格,它们的换行是结构而不是排版
空行永远是段落边界两段之间的空行是作者的真实意图,合并绝不跨越它
拉丁字母 + 连字符结尾视为断词,接回时删掉连字符inter- 换行 national 拼回 international;而 2026- 换行 08 两侧不是字母,不会被拼成 202608

接回时的拼接也分情况:两侧都是中文直接相接、不加空格; 有一侧是英文或数字则补一个空格;上一行以「字母 + 连字符」结尾就当成断词, 删掉连字符直接拼。「PDF / 论文」场景用的是更激进的「全部接回」, 因为 PDF 的每一行几乎都是排版换行;默认的「自动判断」则保守得多。 无论哪一档,台账都会写明接回了多少处, 发现接错了就把「合并断行」改成「不合并」,一键回到原样。

PDF 复制换行接回段落算例:三行变两行

从一篇 PDF 论文里复制下来的三行长这样(每行末尾都是 PDF 的排版换行):

本文提出一种轻量的 inter-
national 文本清理方案。
实验部分见第 3 节。

选「PDF / 论文」场景后得到:

本文提出一种轻量的 international 文本清理方案。
实验部分见第 3 节。

第一行以「字母 + 连字符」结尾,判定为断词:连字符删掉、两半直接拼回 international,中间不补空格。第二行以句号收尾,命中「句末标点不合并」, 所以「实验部分见第 3 节。」仍然自成一行,没有被吸进上一段。 台账这次记的是合并断行 1 处——三行变两行,只动了该动的那一处。

还有两件事要提醒:分栏 PDF 复制文字排版乱是另一回事——两栏的文字会交错在一起, 页眉页脚也会混进正文,这是复制阶段就已经乱了,任何工具都救不回来,接回段落后请扫一眼; 另外如果你手上是 PDF 文件而不是复制的内容,那属于 PDF 提取文字的范畴,不在本页。

从文档抄的代码粘到编辑器就报错,是什么原因

这是「粘贴去格式」里最典型、也最费时间的一类问题:代码看上去一模一样, 粘进 IDE 或终端却直接报语法错误,逐字对了半小时也看不出差别。 元凶通常是下面四类字符——它们在文档里显示得和正常字符几乎一样:

粘过来的是应该是典型症状
“ ”(弯双引号)" "(直双引号)JS / Python / JSON 直接语法错误,报错常常指向下一行,找半天找不到
‘ ’(弯单引号)' '(直单引号)Shell 里引号不配对,命令粘进终端后一直等你补右引号
—(破折号)-(连字符)命令行参数 --force 变成 —force,工具报「未知选项」
全角空格、不间断空格、零宽字符普通半角空格 / 直接删掉Python 报 IndentationError,YAML 缩进解析失败,正则怎么写都匹配不上

为什么会变?Word、WPS 与很多富文本编辑器默认开着「智能引号」, 你敲的直引号会被自动替换成弯引号;中文输入法在全角状态下敲的空格是 U+3000; 网页排版为了对齐大量使用 &nbsp;;某些站点还会主动往代码块里插零宽字符防复制。 选「代码 / 终端」场景可以一次解决:弯引号、破折号、省略号还原成 ASCII, 全角空格与零宽字符清掉,同时不合并断行、不压空行、不动缩进—— 代码的换行和缩进本身就是语义,动了就是另一个 bug。

清完之后想验证规则写得对不对,用正则测试; 贴的是 JSON 就用JSON 格式化校验一遍, 它会明确指出哪一行哪一列不对。

富文本清理的 8 个场景分别做什么

进页默认就是「网页复制」,什么都不点、粘上去就有干净结果。 换场景是为了处理那些只在特定来源才出现的问题, 下面这张表与页面上的按钮共用同一份配置,点哪个按钮生效的就是哪一行:

场景什么时候用它会额外做什么
网页复制从网页、维基、文档站复制正文默认设置:去格式、清隐形字符、压掉多余空行、自动判断要不要接回硬换行,文字本身一个字不改。
Word / WPS从 Word、WPS 文档复制段落额外去掉 Word 复制过来的自动编号(那些是死数字,重排会错),项目符号统一成「- 」。
PDF / 论文从 PDF、论文、扫描件复制强制把每一行硬换行都接回段落,并清掉断词用的软连字符——这是 PDF 复制最需要的一步。
微信 / 公众号群消息、公众号正文、小红书文案重点清零宽字符(这些渠道最多),压掉排版留下的空行,链接地址保留在文字后面便于溯源。
代码 / 终端从文档、聊天记录里抄代码或命令把弯引号、破折号、省略号还原成 ASCII(粘进 IDE 就报错的头号原因),不合并断行、不动空行与缩进。
只要纯文本(最狠)塞进 CMS、表单、数据库字段全开:删掉全部空行与项目符号、弯引号 ASCII 化、全角空格换成半角,输出压到最干净。
只去格式,别动我的字只想掉样式,其余原样只做去格式和行尾统一:空行、空白、断行、符号、编号一律不碰,最保守的一档。
自定义自己勾清理项改动任意一个开关就会自动切到这一档,你的组合不会被预设覆盖掉。

改动任意一个清理项都会自动切到「自定义」,你手动勾的开关不会被场景悄悄覆盖回去; 这些参数偏好会记在浏览器本地,下次打开还是你上次的配置, 但文本内容一个字都不会被存下来

粘贴去格式、富文本转纯文本说的是一回事吗

大体上是,但有三处例外会让人白试半天。同一件事在不同人嘴里有十几种叫法, 而其中几组词指向的其实不是同一个需求——下面这张表按需求归组, 顺便说清哪一组该来本页、哪一组该去别处。

常见叫法与搜法它实际指的事该用什么
粘贴去格式 / 复制粘贴去格式 / 在线去格式最常见的问法,说的就是本页做的事:把剪贴板里那份带样式的内容取成干净文字粘进来即可,默认的「网页复制」场景就是它
富文本转纯文本 / 纯文本转换偏「格式转换」的说法。要当心「纯文本转换」还有另一个意思——文件编码不是 UTF-8、打开一片乱码,那是编码问题不是格式问题本页只做前者;编码不对的文件本页会明确提示,请另存为 UTF-8 再回来
去除格式 / 清除格式 / 文本格式清理 / 去格式化工具含义最宽的一组,三种诉求常被混在一起说:去掉粘贴带来的样式、去掉 HTML 标签、去掉 Markdown 语法本页只管第一种;手上是能直接看见尖括号的 HTML 源码,请改用去除 HTML 标签
粘贴纯文本 / 粘贴保留纯文本 / 粘贴时不要格式 / ctrl shift v 粘贴为纯文本问的是粘贴动作本身怎么设置,答案在目标软件里:Word 是「开始 - 粘贴 - 只保留文本」,浏览器和多数编辑器是 Ctrl+Shift+V这些只能去掉样式,去不掉隐形字符、PDF 断行和 Word 自动编号,粘完仍建议来这里过一遍
paste as plain text online / remove formatting from text / strip formatting online / rich text cleaner / clean pasted text英文界面里的叫法,指的是同一件事英文工具多数只做去样式,对中文特有的全角空格、中文弯引号和中文 PDF 断行不做处理

一句话分辨:你手上是「复制粘贴过来的内容」还是「一串能看见标签的源码」。 前者来本页,后者去去除 HTML 标签; 想连标题、链接、加粗一起保留成语法,那是HTML 转 Markdown 的活。

富文本清理一般用来做什么:7 个真实场景

  • Word 稿件贴进 CMS 后台编辑器最怕的就是 Word 粘过来的一堆内联样式和 mso 类名。选「Word / WPS」场景,正文只剩文字,自动编号那些死数字会一并去掉(删掉中间一条后面的号才不会全错),项目符号统一成「- 」,贴进后台不会再带样式。
  • 网页资料贴进笔记与文档网页复制会同时带 HTML 与纯文本两份,粘出来就是一堆字体和链接色。默认的「网页复制」场景只取文字、丢掉全部标签与样式表,顺手清掉网页里常见的零宽字符与不间断空格;想保留出处就把超链接改成「文字后面附上地址」。
  • PDF 论文摘录重新排版选「PDF / 论文」场景,硬换行会被接回完整段落,中文直接相接、英文补一个空格,被连字符断开的英文单词拼回原样,软连字符一并清掉。分栏 PDF 的页眉页脚可能混进正文,接回之后请扫一眼再用。
  • 公众号文案二次编辑微信、公众号、小红书的富文本里塞着大量 section 嵌套与零宽字符,这也是「明明一样却搜不到」的元凶。「微信 / 公众号」场景重点清零宽字符、压掉排版空行,并把链接地址留在文字后面。
  • 网页表格贴进 ExcelHTML 表格默认转成制表符分隔,一行一条、单元格之间是 Tab,直接粘进 Excel 或 Numbers 就能分列。要做真正的表格格式转换请用 CSV 相关工具,本页只负责把表格文字取干净。
  • 从文档或聊天记录里抄代码选「代码 / 终端」场景:弯引号、破折号、省略号还原成 ASCII,全角空格与零宽字符清掉,同时不合并断行、不动空行与缩进——代码的换行和缩进本身就是语义。
  • 客户发来的富文本要入库选「只要纯文本(最狠)」,空行、项目符号、排版符号一并压干净,输出可以直接写进数据库字段或表单。入库前想确认长度有没有超,接着用字数限制检查。

最后说清本页的边界,免得白试:它只处理你复制粘贴过来的内容,输出永远是纯文本。 要把一串 HTML 源码字符串去掉标签,用去除 HTML 标签; 要把 HTML 转成带链接和加粗语法的 Markdown,用HTML 转 Markdown; 手上是 .docx 文件而不是复制的内容,用Word 转 TXT; 要成体系地互转中英文标点,用中英标点转换; 要做全角半角转换,用全角半角转换。 清理完之后的下一步通常是:先用去空行空格精修空白, 再用文本排序文本去重整理, 需要自定义替换规则就交给批量查找替换, 发布前用字数限制检查确认没超平台上限。