富文本清理
富文本清理是免费在线粘贴去格式工具:把从 Word、网页、PDF、微信公众号复制的内容粘进来,一键去掉字体、颜色、加粗、超链接等全部格式,得到干净的纯文本。它还会清掉看不见却会出事的粘贴污染——零宽字符、不间断空格、全角空格、行尾空格、Word 自动编号,也能把 PDF 复制下来每行都断开的文字接回完整段落。可保留段落也可压成一段,每项改动都逐条报数。全程在浏览器本地完成,粘贴的内容不上传。
手机和不少 App 的剪贴板只提供纯文本,格式可能已经由系统去掉;本页仍会清理隐形字符、多余空白与断行, 并在上面的徽章里如实标注这次到底拿到了什么。
选一个场景(点了就用,不用逐项勾)
默认设置:去格式、清隐形字符、压掉多余空行、自动判断要不要接回硬换行,文字本身一个字不改。
全部 17 项清理器:去格式 / 不可见污染 / 行与段 / 列表与编号 / 字符规范
这 17 项分别在清什么、从哪来、不清会出什么问题
去格式
- 去掉 HTML 标签与样式:粘到别处带着字体、字号、颜色、背景、行距,贴进 CMS 或表单还会带一堆 class 与内联样式
- 丢弃脚本、样式表与注释:用正则 <[^>]*> 粗暴去标签会把 CSS 规则和 JS 代码原样倒进结果,是最典型的「粘出来一堆样式代码」
- 超链接:默认粘贴会带蓝色下划线样式;直接丢掉又会丢失出处
- 图片:纯文本里塞不下图片,粘过去要么是空白要么是一串 base64
- 表格:直接去标签会把整行单元格挤成一串没有分隔的文字,列全糊在一起
不可见污染
- 不间断空格与全角空格:看起来就是个空格,但搜索、匹配、导入数据库时对不上,Excel 里的查找也找不到
- 零宽字符与 BOM:完全看不见,却让两段「一模一样」的文字比对不相等、搜索搜不到、账号密码粘过去登录失败
- 软连字符:平时不显示,一旦复制出来就成了单词里的隐形字符,拼写检查和搜索全对不上
- 控制字符与行分隔符:导入数据库或 JSON 解析时直接报错,编辑器里显示成方块或干脆看不见
行与段
- 行尾统一:同一份文本里混着两种行尾,diff 会整篇标红,脚本按 \n 切行会留下一堆 \r
- 行尾多余空白:看不见,但会让每行末尾多出字符,拼 SQL、比对、导入时对不上
- 多余空行:粘出来段落之间隔着五六个空行,看着像没排版
- 断行合并(会改动文字):复制出来每行都断开,重新排版时段落全乱,中间还夹着断开的单词
列表与编号
- 项目符号(会改动文字):复制过来是 •、·、▪ 这些死符号,样式不统一,贴进 Markdown 也不成列表
- 自动编号残留(会改动文字):这些数字不再自动重排,删掉中间一条后面的编号就全错了
字符规范
- 弯引号与排版符号(会改动文字):从文档里抄的代码粘进编辑器直接报语法错误,命令行里也粘不出正确的参数
- emoji 与图形符号(会改动文字):入库、打印、生成正式文档时不需要,有些系统还会存成乱码
🔒 剪贴板里的富文本只在你的浏览器里被当成字符串解析取文字,全程不渲染、不上传任何服务器, 也不写入本地存储(只记住你选的场景与清理项),关闭页面即清除。复制结果时只写入纯文本, 再粘到 Word 也不会带回格式。
如何使用富文本清理
光标点进「粘贴区」,直接按 Ctrl+V(Mac 是 Command+V)粘贴从 Word、WPS、网页、PDF 或公众号复制的内容。页面会同时读取剪贴板里的富文本与纯文本,并在粘贴区上方用徽章如实标注这次拿到的是「富文本(HTML)」还是「纯文本」。也可以直接打字,或拖入 .txt / .md / .log / .csv / .srt 纯文本文件(单文件 10 MB 以内,按 UTF-8 读取);.html 文件不收,那是 HTML 源码不是粘贴内容。
点一个场景:网页复制 / Word、WPS / PDF、论文 / 微信、公众号 / 代码、终端 / 只要纯文本 / 只去格式。每个场景下面写清了它会额外做什么,点完还能展开 17 项清理器逐个调;改动任意一项会自动切到「自定义」,不会被场景悄悄覆盖。输出方式有保留段落、轻结构、压成一段三档。
看右边的清理台账:每一项改了什么、改了几处、首个命中的前后对照都列出来,0 处的项也会列出来证明查过了。确认没问题就点「复制为纯文本」(写进剪贴板的只有纯文本,再粘到 Word 也不会带回格式)或「下载 .txt」;想再清一轮就点「回填再清一次」,结果不会变——本工具是幂等的。
关于富文本清理的常见问题
- 富文本清理会上传我粘贴的内容吗
- 不会上传。读取剪贴板、解析富文本、去格式与清理全部在你的浏览器里用 JavaScript 完成,页面没有任何一次把内容发往服务器的请求,关闭或刷新页面即全部清除,断网状态下同样能用。剪贴板里的原始 HTML 只存在于内存中,不写入本地存储;本页只记住你选的场景与清理项这些参数偏好。所以处理合同、客户资料、内部文档也可以放心使用。
- 从 Word 复制的文字怎么去掉格式变成纯文本
- 打开本页,在粘贴区直接按 Ctrl+V。工具会取出剪贴板里那份带样式的 HTML,只把文字提取出来,字体、字号、颜色、背景、加粗、超链接、段落间距全部丢掉,右边就是纯文本。选「Word / WPS」场景还会顺手去掉 Word 自动编号复制过来的死数字,并把项目符号统一成「- 」。最后点「复制为纯文本」,再粘到任何地方都不会带格式。
- 网页上复制的文字粘贴过去带一堆样式怎么办
- 那是因为剪贴板里同时存了一份 HTML,目标软件优先用了它。本工具只读取这份 HTML 里的文字、丢掉全部标签与样式表——包括 script、style 和注释里的内容,一个字符都不会漏进结果,所以不会出现「粘出来一堆 CSS 代码」那种情况。它还会顺手删掉网页里常见的零宽字符和不间断空格,贴进 CMS 或表单就不会再带样式。
- PDF 复制的文字每行都断开怎么接成段落
- 选「PDF / 论文」场景就行。PDF 是版式文件,换行是排版产物而不是段落,所以复制出来每行都断开。工具会按句末标点、行长度、是否列表行或表格行来判断哪些换行该接回去:中文直接相接、英文补一个空格,被连字符断开的英文单词(inter- 换行 national)也会拼回 international。如果原文本来就是诗歌、地址或代码,把「合并断行」改成「不合并」,台账里也会写明接回了多少处。
- 粘贴过来的文字里有看不见的字符怎么清掉
- 零宽空格、零宽连接符、BOM、软连字符、不间断空格、全角空格、方向控制符与 C0/C1 控制字符都会被清理,并在结果区逐项告诉你删了几个、分别是哪个码点(例如 U+200B×2、U+FEFF×1)。这类字符正是「看着一模一样却搜不到、对不上、导入报错」的原因。组成 emoji 的零宽连接符受保护,全家福表情不会被拆成三个人。
- 从文档抄的代码粘贴到编辑器就报错怎么解决
- 多半是 Word 或网页把直引号自动替换成了弯引号“ ”,或者混进了全角空格、不间断空格和零宽字符。选「代码 / 终端」场景,工具会把弯引号、破折号、省略号还原成 ASCII 字符并清掉隐形空白,同时不合并断行、不动你的空行与缩进。要调试正则用正则测试,要检查 JSON 用 JSON 格式化。
- Ctrl+Shift+V 和在线粘贴去格式工具有什么区别
- Ctrl+Shift+V(粘贴为纯文本)由目标软件自己实现,各家行为不一致:有的仍保留部分样式,有的在网页输入框里被网站接管,而且它只去样式,不会处理零宽字符、不间断空格、PDF 硬换行、Word 自动编号这些问题,更不会告诉你它做了什么。本工具按场景一次性处理这 17 类污染,并逐项列出改了什么、改了几处。
- 粘贴到 Word 不带格式怎么设置
- Word 里点「开始 - 粘贴 - 只保留文本」就是一次性的不带格式粘贴;想以后按 Ctrl+V 默认如此,进「文件 - 选项 - 高级」,把「粘贴自其他程序」改成「仅保留文本」,WPS 的位置类似。要提醒的是这个设置只解决样式:从网页或 PDF 带过来的零宽字符、不间断空格、行尾空白和断开的行,照样会原样进入 Word 文档,只是你看不见。要连这些一起清干净,就先粘到本页处理完,再复制到 Word。
- 粘贴去格式会不会把我的文字内容改掉
- 默认只删格式和不可见字符,不改文字本身:中英文标点、全角标点、大小写一律不动,中文的全角逗号句号更是永远不碰(要转标点请用中英标点转换)。对照表里标了「会改动文字」的一共五项,其中弯引号 ASCII 化、删 emoji、去掉项目符号、去掉自动编号这四项默认全部关闭,只有你手动勾选或选了明确带上它们的场景才生效;第五项「合并断行」默认是保守的「自动判断」,只接回它有把握的排版换行,不满意随时改成「不合并」。每一项都会在结果区写明改了几处并给出前后对照。
- 富文本清理能保留段落和列表还是压成一段
- 三种输出都有。默认「保留段落」把段落分行原样保留,连续空行压成一个;「轻结构」在此基础上把列表统一成「- 」、表格用制表符分列,适合转手贴进笔记;「压成一段」把所有换行去掉合成一整段,中文直接相接、英文补空格,适合填表单和发消息。注意本页产出的始终是纯文本,不会输出 Markdown 的加粗和链接语法,要完整 Markdown 请用 HTML 转 Markdown。
- 复制表格粘贴过来会变成什么格式
- HTML 表格默认转成制表符分隔的纯文本:每行一条,单元格之间是一个 Tab,可以直接粘进 Excel 或 Numbers 自动分列。也可以改成用空格分列,或者选「丢弃表格」把表格里的文字整体去掉。单元格之间的换行与缩进不会变成多余的尾随空格,所以粘进表格后每一列都是干净的。
- 微信公众号复制的文字粘贴后乱码乱排版怎么办
- 这些渠道的富文本里塞了大量 section 嵌套、内联样式和零宽字符,很多编辑器直接把它们原样吃下去,看起来就像乱码或排版全乱。选「微信 / 公众号」场景,工具只取文字、压掉多余空行、重点清掉零宽字符,链接地址可以选择保留在文字后面。真正的编码乱码(文件不是 UTF-8)本页会明确提示,请另存为 UTF-8 再来。
- 粘的是 HTML 源码能用富文本清理去标签吗
- 本页处理的是「复制粘贴过来的带格式内容」,也就是剪贴板里真的带了一份 HTML 的情况。如果你手上是一串 HTML 源码字符串(像 <p>你好</p> 这样能直接看见标签的文本),本页只会提示你、不会擅自解析——因为那样会把正文里正常的 a < b、泛型 List<int> 一起吃掉。这种需求要用专门的「去除 HTML 标签」工具(本站文本处理分类里就有);如果你想连标题、链接和加粗一起保留成 Markdown,现在就可以用 HTML 转 Markdown。
- 手机上粘贴去格式还能用吗有什么不一样
- 能用,页面在窄屏上会自动纵向堆叠。要说明的是:手机和不少 App 的剪贴板只提供纯文本,格式可能已经由系统去掉了,这时页面上的徽章会如实标成「来源:纯文本」,而不是假装完成了去格式。即便只拿到纯文本,工具仍会清理隐形字符、多余空白、行尾空格和断行,这些问题在手机上同样存在。
- 富文本清理免费吗支持多大的文本和哪些文件格式
- 完全免费、无需注册、不加水印。粘贴的纯文本建议 500 万字以内,剪贴板富文本 1000 万字符以内,超过会明确提示已处理多少而不是静默截断;超过 20 万字会切换成「点按钮处理 + 进度条 + 可取消」的模式,避免卡住页面。文件方面支持拖入 .txt / .md / .log / .csv / .srt 等 UTF-8 纯文本,单文件 10 MB 以内;.html 文件不收,非 UTF-8 文件会提示另存为 UTF-8 后重试。
复制的文字带格式怎么去掉:9 种症状速查
先按你看到的现象找,比按「这属于第几类污染」找快得多。 下面九行覆盖了粘贴出问题时最常见的九种样子:左边是症状,中间是它真正的成因, 右边是本页对应的处理。找到自己那一行,照着选场景就行。
| 粘出来的症状 | 真正的原因 | 本页怎么处理 |
|---|---|---|
| 想把 Word 复制粘贴去掉格式,样式是没了,编号却还在,删掉中间一条后面全错 | Word 的自动编号是域,复制到别处时被固化成普通数字,从此不再自动重排 | 选「Word / WPS」场景。word 自动编号复制过来怎么去掉,靠的是「去掉自动编号」这一项:行首的死数字整段删掉,项目符号统一成「- 」 |
| 网页复制文字去格式没做干净,粘贴到 CMS 带一堆样式,有时还粘出一段 CSS | 网页复制会同时往剪贴板写 HTML 与纯文本两份,编辑器优先吃 HTML;有的编辑器还会把 style 标签里的样式代码当正文吐出来 | 本页只从这份 HTML 里取文字,script、style 与注释整段丢弃,样式代码一个字符都漏不进结果 |
| 粘贴到表单格式乱,看着和原文一样,提交时却报字段超长或校验不通过 | 表单里混进了不间断空格、零宽字符和行尾空格——它们都算长度,也会让后台的精确匹配对不上 | 默认场景就会清掉这几类;要连空行一起压干净就选「只要纯文本(最狠)」 |
| 微信复制文字格式怎么去掉一直没弄明白,公众号里复制的段落粘出来空行成片、字号忽大忽小 | 微信编辑器用大量 section 嵌套做排版,还会插入零宽字符,很多编辑器原样吃下去 | 选「微信 / 公众号」场景。公众号复制文字去格式的重点是清零宽字符、压掉排版空行,链接地址可以选择留在文字后面 |
| PDF 复制粘贴换行怎么去掉:一段话被切成十几行,粘到哪里都是断的 | PDF 是版式文件,换行是按行宽切出来的排版产物,不是作者的段落 | 选「PDF / 论文」场景,按下面一节的五条规则把排版换行接回去,诗歌与代码不会被误接 |
| 复制文字有隐藏字符:站内搜索搜不到、两边比对对不上、导入数据库还报错 | 零宽空格、BOM、软连字符这些字符不占位置也不显示,肉眼根本没法排查 | 结果区按码点逐个报数(形如 U+200B×2),删了哪几个、各几处一目了然 |
| 复制的文字有看不见的空格,用 Excel 或脚本一比对就是不相等 | 全角空格 U+3000 与不间断空格 U+00A0 显示得和普通空格一模一样,但码点不同 | 两者都会被换成普通半角空格;至于 nbsp 怎么去掉,靠的就是这一项 |
| 粘贴代码引号报错,逐字对了半小时也看不出哪里不一样 | 文档的智能引号把直引号换成了弯引号,缩进里还混进了全角空格 | 选「代码 / 终端」场景,把中文引号变直引号、破折号还原成连字符,同时不合并断行、不动缩进 |
| 复制表格到文本粘出来挤成一坨,分不清哪个字属于哪一列 | HTML 表格的单元格边界在转成纯文本时丢了,就只剩一串连续文字 | 默认转成制表符分隔:一行一条、单元格之间一个 Tab,直接粘进 Excel 或 Numbers 就能分列 |
九种症状里有六种的根子是同一件事:剪贴板里存的从来不止你看见的那些字。 Word 存的是带 mso 类名的 HTML,网页存的是整棵 DOM 的片段,微信还会顺手塞进零宽字符。 目标软件拿到这份 HTML 就照单全收,于是样式、隐形字符、行尾空格一起进了你的文档。 本页的做法是绕开这一步:把那份 HTML 当字符串解析、只取文字,再按场景清理。
复制粘贴过来的文字有哪些格式污染:17 类对照
「粘出来不对劲」从来不只是字体和颜色的问题。真正让人抓狂的是那些看不见却会出事的东西:搜索搜不到、比对对不上、导入报错、代码粘进去就报语法错误。 下面这张表把本页会处理的每一类污染都写清楚了:它从哪来、不清会造成什么问题、本工具怎么处理。 表格与页面上的清理台账共用同一份数据,实现改了这里就会跟着改,不会出现说明与实际不符。
表里最值得单拎出来说的是两类。一类是零宽字符:它宽度为零、不显示、也搜不出来, 所以「零宽字符怎么删除」没法靠肉眼加退格键解决,只能按码点扫。本页按 U+200B、U+200C、 U+200D、U+2060、U+FEFF 这些码点逐个识别并报数,唯独放过组成 emoji 的那个零宽连接符—— 删了它,一家三口的全家福表情会当场散成三个人。 另一类是行尾空格:复制的文字行尾有空格几乎不可能被看见,却会让 Markdown 多出一个硬换行、 让 diff 整行标红、让配置文件的值莫名其妙多一截。本页默认逐行清掉行尾空白,行首缩进一律不动——代码与 YAML 的层级不会被破坏。
| 污染类型 | 从哪来 | 不清会怎样 | 本工具怎么处理 |
|---|---|---|---|
| 去掉 HTML 标签与样式 | 从 Word、WPS、网页、公众号复制时,剪贴板里同时存了一份带样式的 HTML | 粘到别处带着字体、字号、颜色、背景、行距,贴进 CMS 或表单还会带一堆 class 与内联样式 | 把剪贴板里的 HTML 当字符串做词法扫描、只取文字,全程不渲染、不建 DOM 节点 |
| 丢弃脚本、样式表与注释 | 整页复制时必然带上 script、style、noscript、head、title 和 HTML 注释 | 用正则 <[^>]*> 粗暴去标签会把 CSS 规则和 JS 代码原样倒进结果,是最典型的「粘出来一堆样式代码」 | 扫描器进入这些块后整段丢弃;连未闭合的 script 也一直丢到文档末尾,一个字符都不进输出 |
| 超链接 | 网页正文里的 a 标签 | 默认粘贴会带蓝色下划线样式;直接丢掉又会丢失出处 | 三档可选:只留锚文本(默认)、锚文本后附上地址、整条链接文字都去掉;javascript: 这类地址永不附加 |
| 图片 | 网页与公众号正文里的 img | 纯文本里塞不下图片,粘过去要么是空白要么是一串 base64 | 默认整个去掉;需要说明文字时可以选「保留 alt 文字」 |
| 表格 | HTML 表格,以及从 Excel、飞书表格复制的区域 | 直接去标签会把整行单元格挤成一串没有分隔的文字,列全糊在一起 | 默认单元格之间放制表符、每行一条,可以直接粘进 Excel 分列;也可以改成空格或整体丢弃 |
| 不间断空格与全角空格 | 是网页排版占位的常客;U+3000 全角空格来自中文输入法与 Word 的首行缩进 | 看起来就是个空格,但搜索、匹配、导入数据库时对不上,Excel 里的查找也找不到 | 不间断空格换成普通空格;全角空格可选择换成空格、删除或保留,并逐项报数 |
| 零宽字符与 BOM | 微信、公众号、小红书、部分在线编辑器与「防复制」脚本会往文字里插零宽字符 | 完全看不见,却让两段「一模一样」的文字比对不相等、搜索搜不到、账号密码粘过去登录失败 | 按码点逐个删除并给出 U+200B×2 这样的明细;组成 emoji 的零宽连接符受保护,不会把表情拆开 |
| 软连字符 | PDF、Word 为了在行末断词插入的 U+00AD | 平时不显示,一旦复制出来就成了单词里的隐形字符,拼写检查和搜索全对不上 | 整体删除,并在台账里单独报数 |
| 控制字符与行分隔符 | 从终端、日志、老系统与部分 PDF 复制时混进来的 C0/C1 控制字符、U+2028/U+2029 | 导入数据库或 JSON 解析时直接报错,编辑器里显示成方块或干脆看不见 | 删除控制字符(保留制表符与换行);U+2028/U+2029 转成换行而不是删掉,否则两段会粘成一段 |
| 行尾统一 | Windows 与 Mac、网页与文档混着来的 CRLF / CR | 同一份文本里混着两种行尾,diff 会整篇标红,脚本按 \n 切行会留下一堆 \r | 统一成 LF;需要给 Windows 记事本用时可以在输出时改回 CRLF |
| 行尾多余空白 | 网页排版、表格复制、手动换行时留下的行尾空格与制表符 | 看不见,但会让每行末尾多出字符,拼 SQL、比对、导入时对不上 | 逐行清掉行尾空白,行首缩进一律不动(代码与 YAML 的层级不会被破坏) |
| 多余空行 | 网页里的空 p 标签、公众号排版里的占位行 | 粘出来段落之间隔着五六个空行,看着像没排版 | 默认把连续空行压成一个(保留段落感),也可以全部保留或全部删除;口径与「去空行空格」完全一致 |
| 断行合并(会改动文字) | PDF、论文、邮件、老论坛正文每 40~80 个字符就硬换一行 | 复制出来每行都断开,重新排版时段落全乱,中间还夹着断开的单词 | 按句末标点、行长度、是否列表行或表格行判断哪些换行是排版产物并接回;中文直接相接、英文补一个空格、被连字符断开的英文单词拼回原样 |
| 项目符号(会改动文字) | Word、WPS 的项目符号列表,以及网页 ul/li | 复制过来是 •、·、▪ 这些死符号,样式不统一,贴进 Markdown 也不成列表 | 默认统一成 Markdown 的「- 」,也可以原样保留或整体删掉;已经是「- 」的行不会被加成「- - 」 |
| 自动编号残留(会改动文字) | Word 的自动编号、有序列表复制出来变成的死数字 | 这些数字不再自动重排,删掉中间一条后面的编号就全错了 | 可选删除行首的 1. / 1) / 一、/ ① 等编号;默认不动,且只认三位以内的数字,2026. 那一年 不会被当成编号 |
| 弯引号与排版符号(会改动文字) | Word、网页会把直引号自动替换成 “ ”,破折号变成 — –,省略号变成 … | 从文档里抄的代码粘进编辑器直接报语法错误,命令行里也粘不出正确的参数 | 可选把 “ ” ‘ ’ 还原成 " ',— – 还原成 -,… 还原成 ...;默认关闭,只有「代码 / 终端」等预设会打开 |
| emoji 与图形符号(会改动文字) | 聊天记录、社媒文案里的表情 | 入库、打印、生成正式文档时不需要,有些系统还会存成乱码 | 可选整簇删除(不会把一个表情拆成几个残片);默认保留 |
标了「会改动文字」的五项默认全部关闭或需要你显式选择场景, 其余的只删格式与不可见字符,不动任何一个可见的字。这是本页的底线: 静默改字的工具,用户第二次就不敢用了。想单独精修纯文本里的空行与空格, 用去空行空格;想做去重、排序、大小写, 用文本处理工具箱。
记事本中转和 Ctrl+Shift+V 去格式有什么区别
大部分人已经知道两个土办法:按 Ctrl+Shift+V「粘贴为纯文本」, 或者先粘进记事本再复制出来。它们都能去掉样式,但都只解决了问题的一半。
| 方式 | 它做了什么 | 它没做什么 |
|---|---|---|
| Ctrl+Shift+V(粘贴为纯文本) | 由目标软件决定怎么处理剪贴板,多数情况下只丢样式 | 各家软件行为不一致:有的仍保留部分样式,有的在网页输入框里直接被网站接管;只去样式,不会碰零宽字符、不间断空格、PDF 硬换行、Word 自动编号,也不会告诉你它到底做了什么 |
| 记事本 / 便签中转一遍 | 粘进纯文本编辑器再复制出来,格式确实没了 | 多一次来回,而且只解决样式:隐形字符原样带过去,PDF 的每行断开还是断开,行尾空格照旧,Word 的死编号照旧;中文全角空格也一个不少 |
| 本页的富文本清理 | 直接读剪贴板里的 text/html,当字符串解析取文字,再按你选的场景清 17 类粘贴污染 | 按场景一次处理完,并逐项列出「改了什么、改了几处、前后长什么样」;会改动文字的选项默认关闭,需要时才由你或场景预设打开 |
使用建议:日常在 Word、聊天窗里粘一句话,Ctrl+Shift+V 就够了; 一旦是「要入库、要发布、要和别的数据比对、要粘进代码编辑器」这几种情况, 就值得多开一个页面——因为出问题的往往不是样式,而是那几个看不见的字符。 本页与两个土办法最大的差别是它会告诉你它改了什么: 哪一类、几处、首个命中长什么样,全部列在结果区。
PDF 复制的文字为什么每行都断开,怎么接回段落
PDF 是版式文件:它记录的是「哪个字画在纸面的哪个位置」, 而不是「这段话有几个自然段」。排版软件在生成 PDF 时按行宽把文字切开, 于是复制出来就是一行一行的短句——那些换行是排版产物,不是作者的段落。 论文、扫描件、分栏排版的期刊尤其严重,有些还会在行末插一个看不见的软连字符把英文单词断开。
所以「pdf 复制粘贴换行怎么去掉」这个问题,准确的答法不是把换行全删掉。 PDF 复制的文字怎么合并成段落,取决于相邻两行到底是不是同一句话—— 删光换行会把诗歌、地址、歌词和代码一起改坏,留着又读不成段。
本页的「合并断行」就是在还原这件事。它不是无脑把所有换行都删掉—— 那会把诗歌、地址、代码、歌词全部改坏。判定依据一共五条,两行同时满足才会接起来:
| 判定规则 | 为什么这么定 |
|---|---|
| 上一行以句末标点结尾就不合并 | 。!?;…以及右引号、右括号意味着这句话说完了,后面多半是真正的新段落 |
| 上一行短于 24 个字符就不合并 | 标题、地址、诗句、表单项天生就短,短行接起来最容易把原文改坏 |
| 列表行与含制表符的表格行都不参与 | 「- 甲」「1. 乙」是新条目,含 Tab 的行是表格,它们的换行是结构而不是排版 |
| 空行永远是段落边界 | 两段之间的空行是作者的真实意图,合并绝不跨越它 |
| 拉丁字母 + 连字符结尾视为断词,接回时删掉连字符 | inter- 换行 national 拼回 international;而 2026- 换行 08 两侧不是字母,不会被拼成 202608 |
接回时的拼接也分情况:两侧都是中文直接相接、不加空格; 有一侧是英文或数字则补一个空格;上一行以「字母 + 连字符」结尾就当成断词, 删掉连字符直接拼。「PDF / 论文」场景用的是更激进的「全部接回」, 因为 PDF 的每一行几乎都是排版换行;默认的「自动判断」则保守得多。 无论哪一档,台账都会写明接回了多少处, 发现接错了就把「合并断行」改成「不合并」,一键回到原样。
PDF 复制换行接回段落算例:三行变两行
从一篇 PDF 论文里复制下来的三行长这样(每行末尾都是 PDF 的排版换行):
本文提出一种轻量的 inter-
national 文本清理方案。
实验部分见第 3 节。选「PDF / 论文」场景后得到:
本文提出一种轻量的 international 文本清理方案。
实验部分见第 3 节。第一行以「字母 + 连字符」结尾,判定为断词:连字符删掉、两半直接拼回 international,中间不补空格。第二行以句号收尾,命中「句末标点不合并」, 所以「实验部分见第 3 节。」仍然自成一行,没有被吸进上一段。 台账这次记的是合并断行 1 处——三行变两行,只动了该动的那一处。
还有两件事要提醒:分栏 PDF 复制文字排版乱是另一回事——两栏的文字会交错在一起, 页眉页脚也会混进正文,这是复制阶段就已经乱了,任何工具都救不回来,接回段落后请扫一眼; 另外如果你手上是 PDF 文件而不是复制的内容,那属于 PDF 提取文字的范畴,不在本页。
从文档抄的代码粘到编辑器就报错,是什么原因
这是「粘贴去格式」里最典型、也最费时间的一类问题:代码看上去一模一样, 粘进 IDE 或终端却直接报语法错误,逐字对了半小时也看不出差别。 元凶通常是下面四类字符——它们在文档里显示得和正常字符几乎一样:
| 粘过来的是 | 应该是 | 典型症状 |
|---|---|---|
“ ”(弯双引号) | " "(直双引号) | JS / Python / JSON 直接语法错误,报错常常指向下一行,找半天找不到 |
‘ ’(弯单引号) | ' '(直单引号) | Shell 里引号不配对,命令粘进终端后一直等你补右引号 |
—(破折号) | -(连字符) | 命令行参数 --force 变成 —force,工具报「未知选项」 |
全角空格、不间断空格、零宽字符 | 普通半角空格 / 直接删掉 | Python 报 IndentationError,YAML 缩进解析失败,正则怎么写都匹配不上 |
为什么会变?Word、WPS 与很多富文本编辑器默认开着「智能引号」, 你敲的直引号会被自动替换成弯引号;中文输入法在全角状态下敲的空格是 U+3000; 网页排版为了对齐大量使用 ;某些站点还会主动往代码块里插零宽字符防复制。 选「代码 / 终端」场景可以一次解决:弯引号、破折号、省略号还原成 ASCII, 全角空格与零宽字符清掉,同时不合并断行、不压空行、不动缩进—— 代码的换行和缩进本身就是语义,动了就是另一个 bug。
清完之后想验证规则写得对不对,用正则测试; 贴的是 JSON 就用JSON 格式化校验一遍, 它会明确指出哪一行哪一列不对。
富文本清理的 8 个场景分别做什么
进页默认就是「网页复制」,什么都不点、粘上去就有干净结果。 换场景是为了处理那些只在特定来源才出现的问题, 下面这张表与页面上的按钮共用同一份配置,点哪个按钮生效的就是哪一行:
| 场景 | 什么时候用 | 它会额外做什么 |
|---|---|---|
| 网页复制 | 从网页、维基、文档站复制正文 | 默认设置:去格式、清隐形字符、压掉多余空行、自动判断要不要接回硬换行,文字本身一个字不改。 |
| Word / WPS | 从 Word、WPS 文档复制段落 | 额外去掉 Word 复制过来的自动编号(那些是死数字,重排会错),项目符号统一成「- 」。 |
| PDF / 论文 | 从 PDF、论文、扫描件复制 | 强制把每一行硬换行都接回段落,并清掉断词用的软连字符——这是 PDF 复制最需要的一步。 |
| 微信 / 公众号 | 群消息、公众号正文、小红书文案 | 重点清零宽字符(这些渠道最多),压掉排版留下的空行,链接地址保留在文字后面便于溯源。 |
| 代码 / 终端 | 从文档、聊天记录里抄代码或命令 | 把弯引号、破折号、省略号还原成 ASCII(粘进 IDE 就报错的头号原因),不合并断行、不动空行与缩进。 |
| 只要纯文本(最狠) | 塞进 CMS、表单、数据库字段 | 全开:删掉全部空行与项目符号、弯引号 ASCII 化、全角空格换成半角,输出压到最干净。 |
| 只去格式,别动我的字 | 只想掉样式,其余原样 | 只做去格式和行尾统一:空行、空白、断行、符号、编号一律不碰,最保守的一档。 |
| 自定义 | 自己勾清理项 | 改动任意一个开关就会自动切到这一档,你的组合不会被预设覆盖掉。 |
改动任意一个清理项都会自动切到「自定义」,你手动勾的开关不会被场景悄悄覆盖回去; 这些参数偏好会记在浏览器本地,下次打开还是你上次的配置, 但文本内容一个字都不会被存下来。
粘贴去格式、富文本转纯文本说的是一回事吗
大体上是,但有三处例外会让人白试半天。同一件事在不同人嘴里有十几种叫法, 而其中几组词指向的其实不是同一个需求——下面这张表按需求归组, 顺便说清哪一组该来本页、哪一组该去别处。
| 常见叫法与搜法 | 它实际指的事 | 该用什么 |
|---|---|---|
| 粘贴去格式 / 复制粘贴去格式 / 在线去格式 | 最常见的问法,说的就是本页做的事:把剪贴板里那份带样式的内容取成干净文字 | 粘进来即可,默认的「网页复制」场景就是它 |
| 富文本转纯文本 / 纯文本转换 | 偏「格式转换」的说法。要当心「纯文本转换」还有另一个意思——文件编码不是 UTF-8、打开一片乱码,那是编码问题不是格式问题 | 本页只做前者;编码不对的文件本页会明确提示,请另存为 UTF-8 再回来 |
| 去除格式 / 清除格式 / 文本格式清理 / 去格式化工具 | 含义最宽的一组,三种诉求常被混在一起说:去掉粘贴带来的样式、去掉 HTML 标签、去掉 Markdown 语法 | 本页只管第一种;手上是能直接看见尖括号的 HTML 源码,请改用去除 HTML 标签 |
| 粘贴纯文本 / 粘贴保留纯文本 / 粘贴时不要格式 / ctrl shift v 粘贴为纯文本 | 问的是粘贴动作本身怎么设置,答案在目标软件里:Word 是「开始 - 粘贴 - 只保留文本」,浏览器和多数编辑器是 Ctrl+Shift+V | 这些只能去掉样式,去不掉隐形字符、PDF 断行和 Word 自动编号,粘完仍建议来这里过一遍 |
| paste as plain text online / remove formatting from text / strip formatting online / rich text cleaner / clean pasted text | 英文界面里的叫法,指的是同一件事 | 英文工具多数只做去样式,对中文特有的全角空格、中文弯引号和中文 PDF 断行不做处理 |
一句话分辨:你手上是「复制粘贴过来的内容」还是「一串能看见标签的源码」。 前者来本页,后者去去除 HTML 标签; 想连标题、链接、加粗一起保留成语法,那是HTML 转 Markdown 的活。
富文本清理一般用来做什么:7 个真实场景
- Word 稿件贴进 CMS 后台:编辑器最怕的就是 Word 粘过来的一堆内联样式和 mso 类名。选「Word / WPS」场景,正文只剩文字,自动编号那些死数字会一并去掉(删掉中间一条后面的号才不会全错),项目符号统一成「- 」,贴进后台不会再带样式。
- 网页资料贴进笔记与文档:网页复制会同时带 HTML 与纯文本两份,粘出来就是一堆字体和链接色。默认的「网页复制」场景只取文字、丢掉全部标签与样式表,顺手清掉网页里常见的零宽字符与不间断空格;想保留出处就把超链接改成「文字后面附上地址」。
- PDF 论文摘录重新排版:选「PDF / 论文」场景,硬换行会被接回完整段落,中文直接相接、英文补一个空格,被连字符断开的英文单词拼回原样,软连字符一并清掉。分栏 PDF 的页眉页脚可能混进正文,接回之后请扫一眼再用。
- 公众号文案二次编辑:微信、公众号、小红书的富文本里塞着大量 section 嵌套与零宽字符,这也是「明明一样却搜不到」的元凶。「微信 / 公众号」场景重点清零宽字符、压掉排版空行,并把链接地址留在文字后面。
- 网页表格贴进 Excel:HTML 表格默认转成制表符分隔,一行一条、单元格之间是 Tab,直接粘进 Excel 或 Numbers 就能分列。要做真正的表格格式转换请用 CSV 相关工具,本页只负责把表格文字取干净。
- 从文档或聊天记录里抄代码:选「代码 / 终端」场景:弯引号、破折号、省略号还原成 ASCII,全角空格与零宽字符清掉,同时不合并断行、不动空行与缩进——代码的换行和缩进本身就是语义。
- 客户发来的富文本要入库:选「只要纯文本(最狠)」,空行、项目符号、排版符号一并压干净,输出可以直接写进数据库字段或表单。入库前想确认长度有没有超,接着用字数限制检查。
最后说清本页的边界,免得白试:它只处理你复制粘贴过来的内容,输出永远是纯文本。 要把一串 HTML 源码字符串去掉标签,用去除 HTML 标签; 要把 HTML 转成带链接和加粗语法的 Markdown,用HTML 转 Markdown; 手上是 .docx 文件而不是复制的内容,用Word 转 TXT; 要成体系地互转中英文标点,用中英标点转换; 要做全角半角转换,用全角半角转换。 清理完之后的下一步通常是:先用去空行空格精修空白, 再用文本排序与文本去重整理, 需要自定义替换规则就交给批量查找替换, 发布前用字数限制检查确认没超平台上限。