Word 转 TXT/Markdown

Word 转 TXT/Markdown,是指把 .docx 里的正文文字抽出来,存成不带格式的 .txt 纯文本,或存成保留标题与列表层级的 .md。拖入文件即在浏览器本地解析:选「纯文本」得到干净的段落;选「Markdown」把标题写成 #、##,项目符号写成 -,加粗和链接语法也留着,适合搬进笔记或博客。中文按 Unicode 原样输出不乱码,结果可预览、复制或下载。文件不上传服务器,免费不注册;仅支持 .docx。

拖入 Word 文件(.docx),点击选择
文件不上传 · 浏览器本地解析 · 仅支持 .docx

🔒 文档在你的浏览器内解析,未上传任何服务器。仅提取文字,复杂表格/图片/版式不保留。

如何使用Word 转 TXT/Markdown

1

拖入 .docx 文件或点击选择。解析全程在你的浏览器里完成、文件不上传;旧版 .doc 会按文件头认出来并提示先另存为 .docx。

2

选输出格式:「纯文本 .txt」只要段落文字;「Markdown .md」会把标题转成 #、##,项目符号转成 -,并保留加粗与链接语法。选错了随时改,改完重新提取即可。

3

点「提取文字」,结果区显示提取到的字符数并预览前 6000 个字符,再点「复制」放进剪贴板,或「下载 .txt / .md」保存,文件名沿用原文档名。

关于Word 转 TXT/Markdown的常见问题

Word 转 TXT 会把我的文档上传到服务器吗?
不会。.docx 的解包和文字提取都由浏览器里的 JavaScript(mammoth)在你的设备上完成,页面不会把文档内容发往任何服务器,也不写入本地存储,关掉或刷新页面就全部清除,合同、简历、内部资料都可以放心提取。想自己验证:按 F12 打开开发者工具的「网络」面板,再点一次「提取文字」——你只会看到第一次点击时下载解析内核那一个 JS 代码块(之后走缓存),没有任何上传请求。
旧版 .doc 文件怎么转成 TXT 纯文本?
先用 Word 或 WPS 打开,「另存为」里选 .docx,再回本页提取。原因在格式本身:.docx 其实是个 zip 包,里面装的是 XML,浏览器解得开;旧版 .doc 是 OLE2 二进制复合文档,纯前端拆不动。工具会读文件开头的 D0 CF 11 E0 这几个字节把 .doc 认出来并直接提示,不会给你一堆乱码。电脑上没装 Office 也行,手机 WPS、腾讯文档、石墨文档导入后重新导出 docx 同样管用。
Word 转 Markdown 能保留标题和列表层级吗?
能。选 Markdown 时工具先把 docx 转成 HTML 再转 md:Word 的「标题 1、标题 2」变成 #、##,项目符号列表变成 -、子项缩进照旧,有序列表变成 1. 2.,加粗写成 **文字**、斜体写成 _文字_,超链接写成 [锚文字](网址)。不保留的是表格结构和字体、字号、颜色。有个前提常被忽略:原文档得真的用了标题样式,靠手动放大字号加粗做出来的「假标题」没有层级信息,转出来只是普通段落。
Word 转 TXT 后表格、图片和页眉会保留吗?
表格会被拆平,图片和页眉不保留。纯文本模式下每个单元格各自成行——一张 3 列 × 3 行(含表头)的表格转出来就是 9 行文字,行列对应关系没了;图片位置只留一个空行;页眉、页脚里的文字不会出现在结果里,文本框、艺术字这类浮动元素的文字位置也可能和你在 Word 里看到的不一样。需要连表格和排版一起带走,用 Word 转 HTML;只想知道有多少字,用文档字数统计,下面都给了入口。
Word 转 TXT 中文乱码怎么解决?
本页下载的 .txt 是 UTF-8 编码,Windows 记事本、VS Code、Mac 文本编辑和手机上都能正常显示中文。少数老软件(部分国产编辑器、老设备的电子书阅读器)默认按 GBK 读文件,遇到 UTF-8 就成了问号,用记事本打开后「另存为」把编码改成 ANSI/GBK 即可。反过来常见的另一种情况是从 Word 直接复制粘贴出现方块或问号,那多半是目标程序缺字体或编码不对,和文字本身无关,走本页提取再粘贴通常就正常了。
手机上怎么把 Word 文档转成 TXT 并下载?
用手机浏览器(iOS Safari、安卓 Chrome、微信内置浏览器都行)打开本页,点选择文件,从「文件」App 或聊天记录里挑出 .docx,提取同样在手机本地完成,不用装 Word 或 WPS。结果可以直接点「复制」粘到备忘录或聊天窗口。两个小提醒:微信里收到的文档要先「用其他应用打开 → 保存到文件」再回本页选择;iOS Safari 下载的 .txt 在「文件」App 的「下载」文件夹里。
Word 转 TXT 对文件大小和字数有限制吗?
页面没有单独设上限,能不能转取决于设备内存——文档要整份读进内存解析。本地实测一份 17 万字符、2000 个小节的 .docx,提取纯文本约 0.1 秒、转 Markdown 约 0.25 秒,日常几万字的稿子基本是点完就出结果。真正拖慢的是内嵌大量高清图片的文档:图片把 .docx 撑到几十上百 MB,纯文本模式根本用不到它们,却仍要先解包。手机内存小,这类大文档建议放到电脑上转。
Word 转 Markdown 后图片会变成 base64 一长串吗?
会。Markdown 模式下文档里的图片会内嵌成 ![](data:image/png;base64,……),一张图就是几千到几万个字符挤在一行里,粘到支持 DataURL 的笔记软件里能正常显示,但 .md 文件会明显变大。不想要它有两个办法:转换前在 Word 里把图片删掉,或者转完后把以 ![](data: 开头的整行删掉,文字内容不受影响。只要纯文字就直接选「纯文本 .txt」,那种模式下图片会被忽略。
Word 转 TXT 提取不到文字、结果空白怎么办?
结果为空多半是扫描件或截图拼成的文档:页面上看着是字,文件里其实只有图片,没有可提取的文本层,本站不做 OCR,这类文档提不出文字,得先用识别工具转成可编辑文档。另外两种情况:文档加密或损坏时会提示「文档无法解析,可能已损坏或加密」,请先在 Word 里去掉打开密码另存一份再来;正文全写在文本框、艺术字里时提取结果也会偏少,把内容放回正文段落再转就正常了。

Word 转 TXT 和转 Markdown 分别保留什么内容

两种格式的取舍很直接:纯文本只留文字,Markdown 多留一层结构。下面这张表是拿同一份带标题、列表、表格、图片的 .docx 实际转出来的结果,选格式前扫一眼就知道自己会丢什么。

同一份 .docx 转纯文本与转 Markdown 的实际结果对照
文档里的元素纯文本 .txtMarkdown .md
标题 1 / 标题 2 样式只剩文字,层级看不出来转成 # 与 ##,层级保留
项目符号列表每条独立成行,符号丢失转成 -,子项缩进保留
有序列表每条独立成行,自动编号丢失转成 1. 2.
加粗 / 斜体全部丢失,只剩文字写成 **加粗**、_斜体_
超链接只剩锚文字,网址丢失写成 [锚文字](网址)
表格每个单元格一行,行列关系丢失表头变加粗行,其余单元格逐行排列
图片位置留空行,不输出内容内嵌成 ![](data:image/png;base64,…)
页眉 / 页脚不提取不提取

表格那一行值得单独说,很多人转完才发现:CSV 之外的纯文本没有「列」的概念,一张 3 列 × 3 行(含表头)的表格拆下来就是 9 行孤零零的文字,姓名、部门、电话三列串成一条竖线。Markdown 模式也不会把它还原成 md 表格。所以文档里表格是主角的话,与其在这里提取文字,不如把表格复制进 Excel 后用 Excel 转 Markdown 表格,行列关系才保得住。

Word 转 TXT、转 HTML 和转 Markdown 该怎么选

先看结果拿去干什么,再选格式:喂给程序、脚本、AI 提问框,用纯文本最省事;搬进 Obsidian、语雀、GitHub 这类支持 Markdown 的地方,选 .md;要贴到网页或邮件里、还想留住表格和图片,那已经超出「提取文字」的范围了。

反方向也有对应工具:手头是 .txt 想变成规规矩矩的 Word 文档,用 TXT 转 Word;写好的 Markdown 要交一份 docx,用 Markdown 转 Word;只想知道这份文档有多少字、多少段、大概读多久, 用 文档字数统计,同样是本地处理、文件不上传。