Word 转 HTML

Word 转 HTML,是指把 .docx 文档转成能直接贴进网页的 HTML 代码:标题变成 h1、h2,项目符号变成 ul、li,表格变成 table 并带上合并单元格的 colspan,加粗、斜体、超链接都留着。拖入文件即在浏览器本地用 mammoth 解析,输出可选「片段」嵌进现有页面,或「完整文档」带 charset、双击就能打开;图片可内联成 base64 让 HTML 自包含,也可丢弃换更小体积。结果分预览和源码两个视图,能复制也能下载 .html,输出前统一消毒去掉脚本类内容。文件不上传服务器,免费不注册;仅支持 .docx。

拖入 Word 文件(.docx),点击选择
文件不上传 · 浏览器本地解析 · 仅支持 .docx · 单文件 ≤ 100MB

🔒 文档在你的浏览器内用 mammoth 解析,未上传任何服务器。输出 HTML 已经 DOMPurify 消毒、预览在沙箱中运行。保留标题/列表/表格/加粗等基础格式,复杂版式与浮动图形可能丢失。

如何使用Word 转 HTML

1

拖入 .docx 文件或点击选择。解析全程在你的浏览器里完成、文件不上传;旧版 .doc 会按文件头认出来并提示先另存为 .docx,其他扩展名直接拒收、不读进内存。

2

选参数:输出形态选「片段」只给 body 内容、方便嵌进现有页面,选「完整文档」会补上 doctype、charset 与一份基础样式,存下来双击就能用浏览器打开;图片选「内联」转成 base64 写进 img 标签、HTML 自包含,选「忽略」则不生成 img、产物小很多;勾上「美化代码」会按标签缩进换行,便于手工再改。

3

点「转为 HTML」,结果区在「预览」和「HTML 源码」之间切换——预览跑在沙箱 iframe 里,源码按钮上标着字符数。确认无误后点「复制源码」贴进编辑器,或「下载 .html」保存,文件名沿用原文档名。

关于Word 转 HTML的常见问题

Word 转 HTML 会把文档上传到服务器吗?
不会。.docx 的解包和转换都由浏览器里的 JavaScript(mammoth)在你的设备上跑完,页面不会把文档内容发往任何服务器,也不写入本地存储,关掉或刷新页面就全部清除,合同、标书、内部资料都可以放心转。想自己验证:按 F12 打开开发者工具的「网络」面板,再点一次「转为 HTML」——你只会看到第一次点击时下载解析内核那几个 JS 代码块(之后走缓存),没有任何上传请求。
Word 转 HTML 怎么保留表格和合并单元格?
表格会转成标准的 table、tr、td 标签,Word 里合并过的单元格会带上 colspan、rowspan 属性,行列关系和原文一致;如果这张表在 Word 里勾了「在各页顶端以标题行形式重复出现」,表头还会输出成 thead 与 th。要留意的是标签里不带任何边框样式:选「完整文档」时附的基础 CSS 会给表格画上细线,选「片段」贴进自己的页面就得用你站点的表格样式,否则看到的是一张没有框线的裸表。
Word 转 HTML 内联图片后文件会变多大?
大约是图片原体积的 1.33 倍。base64 用 4 个字符表示 3 个字节,膨胀约 33%:一张 1MB 的 PNG 内联后是约 140 万个字符、1.33MB 的文本,三张这样的图就能把一份 HTML 撑到 4MB 以上,粘进编辑器会明显卡顿。所以图片多、又要发进 CMS 或公众号时,建议选「忽略图片」拿干净的文字与表格结构,图片另外上传再插回去;只有做离线单文件存档、要求 HTML 自包含时才值得内联。
Word 转 HTML 后标题没变成 h1 是怎么回事?
多半是文档里用的「假标题」。转换按 Word 的段落样式判断层级:套了「标题 1」「标题 2」样式的段落才会输出 h1、h2;靠手动放大字号加粗做出来的标题,在文件里只是普通段落,转出来就是 p 套 strong,网页大纲自然是空的。回到 Word 选中这些行,在「开始」选项卡的样式库里点一下对应的标题样式,再来本页重转即可。搜索引擎读的正是 h1、h2 这层结构,稿子要发到网站上的话这步别省。
旧版 .doc 怎么转成 HTML 网页代码?
先在 Word 或 WPS 里把它另存为 .docx,再回本页转换。差别在格式本身:.docx 其实是个 zip 包,里面装的是 XML,浏览器解得开;旧版 .doc 是 OLE2 二进制复合文档,纯前端拆不动,所以工具读到文件开头的 D0 CF 11 E0 这几个字节就会直接提示,不会硬转出一堆乱码。另一条路是在 Word 里直接「另存为网页」,但那样导出的 HTML 会塞满 mso- 开头的私有样式和成段 XML 注释,代码量能翻好几倍,贴进网站前还得手工清理,远不如转成 .docx 后在本页拿到的标签干净。
Word 转 HTML 中文乱码怎么解决?
选「完整文档」下载的 .html 头部带 meta charset=utf-8,文件本身也是 UTF-8 存的,浏览器打开中文正常。乱码基本都出在「片段」这条路上:只取 body 内容贴进别人的页面时,用什么编码解读由那个页面的 charset 决定,如果对方还声明着 gbk 或 gb2312,中文就会变成问号和方块——把目标页面的 charset 改成 utf-8 即可,光改文件编码没用。还有一种常见情况与本工具无关:Word 自带的「另存为网页」导出的文件多为 GBK 编码,搬到 UTF-8 的站点上同样会乱码。
手机上怎么把 Word 转成 HTML 并下载?
用手机浏览器(iOS Safari、安卓 Chrome、微信内置浏览器都行)打开本页,点选择文件,从「文件」App 或聊天记录里挑出 .docx,转换同样在手机本地完成,不用装 Word 或 WPS。结果可以直接点「复制源码」粘到备忘录或聊天窗口。两个提醒:微信里收到的文档要先「用其他应用打开 → 保存到文件」,再回本页选择;手机内存小,图片多的文档建议先把图片处理切到「忽略」,免得内联 base64 把内存占满。
Word 转 HTML 出来的代码能直接放进网站吗?
能,「片段」模式就是为这个准备的——输出是干净的 h1、p、ul、table 等语义标签,不带 class 和内联 style,不会和你站点的 CSS 打架,粘进 CMS 的源码模式或模板文件即可。通常还要补三件事:给表格、图片配上你自己的样式(片段不含任何 CSS);按站点规范决定正文里保不保留 h1,很多 CMS 的文章标题已经占了 h1;图片若内联成了 base64,换回正常图片地址更利于加载。贴之前先在「预览」里看一眼排版,比直接发布省事。
Word 转 HTML 提示已移除不安全内容是什么意思?
那是输出前的一道消毒工序。生成的 HTML 会先过一遍 DOMPurify,脚本、事件属性、javascript: 开头的链接会被剥掉,预览也放在沙箱 iframe 里跑,所以拿到的代码可以放心往页面里贴。绝大多数文档这个计数是 0;真触发多半是文档里存着 javascript: 之类的异常超链接,常见于从网页上整块复制进 Word 的内容。被移除的只是这类可执行内容,正文文字、表格和图片都不受影响。
Word 转 HTML 免费吗?对文件大小有限制吗?
免费、不注册、不加水印,也不限次数。大小上页面提示单文件不超过 100MB,实际能不能转还取决于设备内存——文档要整份读进内存解析,再生成一份 HTML 字符串。日常几十页的稿子基本是点完就出结果;真正吃内存的是内嵌大量高清图片的文档,选「内联」还会额外产出约 1.33 倍体积的 base64 文本,这种文档建议改选「忽略图片」,或者放到电脑上转。

Word 转 HTML 保留哪些格式、哪些会丢失

一句话分界:有语义的结构留得住,纯外观的装饰留不住。下面这张表是拿一份带标题、多级列表、合并单元格表格和插图的 .docx 实际转出来的结果,转之前扫一眼就知道自己会丢什么、要在网页那头补什么。

一份 .docx 转 HTML 后各类元素的实际去向
Word 里的元素转出的 HTML说明
标题 1 / 标题 2 样式h1 / h2 …… 到 h6必须真的套了标题样式,手动放大加粗的不算
项目符号列表ul > li多级缩进按层级嵌套,子列表照旧
编号列表ol > li编号交给浏览器生成,不写死数字
加粗 / 斜体strong / em字号、颜色不跟着走
超链接a href锚文字与网址都在;javascript: 链接会被消毒剥掉
表格table / tr / td合并单元格带 colspan、rowspan;重复标题行输出 thead 与 th
内嵌图片img src="data:image/png;base64,…"选「忽略」则整个 img 标签都不生成
脚注 / 尾注文末的 p 与跳转链接正文里的引用记号会转成锚点
字体、字号、颜色、居中不输出片段里没有 class 和 style,观感由你的页面 CSS 决定
文本框、艺术字、分栏不输出或位置错位浮动元素没有对应的 HTML 语义
页眉、页脚、批注不输出属于版式信息,网页里没有对应概念
公式(OMML)不输出要保留公式建议截图,或另存 PDF

最容易翻车的是第一行。把 Word 稿子搬上网站这件事,成败往往不在图片和表格,而在标题样式:编辑手动调字号做出来的「标题」,转出来全是普通段落,网页只剩一堆 p,正文大纲是空的,搜索引擎也读不出层级。与其转完在 HTML 里手工加 h2,不如回 Word 花一分钟把标题样式套对,再重转一次。

Word 转 HTML 选片段还是完整文档、图片要不要内联

两个选项按「结果拿去哪儿用」来定:要塞进已有页面就选片段,要单独存一份能双击打开的文件就选完整文档;图片则看你更在意自包含还是体积。

内联前先估个体积,别等编辑器卡住才发现问题:base64 每 3 个字节编成 4 个字符,一张 1MB 的图会变成约 1.33MB 的文本躺在 HTML 里。

内联图片后的体积估算
base64 字符数 ≈ 原图字节数 ÷ 3 × 4(约 +33%);1MB 图片 ≈ 1,398,104 个字符 ≈ 1.33MB

同一份 Word 还有别的去处:只要正文文字或想搬进笔记软件,用 Word 转 TXT/Markdown;本页转出的 HTML 想再变成 md,接着用 HTML 转 Markdown;反过来手上是 Markdown 要出网页,用 Markdown 转 HTML;只想知道这份文档多少字、大概读多久,用 文档字数统计。这些同样在浏览器本地完成、文件不上传。