欢迎来到山村网

把Word转为简洁的html的若干种方法

2019-03-28 23:29:43浏览:258 来源:山村网   
核心摘要:word可以直接另存为 htm,但即使是 另存为 html 也会有大量的废代码。以前我一般用 dreamweaver 的 clean up html 来处理,先处

word可以直接另存为 htm,但即使是 另存为 html 也会有大量的废代码。以前我一般用 dreamweaver 的 clean up html 来处理,先处理 word 特有标签,然后删除一些 font,b,span 等。进一步,在 editplus 里面用正则进行处理,最后得到我想要的干净的html 代码。当然最完美的办法就是拷贝文字出来,自己用文本编辑器书写htm标签,:)

  今天又看到lifehacker这几种word 2 clean htm方法:

  1.使用这个HTML Tidy Library Project开源软件来处理。

  2.微软官方站点也有个Office 2000 HTML Filter 2.0工具,可以用来处理掉word2000转html时出现的多余代码。

  3.使用这个Word HTML Cleaner 在线工具来处理。只能处理word2000以下版本。

  4.有人给出了正则表达式(其实,上面的各种软件也都是用正则来解决的)

  删除不需要的标签

  <[/]?(font|span|xml|[ovwxp]:w+)[^>]*?>
- replace any matches with the empty string

  删除class,style...等不需要的属性

  <([^>]*)(?:class|lang|style|size|face|[ovwxp]:w+)=(?:'[^']*'|""[^""]*""|[^>]+)([^>]*)>
- replace any matches with <$1$2>

  详细解释在Clean Word HTML using Regular expressions

(责任编辑:豆豆)
下一篇:

用ASP.NET AJAX框架扩展HTML Map控件

上一篇:

为什么要使用html的meta标签?

  • 信息二维码

    手机看新闻

  • 分享到
打赏
免责声明
• 
本文仅代表作者个人观点,本站未对其内容进行核实,请读者仅做参考,如若文中涉及有违公德、触犯法律的内容,一经发现,立即删除,作者需自行承担相应责任。涉及到版权或其他问题,请及时联系我们 xfptx@outlook.com