HTMLからプレーンテキスト
HTMLを解析しbody内text nodeの内容をplain textとして抽出します。
使い方
- 変換するHTMLを入力して実行します。
主な機能と処理範囲
現在実装はremove-html-tagsと同じDOMParser+body.textContent経路ですがHTML→text用途の画面です。
処理の仕組み
text/html Documentをparseしbody.textContentを結果にします。
例
<h1>Title</h1><p>Body</p>はDOM text内容を連結した結果になります。
こんな場面で便利
- HTML sourceから表示textを取り出すとき
利用前の確認
- CSS layout・link URL・image情報は構造化保存しません。
よくある質問
link先URLも付きますか?
いいえ。anchor表示textは残りますがhrefは抽出しません。