演題番号 | 3F3-5 |
---|---|
題目 | ウェブページ内の階層構造を考慮した本文抽出技術 |
著者 | 藤田 尚樹(日本電信電話株式会社 NTTサイバーソリューション研究所) 安田 宜仁(日本電信電話株式会社 NTTサイバーソリューション研究所) 片渕 典史(日本電信電話株式会社 NTTサイバーソリューション研究所) 片岡 良治(日本電信電話株式会社 NTTサイバーソリューション研究所) |
時間 | 06月03日(Fri) 14:00〜14:20 |
概要 | ウェブページは広告などページの主題以外の情報を含み,それらは例えば検索エンジンの検索精度低下を引き起こす。そのため本文抽出技術は重要視されている.本稿ではHTML中で本文(主題が記述されている部分)は1つもしくは複数のノード配下の全てのノードとして抽出できるという仮説のもと,CRFを用いた本文判定結果を階層構造を考慮して上位ノードの結果と下位ノードの結果の多数決で再判定する手法を提案する. |
論文 | PDFファイル |