Tika是一個內容抽取的工具集合(a toolkit for text extracting)。它集成了POI, Pdfbox 并且為文本抽取工作提供了一個統一的界面。其次,Tika也提供了便利的擴展API,用來豐富其對第三方文件格式的支持。
Tika提供了對如下文件格式的支持:
* PDF - 通過Pdfbox
* MS-* - 通過POI
* HTML - 使用nekohtml將不規范的html整理成為xhtml
* OpenOffice 格式 - Tika提供
* Archive - zip, tar, gzip, bzip等
* RTF - Tika提供
* Java class - Class解析由ASM完成
* Image - 只支持圖像的元數據抽取
* XML
您的評論需要經過審核才能顯示
有用
有用
有用