在 Java 中从 PDF 提取表格
Contents
[
Hide
]
当需要检测现有 PDF 中的表格结构并读取其内容时,使用 TableAbsorber。
提取检测到的表格文本
当您需要在每页定位表格并收集其单元格文本时,请使用此示例。
- 打开源 PDF Document。
- 使用…访问每页 TableAbsorber。
- 遍历已吸收的表格、行和单元格,然后输出提取的文本。
public static void extract(Path inputFile) {
try (Document document = new Document(inputFile.toString())) {
for (Page page : document.getPages()) {
TableAbsorber absorber = new TableAbsorber();
absorber.visit(page);
for (AbsorbedTable table : absorber.getTableList()) {
System.out.println("Table ----");
for (AbsorbedRow row : table.getRowList()) {
System.out.println("Row:");
StringBuilder rowText = new StringBuilder();
for (AbsorbedCell cell : row.getCellList()) {
StringBuilder cellText = new StringBuilder();
for (TextFragment fragment : cell.getTextFragments()) {
for (TextSegment segment : fragment.getSegments()) {
cellText.append(segment.getText());
}
}
rowText.append(" | ").append(cellText);
}
System.out.println(rowText);
}
}
}
}
}