在 Java 中从 PDF 提取表格

当需要检测现有 PDF 中的表格结构并读取其内容时,使用 TableAbsorber。

提取检测到的表格文本

当您需要在每页定位表格并收集其单元格文本时,请使用此示例。

  1. 打开源 PDF Document。
  2. 使用…访问每页 TableAbsorber。
  3. 遍历已吸收的表格、行和单元格,然后输出提取的文本。
public static void extract(Path inputFile) {
    try (Document document = new Document(inputFile.toString())) {
        for (Page page : document.getPages()) {
            TableAbsorber absorber = new TableAbsorber();
            absorber.visit(page);
            for (AbsorbedTable table : absorber.getTableList()) {
                System.out.println("Table ----");
                for (AbsorbedRow row : table.getRowList()) {
                    System.out.println("Row:");
                    StringBuilder rowText = new StringBuilder();
                    for (AbsorbedCell cell : row.getCellList()) {
                        StringBuilder cellText = new StringBuilder();
                        for (TextFragment fragment : cell.getTextFragments()) {
                            for (TextSegment segment : fragment.getSegments()) {
                                cellText.append(segment.getText());
                            }
                        }
                        rowText.append(" | ").append(cellText);
                    }
                    System.out.println(rowText);
                }
            }
        }
    }
}