从 PDF 中提取附件
Contents
[
Hide
]
Aspose.PDF for Java 支持多种提取流程,具体取决于附件在文档中的存储方式。
按名称提取单个附件
当您需要从 PDF 中保存某个特定的嵌入文件时,请使用此示例。
- 打开源 PDF Document。
- 遍历嵌入文件集合,直到找到所需的附件名称。
- 将附件流复制到输出文件,并在提取后停止。
public static void extractSingleAttachment(Path inputFile, String attachmentName, Path outputFile) throws Exception {
try (Document document = new Document(inputFile.toString())) {
System.out.println("Extracting attachment: " + attachmentName);
boolean attachmentFound = false;
for (FileSpecification fileSpecification : document.getEmbeddedFiles()) {
if (attachmentName.equals(fileSpecification.getName())) {
try (InputStream inputStream = fileSpecification.getContents();
OutputStream outputStream = Files.newOutputStream(outputFile)) {
inputStream.transferTo(outputStream);
}
System.out.println("Attachment extracted successfully");
attachmentFound = true;
break;
}
}
if (!attachmentFound) {
throw new IllegalArgumentException("Attachment '" + attachmentName + "' not found in PDF");
}
}
}
打印嵌入文件参数
此辅助方法打印存储在 FileParams 对象中的元数据。
- 检查文件参数对象是否存在。
- 读取可用的校验和、创建日期、修改日期和大小值。
- 将这些值打印到控制台。
public static void printFileParams(FileParams params) {
if (params != null) {
try {
System.out.println("CheckSum: " + params.getCheckSum());
} catch (Exception ex) {
System.out.println("CheckSum: null");
}
System.out.println("Creation Date: " + params.getCreationDate());
System.out.println("Modification Date: " + params.getModDate());
System.out.println("Size: " + params.getSize());
}
}
提取所有嵌入的附件
当需要将 PDF 中的每个嵌入文件写入输出目录时,请使用此示例。
- 打开源 PDF Document。
- 遍历嵌入文件集合,为每个项目确定一个安全的输出文件名。
- 打印元数据,保存每个附件流,并持续进行,直至所有文件导出完毕。
public static void extractAttachments(Path inputFile, Path outputDir) throws Exception {
try (Document document = new Document(inputFile.toString())) {
System.out.println("Total files: " + document.getEmbeddedFiles().size());
int fileIndex = 1;
for (FileSpecification fileSpecification : document.getEmbeddedFiles()) {
String fileName = fileSpecification.getName();
if (fileName == null || fileName.isBlank()) {
fileName = fileSpecification.getUnicodeName();
}
if (fileName == null || fileName.isBlank()) {
fileName = "attachment_" + fileIndex + ".bin";
}
System.out.println("Name: " + fileName);
System.out.println("Description: " + fileSpecification.getDescription());
System.out.println("Mime Type: " + fileSpecification.getMIMEType());
printFileParams(fileSpecification.getParams());
Path outputPath = outputDir.resolve(fileName);
try (InputStream inputStream = fileSpecification.getContents();
OutputStream outputStream = Files.newOutputStream(outputPath)) {
inputStream.transferTo(outputStream);
}
fileIndex++;
}
}
}
提取文件附件注释
当文件通过页面注释而不是仅通过嵌入文件集合附加时,请使用此示例。
- 打开源 PDF Document。
- 在页面上定位第一个 FileAttachmentAnnotation。
- 读取其文件规范,导出内容,并打印目标路径。
public static void extractFileAttachmentAnnotation(Path inputFile, Path outputDir) throws Exception {
try (Document document = new Document(inputFile.toString())) {
FileAttachmentAnnotation fileAttachment = null;
for (Annotation annotation : document.getPages().get_Item(1).getAnnotations()) {
if (annotation.getAnnotationType() == AnnotationType.FileAttachment) {
fileAttachment = (FileAttachmentAnnotation) annotation;
break;
}
}
if (fileAttachment == null) {
System.out.println("File attachment annotation not found.");
return;
}
FileSpecification fileSpecification = fileAttachment.getFile();
System.out.println("File name: " + fileSpecification.getName());
Path outputPath = outputDir.resolve("extracted-" + fileSpecification.getName());
try (InputStream inputStream = fileSpecification.getContents();
OutputStream outputStream = Files.newOutputStream(outputPath)) {
inputStream.transferTo(outputStream);
}
System.out.println("Extracted to: " + outputPath);
}
}