Перейти к содержимому

программный доступ к содержанию PDF

1

Многие документы PDF содержат иерархическое оглавление. Я не имею в виду ToC, видимый на странице - я имею в виду метаданные, которые используются для создания ссылок на боковую панель при просмотре PDF с помощью приложения, такого как Preview. Как я могу извлечь это? Я не ищу приложение с графическим интерфейсом, так как собираюсь извлекать эту информацию из многих документов с помощью скрипта.

730 просмотров
Sean Mackesey спросил 11 лет назад
S 245

1 ответ

0

The python package pdfminer is able to extract this information. Use the dumppdf.py script that comes with the package.

dumppdf.py -T /path/to/my/PDF 

Produces XML of the table of contents.

NOTE: Credit @krowe for linking the source of this answer in the comments.

Sean Mackesey ответил 11 лет назад
S 245