[
https://issues.apache.org/jira/browse/TIKA-4891?page=com.atlassian.jira.plugin.system.issuetabpanels:comment-tabpanel&focusedCommentId=18115373#comment-18115373
]
Hudson commented on TIKA-4891:
------------------------------
SUCCESS: Integrated in Jenkins build Tika » tika-main-jdk17 #1637 (See
[https://ci-builds.apache.org/job/Tika/job/tika-main-jdk17/1637/])
TIKA-4891: rebuild PDF structure-tag extraction on the text stripper … (#3161)
(github:
[https://github.com/apache/tika/commit/00e7382a2644b1e93fa80ccd936842a68290955e])
* (edit) CHANGES.txt
* (edit)
tika-server/tika-server-standard/src/test/java/org/apache/tika/server/standard/TikaPipesTest.java
* (edit)
docs/modules/ROOT/pages/advanced/integration-testing/tika-eval-regression.adoc
* (edit)
tika-server/tika-server-standard/src/test/resources/configs/tika-config-for-server-tests.json
* (edit) tika-eval/pom.xml
* (edit)
tika-metadata-schema/src/main/resources/org/apache/tika/metadata/metadata-keys.json
* (add)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/test/java/org/apache/tika/parser/pdf/TaggedPdfBuilder.java
* (edit)
tika-server/tika-server-standard/src/test/java/org/apache/tika/server/standard/TikaResourceTest.java
* (add)
tika-eval/tika-eval-structure/src/test/resources/extracts-a/only-in-a.pdf.json
* (add)
tika-eval/tika-eval-structure/src/main/java/org/apache/tika/eval/structure/SummaryWriter.java
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/test/java/org/apache/tika/parser/pdf/PDFParserTest.java
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/PDFParser.java
* (add) tika-eval/tika-eval-structure/pom.xml
* (add)
tika-eval/tika-eval-structure/src/main/java/org/apache/tika/eval/structure/Block.java
* (edit) docs/modules/ROOT/pages/configuration/parsers/pdf-parser.adoc
* (add)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/test/java/org/apache/tika/parser/pdf/PDFMarkedContentIdentityTest.java
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/test/java/org/apache/tika/parser/pdf/PDFMarkedContent2XHTMLTest.java
* (add)
tika-eval/tika-eval-structure/src/main/java/org/apache/tika/eval/structure/StructureCompareCLI.java
* (add) tika-eval/tika-eval-structure/src/test/resources/extracts-a/doc.pdf.json
* (add)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/test/java/org/apache/tika/parser/pdf/StructureIndexTest.java
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/test/resources/org/apache/tika/parser/pdf/tika-config.json
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/PDFMarkedContent2XHTML.java
* (add)
tika-eval/tika-eval-structure/src/main/java/org/apache/tika/eval/structure/BlockMatcher.java
* (add) tika-eval/tika-eval-structure/src/main/assembly/assembly.xml
* (add)
tika-eval/tika-eval-structure/src/main/java/org/apache/tika/eval/structure/BlockExtractor.java
* (edit)
tika-metadata-schema/src/main/resources/org/apache/tika/metadata/metadata-key-fields.json
* (add)
tika-eval/tika-eval-structure/src/main/java/org/apache/tika/eval/structure/StructureScores.java
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/PDFParserConfig.java
* (add)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/test/java/org/apache/tika/parser/pdf/PDFMarkedContentGateTest.java
* (add)
tika-eval/tika-eval-structure/src/test/java/org/apache/tika/eval/structure/StructureCompareCLITest.java
* (add) tika-eval/tika-eval-structure/src/test/resources/extracts-b/doc.pdf.json
* (add)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/StructureIndex.java
* (add)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/MarkedContentConfig.java
* (add)
tika-eval/tika-eval-structure/src/test/java/org/apache/tika/eval/structure/BlockExtractorTest.java
* (edit) tika-core/src/main/java/org/apache/tika/metadata/PDF.java
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-integration-tests/src/test/resources/config-examples/pdf-parser-full.json
* (add)
tika-eval/tika-eval-structure/src/test/java/org/apache/tika/eval/structure/StructureScoresTest.java
> Improve handling of PDF/UA structural tags/marked content
> ---------------------------------------------------------
>
> Key: TIKA-4891
> URL: https://issues.apache.org/jira/browse/TIKA-4891
> Project: Tika
> Issue Type: Task
> Reporter: Tim Allison
> Priority: Major
> Attachments: 1008690.pdf, TIKA-4891-1008690.html,
> image-2026-09-13-10-54-59-251.png, screenshot-1.png, screenshot-2.png
>
>
> PDF/UA includes structural markup. We hacked out a standalone handler for
> this back in 1.x but haven't touched it in years.
>
> We should modernize our handling of structural tags and eventually consider
> turning that on by default. That decision will be based on evaluation on
> 1000s of PDFs. This is not a default switch to be taken lightly.
--
This message was sent by Atlassian Jira
(v8.20.10#820010)