This is an automated email from the ASF dual-hosted git repository.

asf-gitbox-commits pushed a commit to branch branch_3x
in repository https://gitbox.apache.org/repos/asf/tika.git


The following commit(s) were added to refs/heads/branch_3x by this push:
     new d6aa80340c TIKA-4811: Add null check (#2999)
d6aa80340c is described below

commit d6aa80340c13f8d42dafd33468644660bf79ef66
Author: L3odr0id <[email protected]>
AuthorDate: Mon Aug 10 15:26:57 2026 +0300

    TIKA-4811: Add null check (#2999)
---
 .../src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java    | 3 ++-
 1 file changed, 2 insertions(+), 1 deletion(-)

diff --git 
a/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
 
b/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
index 12c7e58a90..6037756e84 100644
--- 
a/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
+++ 
b/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
@@ -540,7 +540,8 @@ class AbstractPDF2XHTML extends PDFTextStripper {
             c.increment();
         }
         MediaType ocrImageMediaType = MediaType.image("ocr-" + 
config.getOcrImageFormatName());
-        if (!ocrParser.getSupportedTypes(context).contains(ocrImageMediaType)) 
{
+        Set<MediaType> supportedTypes = ocrParser.getSupportedTypes(context);
+        if (supportedTypes == null || 
!supportedTypes.contains(ocrImageMediaType)) {
             if (ocrStrategy == OCR_ONLY || ocrStrategy == 
OCR_AND_TEXT_EXTRACTION) {
                 throw new TikaException(
                         "" + "I regret that I couldn't find an OCR parser to 
handle " +

Reply via email to