This is an automated email from the ASF dual-hosted git repository.
asf-gitbox-commits pushed a commit to branch branch_2x
in repository https://gitbox.apache.org/repos/asf/tika.git
The following commit(s) were added to refs/heads/branch_2x by this push:
new 193f2c4aa3 TIKA-4811: Add null check (#2999)
193f2c4aa3 is described below
commit 193f2c4aa33307e5f602f16ee5418cfb39937bed
Author: L3odr0id <[email protected]>
AuthorDate: Mon Aug 10 15:26:57 2026 +0300
TIKA-4811: Add null check (#2999)
---
.../src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java | 3 ++-
1 file changed, 2 insertions(+), 1 deletion(-)
diff --git
a/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
b/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
index 3b7d31380f..49c37d0d52 100644
---
a/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
+++
b/tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-pdf-module/src/main/java/org/apache/tika/parser/pdf/AbstractPDF2XHTML.java
@@ -536,7 +536,8 @@ class AbstractPDF2XHTML extends PDFTextStripper {
return;
}
MediaType ocrImageMediaType = MediaType.image("ocr-" +
config.getOcrImageFormatName());
- if (!ocrParser.getSupportedTypes(context).contains(ocrImageMediaType))
{
+ Set<MediaType> supportedTypes = ocrParser.getSupportedTypes(context);
+ if (supportedTypes == null ||
!supportedTypes.contains(ocrImageMediaType)) {
if (ocrStrategy == OCR_ONLY || ocrStrategy ==
OCR_AND_TEXT_EXTRACTION) {
throw new TikaException(
"" + "I regret that I couldn't find an OCR parser to
handle " +