Tika server.md 3.5 KB

1. Kõige lihtsam test (soovitan alustada sellega)

Kui sinu Tika on jooksev (docker-compose'iga), tee terminalis:

# Kontrolli, kas server töötab
curl -I http://localhost:9998/tika

# Või täielik GET
curl http://localhost:9998/tika

See peaks tagastama midagi sellist nagu Apache Tika 2.x server.

2. Faili tekstiekstraktsiooni test

Loo lihtsalt testfail või kasuta olemasolevat (PDF, DOCX, pilt jne) ja proovi:

# Teksti ekstraheerimine
curl -T test.pdf http://localhost:9998/tika

# Tekst plain text formaadis (puhtam)
curl -T test.pdf http://localhost:9998/tika --header "Accept: text/plain"

# Metaandmed (ilma tekstita)
curl -T test.pdf http://localhost:9998/meta

Näide pildiga (OCR test):

curl -T skaneeritud-pilt.jpg http://localhost:9998/tika

Kui kasutad :latest-full varianti, peaks OCR (Tesseract) automaatselt tööle minema skaneeritud dokumentide puhul.

3. Brauseriga kiire ülevaade

Ava brauseris:

  • http://localhost:9998/ → näitab kõiki võimalikke endpointe
  • http://localhost:9998/parsers → millised parserid on saadaval
  • http://localhost:9998/mime-types → toetatud failitüübid

4. Testimine konteineri seest (kui docker-compose käib)

docker exec -it tika bash

# Sees:
curl -T /path/to/some/file.pdf http://localhost:9998/tika

Näpunäide OpenWebUI jaoks

Kui tahad testida just seda, mida OpenWebUI kasutab, lae sinna üks keeruline PDF (skaneeritud või tabelitega) ja vaata, kas tekst tuleb korralikult välja pärast Tika seadistamist.

Praktilisi näiteid

cd ~/Downloads
curl -X PUT -T Wang_et_al_AAP_Final_submitted1.pdf http://100.87.1.24:9998/rmeta/text

curl -T Wang_et_al_AAP_Final_submitted1.pdf http://100.87.1.24:9998/tika --header "Accept: text/html" | pandoc -f html -t markdown -o fail.md

# Lae alla java teek [Tika releases](https://dlcdn.apache.org/tika/)
java -jar tika-app-3.3.0.jar --md Wang_et_al_AAP_Final_submitted1.pdf > fail.md

Siin on lihtne bash-loop, mis konverteerib kõik .pdf failid jooksvas kataloogis Markdowniks, kasutades sinu käsku.


Lihtne üherealise

for f in *.pdf; do java -jar ~/Downloads/tika-app-3.3.0.jar --md "$f" > "${f%.pdf}.md"; done

Kuidas töötab:

  • for f in *.pdf – võtab kõik pdf-failid
  • "$f" – sisendfail (jutumärgid kaitsevad tühikuid nimedes)
  • "${f%.pdf}.md" – asendab .pdf laiendi .md-ga

Koos alamkataloogidega (rekursiivne)

Kui pdf-id on alamkaustades, kasuta find:

find . -name "*.pdf" -exec sh -c 'java -jar tika-app-3.3.0.jar --md "$1" > "${1%.pdf}.md"' _ {} \;

Või moodsamalt ** (bash 4+ või zsh):

shopt -s globstar  # luba rekursiivne glob (bash)
for f in **/*.pdf; do java -jar tika-app-3.3.0.jar --md "$f" > "${f%.pdf}.md"; done

Lisa: edenemislogi ja aja mõõtmine

for f in *.pdf; do
    echo "Töötlen: $f"
    start=$(date +%s)
    java -jar tika-app-3.3.0.jar --md "$f" > "${f%.pdf}.md"
    end=$(date +%s)
    echo "  Valmis (${end - start} sekundit)"
done

Nõuanne Tika versiooni jaoks

Kui kasutad alati sama jar-i väärtust, võid selle enne loopi muutujasse panna:

TIKA_JAR=~/tika/tika-app-3.3.0.jar   # või täpne tee
for f in *.pdf; do
    java -jar "$TIKA_JAR" --md "$f" > "${f%.pdf}.md"
done

Pane tähele, et --md võib olla mõnes versioonis ka --format=markdown. Kui sinu versioon ei tunne --md, proovi --format markdown või --format=markdown.

PDF marker konverter

# Mine ohmu serverisse
cd /data/marker
cat LOEMIND.md