Kui sinu Tika on jooksev (docker-compose'iga), tee terminalis:
# Kontrolli, kas server töötab
curl -I http://localhost:9998/tika
# Või täielik GET
curl http://localhost:9998/tika
See peaks tagastama midagi sellist nagu Apache Tika 2.x server.
Loo lihtsalt testfail või kasuta olemasolevat (PDF, DOCX, pilt jne) ja proovi:
# Teksti ekstraheerimine
curl -T test.pdf http://localhost:9998/tika
# Tekst plain text formaadis (puhtam)
curl -T test.pdf http://localhost:9998/tika --header "Accept: text/plain"
# Metaandmed (ilma tekstita)
curl -T test.pdf http://localhost:9998/meta
Näide pildiga (OCR test):
curl -T skaneeritud-pilt.jpg http://localhost:9998/tika
Kui kasutad :latest-full varianti, peaks OCR (Tesseract) automaatselt tööle minema skaneeritud dokumentide puhul.
Ava brauseris:
http://localhost:9998/ → näitab kõiki võimalikke endpointehttp://localhost:9998/parsers → millised parserid on saadavalhttp://localhost:9998/mime-types → toetatud failitüübiddocker exec -it tika bash
# Sees:
curl -T /path/to/some/file.pdf http://localhost:9998/tika
Kui tahad testida just seda, mida OpenWebUI kasutab, lae sinna üks keeruline PDF (skaneeritud või tabelitega) ja vaata, kas tekst tuleb korralikult välja pärast Tika seadistamist.
cd ~/Downloads
curl -X PUT -T Wang_et_al_AAP_Final_submitted1.pdf http://100.87.1.24:9998/rmeta/text
curl -T Wang_et_al_AAP_Final_submitted1.pdf http://100.87.1.24:9998/tika --header "Accept: text/html" | pandoc -f html -t markdown -o fail.md
# Lae alla java teek [Tika releases](https://dlcdn.apache.org/tika/)
java -jar tika-app-3.3.0.jar --md Wang_et_al_AAP_Final_submitted1.pdf > fail.md
Siin on lihtne bash-loop, mis konverteerib kõik .pdf failid jooksvas kataloogis Markdowniks, kasutades sinu käsku.
for f in *.pdf; do java -jar ~/Downloads/tika-app-3.3.0.jar --md "$f" > "${f%.pdf}.md"; done
Kuidas töötab:
for f in *.pdf – võtab kõik pdf-failid"$f" – sisendfail (jutumärgid kaitsevad tühikuid nimedes)"${f%.pdf}.md" – asendab .pdf laiendi .md-gaKui pdf-id on alamkaustades, kasuta find:
find . -name "*.pdf" -exec sh -c 'java -jar tika-app-3.3.0.jar --md "$1" > "${1%.pdf}.md"' _ {} \;
Või moodsamalt ** (bash 4+ või zsh):
shopt -s globstar # luba rekursiivne glob (bash)
for f in **/*.pdf; do java -jar tika-app-3.3.0.jar --md "$f" > "${f%.pdf}.md"; done
for f in *.pdf; do
echo "Töötlen: $f"
start=$(date +%s)
java -jar tika-app-3.3.0.jar --md "$f" > "${f%.pdf}.md"
end=$(date +%s)
echo " Valmis (${end - start} sekundit)"
done
Kui kasutad alati sama jar-i väärtust, võid selle enne loopi muutujasse panna:
TIKA_JAR=~/tika/tika-app-3.3.0.jar # või täpne tee
for f in *.pdf; do
java -jar "$TIKA_JAR" --md "$f" > "${f%.pdf}.md"
done
Pane tähele, et --md võib olla mõnes versioonis ka --format=markdown. Kui sinu versioon ei tunne --md, proovi --format markdown või --format=markdown.
# Mine ohmu serverisse
cd /data/marker
cat LOEMIND.md