### 1. Kõige lihtsam test (soovitan alustada sellega) Kui sinu Tika on jooksev (docker-compose'iga), tee terminalis: ```bash # Kontrolli, kas server töötab curl -I http://localhost:9998/tika # Või täielik GET curl http://localhost:9998/tika ``` See peaks tagastama midagi sellist nagu `Apache Tika 2.x server`. ### 2. Faili tekstiekstraktsiooni test Loo lihtsalt testfail või kasuta olemasolevat (PDF, DOCX, pilt jne) ja proovi: ```bash # Teksti ekstraheerimine curl -T test.pdf http://localhost:9998/tika # Tekst plain text formaadis (puhtam) curl -T test.pdf http://localhost:9998/tika --header "Accept: text/plain" # Metaandmed (ilma tekstita) curl -T test.pdf http://localhost:9998/meta ``` **Näide pildiga (OCR test):** ```bash curl -T skaneeritud-pilt.jpg http://localhost:9998/tika ``` Kui kasutad `:latest-full` varianti, peaks OCR (Tesseract) automaatselt tööle minema skaneeritud dokumentide puhul. ### 3. Brauseriga kiire ülevaade Ava brauseris: - `http://localhost:9998/` → näitab kõiki võimalikke endpointe - `http://localhost:9998/parsers` → millised parserid on saadaval - `http://localhost:9998/mime-types` → toetatud failitüübid ### 4. Testimine konteineri seest (kui docker-compose käib) ```bash docker exec -it tika bash # Sees: curl -T /path/to/some/file.pdf http://localhost:9998/tika ``` ### Näpunäide OpenWebUI jaoks Kui tahad testida just seda, mida OpenWebUI kasutab, lae sinna üks keeruline PDF (skaneeritud või tabelitega) ja vaata, kas tekst tuleb korralikult välja pärast Tika seadistamist. ### Praktilisi näiteid ```bash cd ~/Downloads curl -X PUT -T Wang_et_al_AAP_Final_submitted1.pdf http://100.87.1.24:9998/rmeta/text curl -T Wang_et_al_AAP_Final_submitted1.pdf http://100.87.1.24:9998/tika --header "Accept: text/html" | pandoc -f html -t markdown -o fail.md # Lae alla java teek [Tika releases](https://dlcdn.apache.org/tika/) java -jar tika-app-3.3.0.jar --md Wang_et_al_AAP_Final_submitted1.pdf > fail.md ``` Siin on lihtne bash-loop, mis konverteerib kõik `.pdf` failid jooksvas kataloogis Markdowniks, kasutades sinu käsku. --- ### Lihtne üherealise ```bash for f in *.pdf; do java -jar ~/Downloads/tika-app-3.3.0.jar --md "$f" > "${f%.pdf}.md"; done ``` **Kuidas töötab:** - `for f in *.pdf` – võtab kõik pdf-failid - `"$f"` – sisendfail (jutumärgid kaitsevad tühikuid nimedes) - `"${f%.pdf}.md"` – asendab `.pdf` laiendi `.md`-ga --- ### Koos alamkataloogidega (rekursiivne) Kui pdf-id on alamkaustades, kasuta `find`: ```bash find . -name "*.pdf" -exec sh -c 'java -jar tika-app-3.3.0.jar --md "$1" > "${1%.pdf}.md"' _ {} \; ``` Või moodsamalt `**` (bash 4+ või zsh): ```bash shopt -s globstar # luba rekursiivne glob (bash) for f in **/*.pdf; do java -jar tika-app-3.3.0.jar --md "$f" > "${f%.pdf}.md"; done ``` --- ### Lisa: edenemislogi ja aja mõõtmine ```bash for f in *.pdf; do echo "Töötlen: $f" start=$(date +%s) java -jar tika-app-3.3.0.jar --md "$f" > "${f%.pdf}.md" end=$(date +%s) echo " Valmis (${end - start} sekundit)" done ``` --- ### Nõuanne Tika versiooni jaoks Kui kasutad alati sama jar-i väärtust, võid selle enne loopi muutujasse panna: ```bash TIKA_JAR=~/tika/tika-app-3.3.0.jar # või täpne tee for f in *.pdf; do java -jar "$TIKA_JAR" --md "$f" > "${f%.pdf}.md" done ``` Pane tähele, et `--md` võib olla mõnes versioonis ka `--format=markdown`. Kui sinu versioon ei tunne `--md`, proovi `--format markdown` või `--format=markdown`. ## PDF marker konverter ```bash # Mine ohmu serverisse cd /data/marker cat LOEMIND.md ```