Dokumentit
Demokäyttäjä
Käyttäjät
Lisää uusi käyttäjä
Lisää uusi dokumentti
Miten muodostan chunks.json-tiedoston?
Ennen kuin voit lisätä uuden käsikirjan yllä olevalla lomakkeella, sen PDF pitää ensin käsitellä omalla koneellasi — tämä vaihe ei tapahdu automaattisesti selaimessa (katso syy alta).
- Hae käsikirjan PDF-tiedosto (esim. Ladatut-kansiosta)
-
Avaa Resurssienhallinnassa kansio
C:\Users\marko\.claude\code-projects\seal-oravanpyora\source\ - Raahaa PDF-tiedosto kansiossa olevan
make_chunks.bat-tiedoston päälle - Musta komentoikkuna avautuu hetkeksi ja käsittelee tiedoston — odota kunnes se sanoo "Valmis" ja paina sitten mitä tahansa näppäintä
- Samaan kansioon ilmestyy uusi tiedosto
<PDF:n nimi>-chunks.json - Jos komentoikkuna näyttää WARNING-rivin, se kertoo mitkä sivut jäivät lähes tyhjiksi tekstinpoiminnassa (usein kansi-/takakansisivuja, ei yleensä syytä huoleen) — tarkista silti tarvittaessa
- Lataa molemmat tiedostot (alkuperäinen PDF + juuri syntynyt chunks.json) yllä olevalla "Lisää uusi dokumentti" -lomakkeella
Miksi tätä ei voi tehdä kokonaan automaattisesti täällä sivustolla?
Tekstinpoiminta PDF:stä voitaisiin periaatteessa tehdä myös suoraan selaimessa lataushetkellä, mutta se tehtäisiin
silloin eri tekniikalla (JavaScript) kuin nykyinen, laatutestattu paikallinen menetelmä (Python/pypdf). Eri
poimintatavat voivat tuottaa hienovaraisesti erilaista tekstiä — rivitykset, välilyönnit, sivunumeroiden tunnistus —
ja tämän projektin aiemmat laatuongelmat (esim. sisällysluettelosivujen suodatus, oikeat sivuviittaukset) on
viritetty juuri nykyistä menetelmää vasten. Tämä paikallinen vaihe on tietoinen valinta luotettavuuden
säilyttämiseksi, ei tekninen rajoite — make_chunks.bat
tekee työn kertakäyttöisesti käynnistettynä, ei vaadi komentojen kirjoittamista käsin.