Faili tekstiks muundur veebis
Muuda tekstilaadsed failid (txt, csv, md, html) üheks tekstifailiks. Loe faile lokaalselt brauseris, laadi alla .txt. Lihtne ja tasuta. Töötlemine toimub koh…
Alusta kasutamist
Mida tööriist teeb?
See tööriist loeb valitud tekstilaadseid faile brauseri File.text() meetodiga ja ühendab nende toorteksti. See ei ole PDF-i või Wordi dokumentide ekstraktor, ei tunne OCR-i ega vali automaatselt kodeeringut. HTML-sildid jäävad tekstina alles, neid ei eemaldata ega renderdata.
Konkreetne näide
Kui valida fail a.txt sisuga Tere ja fail b.html sisuga <b>>Tere</b>, siis tulemuseks on:
===== a.txt ===== Tere ===== b.html ===== <b>Tere</b>
Iga faili ees on päis ===== failinimi ===== ja failide vahel on tühi rida. Allalaetav fail extracted-text.txt sisaldab neid päiseid ja ei ole algsete failide täpne koopia.
Piirangud
- Vaja on vähemalt ühte faili.
- Maksimaalselt 500 faili, 64 MiB faili kohta ja 128 MiB kogu sisend.
- Suurte failide puhul võib mälu olla piiratud, seega alusta väikeste failidega.
- Kodeering on UTF-8; vigased baitijadad võidakse asendada, seega kasuta õiget kodeeringut.
Privaatsus
Kogu töötlus toimub sinu brauseris, faile ei laeta üles ega saadeta serverisse.
Korduma kippuvad küsimused
Kas tööriist tunneb ära PDF-i või pildi teksti?
Ei, see tööriist loeb ainult tekstilaadseid faile (nt .txt, .csv, .md, .html). PDF-id, pildid ja dokumendid (nt DOCX) ei ole toetatud.
Miks on minu HTML-failis sildid näha?
Tööriist loeb faili toortekstina, seega HTML-sildid jäävad algsel kujul alles. See ei ole veebilehitseja, mis renderdaks HTML-i.
Kuidas ma tean, et failid on õiges kodeeringus?
Tööriist eeldab UTF-8 kodeeringut. Kui sinu failid kasutavad muud kodeeringut (nt Latin-1), võivad tähed moonduda. Salvesta failid enne kasutamist UTF-8 kujul.
Töötlemine toimub kohalikult teie brauseris.