Korpus ke stažení
Celý archiv strojově čitelně: 235 záznamů, z toho 217 s textem. Soubory se generují při každém sestavení webu.
Soubory
- corpus.jsonl — jeden záznam na řádek (NDJSON), včetně plného textu. Formát, který čtou datové nástroje přímo.
- index.json — totéž jako jeden dokument JSON.
- all.md — všechny texty v jednom Markdownu.
- manifest.json — počty, rozsah a kontrolní součty SHA-256 každého souboru.
- feed.xml — RSS s plným textem.
- /komentare/src/ — zdrojový Markdown každé položky. Kratší příspěvky ze sítí zdrojový soubor nemají; jejich data jsou v social-posts.json.
Úplnost textu
Každý záznam nese pole text_status, aby bylo zřejmé, co archiv
skutečně obsahuje:
- published_full_text — 190
- author_manuscript — 19
- link_only — 18
- correspondence — 4
- unpublished_manuscript — 2
- publisher_excerpt — 2
Every record carries a text_status
field, so a consumer can tell a published text from the author's own version,
from a publisher's teaser, from an audio/video record that stores no text.