Korpus ke stažení
Celý archiv strojově čitelně: 162 záznamů, z toho 147 s textem. Soubory se generují při každém sestavení webu.
Soubory
- corpus.jsonl — jeden záznam na řádek (NDJSON), včetně plného textu. Formát, který čtou datové nástroje přímo.
- index.json — totéž jako jeden dokument JSON.
- all.md — všechny texty v jednom Markdownu.
- manifest.json — počty, rozsah a kontrolní součty SHA-256 každého souboru.
- feed.xml — RSS s plným textem.
- /komentare/src/ — zdrojový Markdown každé položky.
Úplnost textu
Každý záznam nese pole text_status, aby bylo zřejmé, co archiv
skutečně obsahuje:
- published_full_text — 127
- author_manuscript — 17
- link_only — 15
- publisher_excerpt — 3
Every record carries a text_status
field, so a consumer can tell a published text from the author's own version,
from a publisher's teaser, from an audio/video record that stores no text.