Korpus ke stažení
Celý archiv strojově čitelně: 274 záznamů, z toho 273 s textem. Soubory se generují při každém sestavení webu.
Soubory
- corpus.jsonl — jeden záznam na řádek (NDJSON), včetně plného textu. Formát, který čtou datové nástroje přímo.
- index.json — totéž jako jeden dokument JSON.
- all.md — všechny texty v jednom Markdownu.
- manifest.json — počty, rozsah a kontrolní součty SHA-256 každého souboru.
- feed.xml — RSS s plným textem.
- /komentare/src/ — zdrojový Markdown každé položky. Kratší příspěvky ze sítí zdrojový soubor nemají; jejich data jsou v social-posts.json.
Úplnost textu
Každý záznam nese pole text_status, aby bylo zřejmé, co archiv
skutečně obsahuje:
- published_full_text — 216
- author_manuscript — 23
- machine_transcript — 21
- correspondence — 8
- unpublished_manuscript — 2
- publisher_excerpt — 2
- publisher_transcript — 1
- link_only — 1
Every record carries a text_status
field, so a consumer can tell a published text from the author's own version,
from a publisher's teaser, from a transcript of a recording, from an audio/video
record that stores no text at all.