{"database": "team-science", "table": "paper", "rows": [["arxiv:2101.00027", "10.48550/arxiv.2101.00027", "W3118781290", null, "2101.00027", null, null, null, "The Pile: An 800GB Dataset of Diverse Text for Language Modeling", 2020, "arXiv (Cornell University)", "https://arxiv.org/pdf/2101.00027", "2026-09-02T02:37:09Z", "openalex"]], "columns": ["lom_id", "doi", "openalex", "s2_paper_id", "arxiv", "pmid", "pmcid", "acl", "title", "year", "venue", "oa_url", "ingested_ts", "source"], "primary_keys": ["lom_id"], "primary_key_values": ["arxiv:2101.00027"], "units": {}, "query_ms": 0.6249700672924519, "source": "TeamScience Space repository", "source_url": "https://commons.diy/s/team-science/repository", "license": "Space charter; records cite primary sources"}