{"as_of":"2026-08-10T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe2b0f69e33e172af0fe7ef503bee78c1917a66edb0bd6c5c1830c31433dfca8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:27:57.542454Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":18,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-09T14:27:57.542454Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.542454Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:e71fbb46520c2b0fa38f78619ada986cc702137c9e5b0f366c870713ef191b02","observation_id":"2faa9b3a-7af2-45e2-becb-87d3f888bdad","resolution":{"observed_at":"2026-08-09T14:27:57.542454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-08T20:08:57.500140Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05159","last_updated":"2025-05-27T16:54:17Z","snapshot_observed_at":"2026-08-09T21:49:24.558670Z","submitted_at":"2025-02-07T18:41:21Z","title":"A Lightweight Method to Disrupt Memorized Sequences in LLM","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T20:08:57.500140Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2502.05159"},"observation_digest":"sha256:8b8f28d4b55aa0b23fc72736ffbe1a033431628371c7fba680a4898a597bd29f","observation_id":"935cca9e-f840-4481-bfcd-ea0a1f113379","resolution":{"observed_at":"2026-08-08T20:08:57.500140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-08T14:48:53.827249Z","title":"Redpajama: an open dataset for training large lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.827249Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:4d655f77f3f76d14bbb72090f56ca98571228856098e45cf7cb56e0f8a9a75ff","observation_id":"e48a6e5c-c83a-4769-a84a-670bd1d3bd6b","resolution":{"observed_at":"2026-08-08T14:48:53.827249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-07T15:29:09.304268Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15024","last_updated":"2025-05-23T01:09:11Z","snapshot_observed_at":"2026-08-09T14:19:48.325090Z","submitted_at":"2025-05-21T02:13:24Z","title":"Diagnosing our datasets: How does my language model learn clinical information?","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:29:09.304268Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2505.15024"},"observation_digest":"sha256:baebd010380e560ac8880069cff23510f88e2b59a8fef45d96294eb9ef64e6f2","observation_id":"4824c5f2-d689-44d9-b29b-4d9ac1db0003","resolution":{"observed_at":"2026-08-07T15:29:09.304268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-07T13:32:33.391740Z","title":"Redpajama: an open dataset for training large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:33.391740Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:e01f9d728ee9c3576318b02a28b3fe7a7d1ba01a3b34c873811158bd69997ecd","observation_id":"e15629f2-7a49-41eb-85b5-df5ef3621fc5","resolution":{"observed_at":"2026-08-07T13:32:33.391740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-07T10:29:45.444268Z","title":"Redpajama: an open dataset for training large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05209","last_updated":"2025-06-05T16:21:30Z","snapshot_observed_at":"2026-08-09T07:25:20.673180Z","submitted_at":"2025-06-05T16:21:30Z","title":"The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text","version":1},"reference_index":196,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:45.444268Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2506.05209"},"observation_digest":"sha256:c5024c57ea6401395e8cfa91e207a0324c8b19aa4b3266011729ade85ec12a75","observation_id":"37b1cbea-2d9b-41f2-a510-3b6ce62ca490","resolution":{"observed_at":"2026-08-07T10:29:45.444268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-07T04:19:10.350194Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.350194Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:c63b745b8c45c6178bd775b3293e8982b373d55638e6e5eb346dd1984d17b4d5","observation_id":"2a633f51-b59d-4224-8915-6a1fad4c7ad1","resolution":{"observed_at":"2026-08-07T04:19:10.350194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-07T00:24:47.623955Z","title":"Redpajama: an open dataset for training large language models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-07T00:16:03.841117Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.623955Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:d8562a02c840b3365dc4efb9652f04f38d30f5caa7840c53d3ab100e0944ac70","observation_id":"566ef656-7006-4020-8388-65edc1ea2007","resolution":{"observed_at":"2026-08-07T00:24:47.623955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.12372","doi":"10.48550/arxiv.2411.12372","metadata_source":"pith","pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Redpajama: an open dataset for training large language models","venue":"cs.CL","work_id":"b950825e-7583-4df4-922a-e7109800520c","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:28cdd64aa441a049a4c723dfc1cf923f89b888ca83141c9ab26862980a742bde","observation_id":"e8d4a238-444a-4897-981e-b963eab614df","resolution":{"observed_at":"2026-05-21T23:44:26.591858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-05T14:49:35.952702Z","title":"Redpajama: an open dataset for training large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-09T13:03:46.850295Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.952702Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:4ef091ed1c29ffd86fc5b2d26cdf2db2ba3f49a847f21e035bf7b13057739ae1","observation_id":"9bbf3e5f-ac51-4f10-b045-a2f423eafe06","resolution":{"observed_at":"2026-08-05T14:49:35.952702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-05T13:24:36.827145Z","title":"Weber, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00679","last_updated":"2025-08-31T03:22:54Z","snapshot_observed_at":"2026-08-09T18:50:23.521649Z","submitted_at":"2025-08-31T03:22:54Z","title":"Router Upcycling: Leveraging Mixture-of-Routers in Mixture-of-Experts Upcycling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:36.827145Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2509.00679"},"observation_digest":"sha256:df5c450618ce36e386b36c8442e0b6d7f49a7f05c52e962fa51ebc3cb3b07722","observation_id":"c4457a45-cf0d-497e-b605-89b5accb6f50","resolution":{"observed_at":"2026-08-05T13:24:36.827145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.12372","doi":"10.48550/arxiv.2411.12372","metadata_source":"pith","pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Redpajama: an open dataset for training large language models","venue":"cs.CL","work_id":"b950825e-7583-4df4-922a-e7109800520c","year":2024},"citing_paper":{"arxiv_id":"2511.21613","last_updated":"2026-04-19T02:59:16Z","snapshot_observed_at":"2026-08-06T11:38:39.962564Z","submitted_at":"2025-11-26T17:36:31Z","title":"Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T04:46:33.641714Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2511.21613"},"observation_digest":"sha256:39fe7c2ece489fc139b0c0a6929f6866d192a22671294b14aaf605234b754227","observation_id":"98500d58-abc6-4f10-a38d-02f91e33dfbc","resolution":{"observed_at":"2026-05-17T04:49:03.027674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-03T08:58:51.336919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15251","last_updated":"2026-06-28T17:05:49Z","snapshot_observed_at":"2026-08-08T08:20:09.777596Z","submitted_at":"2026-01-21T18:33:15Z","title":"The Effect of Scripts and Formats on LLM Numeracy","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T08:58:51.336919Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2601.15251"},"observation_digest":"sha256:30232fe9f32e6d7e180e1019fa367ffe4fd9ee3b41d5f6b57892a6d6dca45fcb","observation_id":"6b449b42-ea8b-4d18-969d-63fcdb5c7cf9","resolution":{"observed_at":"2026-08-03T08:58:51.336919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-03T08:15:34.574812Z","title":"Redpajama: an open dataset for training large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-08T23:34:38.789355Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":231,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:34.574812Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:9362f7d0cf4d45ed3bf170b39bd3aac83154245798f6c88bd273c837114a7615","observation_id":"dff2e6a1-fa65-4449-b2f9-f9606e2091bd","resolution":{"observed_at":"2026-08-03T08:15:34.574812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.12372","doi":"10.48550/arxiv.2411.12372","metadata_source":"pith","pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Redpajama: an open dataset for training large language models","venue":"cs.CL","work_id":"b950825e-7583-4df4-922a-e7109800520c","year":2024},"citing_paper":{"arxiv_id":"2606.07502","last_updated":"2026-06-05T17:54:32Z","snapshot_observed_at":"2026-08-02T19:57:32.632603Z","submitted_at":"2026-06-05T17:54:32Z","title":"Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T22:01:37.613094Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2606.07502"},"observation_digest":"sha256:4fa1a41958de0d78e9c3ed78e4e4023e9c0b4ad0b5e47c9bb95ce943a10cc380","observation_id":"590a810a-bea8-41b1-9df8-106cc74348e1","resolution":{"observed_at":"2026-07-02T17:27:15.427174Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.12372","doi":"10.48550/arxiv.2411.12372","metadata_source":"pith","pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Redpajama: an open dataset for training large language models","venue":"cs.CL","work_id":"b950825e-7583-4df4-922a-e7109800520c","year":2024},"citing_paper":{"arxiv_id":"2606.24890","last_updated":"2026-07-12T16:43:51Z","snapshot_observed_at":"2026-08-07T04:54:34.963444Z","submitted_at":"2026-04-30T02:18:50Z","title":"Small edits, large models: How Wikipedia advocacy shapes LLM values","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T09:03:09.977131Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2606.24890"},"observation_digest":"sha256:9a0fe2f8021092222f74c8edbd36985d6622745217fe6d175237dbdde2255de5","observation_id":"f10efb69-6579-48cc-bbba-5edf701d6a07","resolution":{"observed_at":"2026-07-01T09:05:35.771485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-07-14T19:23:22.815333Z","title":"Redpajama: An open dataset for training large language models.arXiv preprint arXiv:2411.12372, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24890","last_updated":"2026-07-12T16:43:51Z","snapshot_observed_at":"2026-08-07T04:54:34.963444Z","submitted_at":"2026-04-30T02:18:50Z","title":"Small edits, large models: How Wikipedia advocacy shapes LLM values","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T19:23:22.815333Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2606.24890"},"observation_digest":"sha256:9918f3c52d964bd1cf45a99cb0d12e21296c9f67cf821395d4848dbb533666bb","observation_id":"32e897c5-9350-474a-a03d-39cf2adbf4ec","resolution":{"observed_at":"2026-07-14T19:23:22.815333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.12372","doi":"10.48550/arxiv.2411.12372","metadata_source":"pith","pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Redpajama: an open dataset for training large language models","venue":"cs.CL","work_id":"b950825e-7583-4df4-922a-e7109800520c","year":2024},"citing_paper":{"arxiv_id":"2606.27598","last_updated":"2026-06-25T23:04:05Z","snapshot_observed_at":"2026-08-09T08:02:06.623919Z","submitted_at":"2026-06-25T23:04:05Z","title":"Narrative-UFET: Narrative Generation for Ultra-Fine Entity Typing","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-29T01:14:50.756453Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2606.27598"},"observation_digest":"sha256:d80a6bf5609a117f083191639b6f9bbcda0031ae880b4f16e8d29d600b19097e","observation_id":"9729b55e-f368-4e28-bc2c-9fd2bdb8eb9a","resolution":{"observed_at":"2026-07-01T19:06:02.750903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.12372","doi":"10.48550/arxiv.2411.12372","metadata_source":"pith","pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Redpajama: an open dataset for training large language models","venue":"cs.CL","work_id":"b950825e-7583-4df4-922a-e7109800520c","year":2024},"citing_paper":{"arxiv_id":"2607.01127","last_updated":"2026-07-01T16:13:03Z","snapshot_observed_at":"2026-08-10T04:33:34.724071Z","submitted_at":"2026-07-01T16:13:03Z","title":"$\\text{Log}_\\text{b}$Quant: Quantizing Language Models in Logarithmic Space","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-02T12:35:58.613973Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2607.01127"},"observation_digest":"sha256:dfd055a8d0fdf9d45297612d151f3e06710c403e5de55e7e244147df28dd11fc","observation_id":"152f7a68-96f4-42be-912d-4711e32a7b26","resolution":{"observed_at":"2026-07-02T12:36:55.872510Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.12372","doi":"10.48550/arxiv.2411.12372","metadata_source":"pith","pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Redpajama: an open dataset for training large language models","venue":"cs.CL","work_id":"b950825e-7583-4df4-922a-e7109800520c","year":2024},"citing_paper":{"arxiv_id":"2607.08196","last_updated":"2026-07-09T07:54:39Z","snapshot_observed_at":"2026-08-07T00:25:36.849231Z","submitted_at":"2026-07-09T07:54:39Z","title":"A First-Principles Theory of Slow Thinking and Active Perception","version":1},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-07-10T11:32:24.374377Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2607.08196"},"observation_digest":"sha256:42fc0ea8aff4785bc5d6fc0ebf328adf1529588bedf719d7d0cc6d78f5bd5881","observation_id":"2a65a684-4ba9-4249-bc4c-5dbb900df86c","resolution":{"observed_at":"2026-07-10T11:37:03.328504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-01T00:03:06.880355Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23250","last_updated":"2026-07-25T15:21:25Z","snapshot_observed_at":"2026-08-09T04:30:45.327844Z","submitted_at":"2026-07-25T15:21:25Z","title":"Libra: Taming Attention Workload Skew in Long-Context LLM Training with Bounded Sequence Pool","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T00:03:06.880355Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2607.23250"},"observation_digest":"sha256:39010677335f5b0fa8d69dcb2589aaed6cbb144085a7ebfe01fde7397043f3d9","observation_id":"69a6c735-9747-426f-aa56-d90025b34803","resolution":{"observed_at":"2026-08-01T00:03:06.880355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-07-31T11:19:36.131568Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24585","last_updated":"2026-07-27T15:51:41Z","snapshot_observed_at":"2026-08-07T13:03:57.696225Z","submitted_at":"2026-07-27T15:51:41Z","title":"From Data to Device: ELMOD An Efficient German-First 2.7B Language Model for Mobile Inference","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-31T11:19:36.131568Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2607.24585"},"observation_digest":"sha256:15b280f22144a4053ff904fc3448772822d7b02ce842a52239f196c81ecd18a6","observation_id":"2acd6937-8313-480a-9af2-15d5e44ef445","resolution":{"observed_at":"2026-07-31T11:19:36.131568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.12372/citation-record","integrity":"/paper/2411.12372/integrity","json":"/paper/2411.12372/citation-record.json","paper":"/paper/2411.12372"},"outbound":[],"paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2411.12372."}