{"as_of":"2026-08-15T00:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:694b854766056a7b589056857d9d1392bd3af00867e604259f5e49eb408a16b5","coverage":[{"denominator":165,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:54:02.331862Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:18:00.321479Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07124","snapshot_observed_at":"2026-08-07T13:18:00.321479Z","title":"LLM360 K2: Building a 65B 360-open-source large language model from scratch,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-12T13:13:08.532263Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.321479Z"},"links":{"cited_paper":"/paper/2501.07124","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:4ae1718ba29da23861bc6220561e5d05c28f778e819a64b5dbf37bb355ce6b8c","observation_id":"bca93d8b-50e0-40af-ae8a-631cc3c33fcc","resolution":{"observed_at":"2026-08-07T13:18:00.321479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07124","snapshot_observed_at":"2026-08-04T17:10:43.436455Z","title":"LLM360 K2: Building a 65B 360-open-source large language model from scratch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11106","last_updated":"2025-09-14T05:49:42Z","snapshot_observed_at":"2026-08-04T17:10:34.284259Z","submitted_at":"2025-09-14T05:49:42Z","title":"Fluid Language Model Benchmarking","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T17:10:43.436455Z"},"links":{"cited_paper":"/paper/2501.07124","citing_paper":"/paper/2509.11106"},"observation_digest":"sha256:a42a995b9b8c9d08b49569f24dca83ff3c7813d6f4bcf130330adf0a457ead1d","observation_id":"44acbbac-0a63-49ac-a2ef-18634bc53a3d","resolution":{"observed_at":"2026-08-04T17:10:43.436455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"cited_work":{"arxiv_id":"2501.07124","doi":"10.48550/arxiv.2501.07124.url:","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07124","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","venue":null,"work_id":"79d80020-6168-4641-9e8d-a139574e92cb","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2501.07124","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:b459a026d6d3be6a2c056364b73bb89e1c221c4bd3a6c763ff2eed715b5ee12d","observation_id":"3fceb114-49db-44b3-8a73-7bad8b49d944","resolution":{"observed_at":"2026-05-10T02:11:57.125399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07124","snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Llm360 k2: Building a 65b 360-open-source large language model from scratch.arXiv preprint arXiv:2501.07124, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"cited_paper":"/paper/2501.07124","citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:9d9960edc2383f950e4cfdd02b7281561cecf7e43fcaf89f1c2042f544fc45bf","observation_id":"37d2254b-2d91-4067-b330-26975a3278ec","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.07124/citation-record","integrity":"/paper/2501.07124/integrity","json":"/paper/2501.07124/citation-record.json","paper":"/paper/2501.07124"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:01.955542Z","title":"01-ai/yi: A series of large language models trained from scratch by developers @01-ai, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:01.955542Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:ef0f38ff4e8ec8aff91a1916b3491a7233855b9c3bf085b87c473642ab93df3c","observation_id":"353c996a-49a5-4e25-999a-9704cb14b243","resolution":{"observed_at":"2026-08-10T20:54:01.955542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T20:54:01.959421Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:01.959421Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:3b1b47a94e3867ef2a2d5bb37604ed566685ba46399aff2a9e3e385eae57906b","observation_id":"26c84eaa-e468-4105-8b3a-b46224bdf5a6","resolution":{"observed_at":"2026-08-10T20:54:01.959421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-12T23:40:54.718397Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-10T20:54:01.963309Z","title":"Nemotron-4 340b technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:01.963309Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:7391a5f17deb1c16e3697bfc831afbbd54f784a5dd7dfad36e19aa70fcabecca","observation_id":"5cbd8f9c-904d-4d6a-bf0e-3a628577094b","resolution":{"observed_at":"2026-08-10T20:54:01.963309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.03988","last_updated":"2023-02-24T09:53:40Z","snapshot_observed_at":"2026-08-13T13:07:56.285029Z","submitted_at":"2023-01-09T10:52:35Z","title":"SantaCoder: don't reach for the stars!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.03988","snapshot_observed_at":"2026-08-10T20:54:01.967459Z","title":"Santacoder: don't reach for the stars! arXiv preprint arXiv:2301.03988, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:01.967459Z"},"links":{"cited_paper":"/paper/2301.03988","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:4af1444f5c9477c882a293c2d1e913e0d2c18ae525b1b0438a2f1ac25d9ab743","observation_id":"b16dbe74-6fee-486c-8ee9-a708f81ba64e","resolution":{"observed_at":"2026-08-10T20:54:01.967459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:01.971970Z","title":"Smollm - blazingly fast and remarkably powerful","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:01.971970Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:1e7bff3b660932edadf5a2749d4762000ad68753a146bf0da12637d4a45f324b","observation_id":"7b8d6cd3-4c44-4ac9-a8f4-69e8e4a6b565","resolution":{"observed_at":"2026-08-10T20:54:01.971970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:01.975834Z","title":"The falcon series of open language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:01.975834Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:c12b7816f4087e60af017e0222c47afc44a20182737fc4f830188471c4831233","observation_id":"b9908567-1d0d-4b41-8e27-64a7bc2147e9","resolution":{"observed_at":"2026-08-10T20:54:01.975834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:01.979803Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based formalisms, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:01.979803Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:f60ae800d145b35bd808b372fc05e4122db999be7f67522860dd23b3c6a6f2c3","observation_id":"459c08ae-b3ec-4f36-9a60-a65d1a30a75e","resolution":{"observed_at":"2026-08-10T20:54:01.979803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:01.984191Z","title":"GPT-NeoX: Large Scale Autoregressive Language Modeling in PyTorch , 9 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:01.984191Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:9eadee76e3242d14183ad67790ca03e94df8fe52321319046473468aead1fcbf","observation_id":"677cf518-4f43-443e-b81a-4ece58f79b7c","resolution":{"observed_at":"2026-08-10T20:54:01.984191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-10T20:54:01.988432Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:01.988432Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:603592e6d3d38ddc05827a9303cde511e94c580910090ea3d95bde407f40aa1b","observation_id":"5130e73c-5385-4d44-8658-a5a94aa78cb2","resolution":{"observed_at":"2026-08-10T20:54:01.988432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:01.992058Z","title":"Model card for claude 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:01.992058Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:012a0b11ef36ee6505490d87514a5666bbefd91c87528d0be02fda6b75a78615","observation_id":"682bede8-499a-4b44-a522-9ba7dfe1c06d","resolution":{"observed_at":"2026-08-10T20:54:01.992058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-10T20:54:01.995171Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:01.995171Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:5a2390f9565b21b323806fa0cf551fd3cf05bd7ed4af5981ea14b884d5e3796a","observation_id":"3bc24cd8-44e7-41a9-b8df-30c5b5e53710","resolution":{"observed_at":"2026-08-10T20:54:01.995171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:01.999295Z","title":"Jiang, Jia Deng, Stella Biderman, and Sean Welleck","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:01.999295Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:3c9344083d2e5264acb673906f9a569e2f06671895f2c66c4c94592423b0b5a4","observation_id":"4f63f515-d423-47fc-85fa-f112e1074f35","resolution":{"observed_at":"2026-08-10T20:54:01.999295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T20:54:02.003077Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.003077Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:1b80d0040da55cf50fe521870e5f23687e5621dcf5e507f62a269ca7efb1d1a1","observation_id":"37c5bd7a-7e0d-4beb-b9eb-bc1be24a34cb","resolution":{"observed_at":"2026-08-10T20:54:02.003077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-10T20:54:02.006684Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.006684Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:0f83daa853b8c67952a3456c2e98c390720dc95e782ba8e6cbb000fe9c154757","observation_id":"e68d8bd9-e96d-472e-bd0b-f254ccfbfccf","resolution":{"observed_at":"2026-08-10T20:54:02.006684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.009921Z","title":"Trafilatura: A Web Scraping Library and Command-Line Tool for Text Discovery and Extraction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.009921Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:6351167306564a23b4c203f6f137880c4462fa7412afc75ef0552ec8e2386e94","observation_id":"bdd10a75-959f-4984-9a84-51d3010e6953","resolution":{"observed_at":"2026-08-10T20:54:02.009921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14255","last_updated":"2022-07-28T17:40:47Z","snapshot_observed_at":"2026-08-12T15:32:23.741504Z","submitted_at":"2022-07-28T17:40:47Z","title":"Efficient Training of Language Models to Fill in the Middle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.14255","snapshot_observed_at":"2026-08-10T20:54:02.013010Z","title":"Efficient training of language models to fill in the middle","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.013010Z"},"links":{"cited_paper":"/paper/2207.14255","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:189146da8db870e790543f9acbc2761df0e98b1256c8048234270b1665464059","observation_id":"e0b9ef25-a8b6-48d7-ba3c-c601cfbea8b4","resolution":{"observed_at":"2026-08-10T20:54:02.013010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.016393Z","title":"Infinity instruct","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.016393Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:e1fc7fa50296d9163b20599102fc300984eca21c9b0bc49c5b03625079ec8341","observation_id":"733e0b5b-8126-49bf-a5d6-9ed6adf2cb99","resolution":{"observed_at":"2026-08-10T20:54:02.016393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17834","last_updated":"2024-02-27T19:00:07Z","snapshot_observed_at":"2026-08-13T04:08:50.424750Z","submitted_at":"2024-02-27T19:00:07Z","title":"Stable LM 2 1.6B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17834","snapshot_observed_at":"2026-08-10T20:54:02.019512Z","title":"Stable lm 2 1.6 b technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.019512Z"},"links":{"cited_paper":"/paper/2402.17834","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:665d2053cb4210cf61fb10e10b5d30c3d682d84b559f0feb11f5dec78e45f9f9","observation_id":"d32ee3df-d104-47ef-a4d0-887de42d0615","resolution":{"observed_at":"2026-08-10T20:54:02.019512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.023089Z","title":"A framework for the evaluation of code generation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.023089Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:757c688b7174ee5b686be645768bb745d6539f2f296b7f84b52d751f8e75f565","observation_id":"a929b4cf-f6fd-462e-8488-1ffe950eebfc","resolution":{"observed_at":"2026-08-10T20:54:02.023089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-13T10:32:14.793112Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-10T20:54:02.026489Z","title":"Red-teaming large language models using chain of utterances for safety-alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.026489Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:313e08dd3038dbde826a1edfee015104415474564c90e2c4636aa047172071ac","observation_id":"de808395-7c4c-4c84-b40d-ad225cf6b9a2","resolution":{"observed_at":"2026-08-10T20:54:02.026489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04724","last_updated":"2023-12-07T22:07:54Z","snapshot_observed_at":"2026-08-13T05:07:35.134194Z","submitted_at":"2023-12-07T22:07:54Z","title":"Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04724","snapshot_observed_at":"2026-08-10T20:54:02.030313Z","title":"Purple llama cyberseceval: A secure coding benchmark for language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.030313Z"},"links":{"cited_paper":"/paper/2312.04724","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:0b5438ff4652f6ea4a5f5577d9fe45c5cad0adbf6cff619900f3f6ce6c38a33b","observation_id":"34a0f1f4-db22-4fa9-a52c-942427e07f4a","resolution":{"observed_at":"2026-08-10T20:54:02.030313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07875","last_updated":"2024-03-19T16:50:50Z","snapshot_observed_at":"2026-08-13T10:13:29.419905Z","submitted_at":"2023-09-14T17:23:37Z","title":"Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07875","snapshot_observed_at":"2026-08-10T20:54:02.037382Z","title":"Safety-tuned llamas: Lessons from improving the safety of large language models that follow instructions, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.037382Z"},"links":{"cited_paper":"/paper/2309.07875","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:73994e08b4705b0d669bbfcd2df3c69a19db136673f0c29badd9a161da70c055","observation_id":"3ede848b-1766-4ace-88b5-a8b9c5e9e298","resolution":{"observed_at":"2026-08-10T20:54:02.037382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11158","last_updated":"2023-05-31T19:09:45Z","snapshot_observed_at":"2026-08-15T00:26:52.527488Z","submitted_at":"2023-04-21T17:58:31Z","title":"Emergent and Predictable Memorization in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11158","snapshot_observed_at":"2026-08-10T20:54:02.041642Z","title":"Emergent and predictable memorization in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.041642Z"},"links":{"cited_paper":"/paper/2304.11158","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:3cc4d72a09a01acbf425084f2c03ccfaa6058fc274a63429fede4221d47c9d7c","observation_id":"f9c5f72e-490a-4b04-84af-3cec111c53e3","resolution":{"observed_at":"2026-08-10T20:54:02.041642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.044863Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.044863Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:d25d9adbacc0314ecfa5eaef3227aa86fb5249551e7676e1c4b0f31c65fa9dca","observation_id":"ad9d6489-289d-4997-ac5c-ec97a7927f3c","resolution":{"observed_at":"2026-08-10T20:54:02.044863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.048149Z","title":"Lee, Haonan Li, Charles Lovering, Niklas Muennighoff, Ellie Pavlick, Jason Phang, Aviya Skowron, Samson Tan, Xiangru Tang, Kevin A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.048149Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:06eb3b206e2154beb3fb41f92d192132b4ce6a75d192bd9917c05946d731e81f","observation_id":"62104c6c-a437-4c88-80fc-f7098987ac89","resolution":{"observed_at":"2026-08-10T20:54:02.048149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.052615Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.052615Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:8182314043649b3bd93f26e05a93fea5cbcd52dcc825e9d9d9ed49244386ad70","observation_id":"908d7370-691f-416b-bbad-3a5670b12da7","resolution":{"observed_at":"2026-08-10T20:54:02.052615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.055732Z","title":"GPT-Neo: Large Scale Autoregressive Language Modeling with Mesh-Tensorflow , March 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.055732Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:288d4072d4db3b478f7528397cbafc0bb58361bb8c4679b94d788bb4dca7e864","observation_id":"9f4df066-a5cc-4c95-b81d-681f5ea5b8e3","resolution":{"observed_at":"2026-08-10T20:54:02.055732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.059993Z","title":"Gpt-neox-20b: An open-source autoregressive language model, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.059993Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:60f82b48440c9edaff11afcf013da05abc725345b799c14fa9698b21e6804f30","observation_id":"a11260a7-cfb1-423d-baa6-241e93d60615","resolution":{"observed_at":"2026-08-10T20:54:02.059993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.063408Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.063408Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:f613af9ccd190f07f103cf09970bcf1711a988ed08960838e5c550d219822df5","observation_id":"3e2eaa45-bdb0-42fd-bae0-e1210afce069","resolution":{"observed_at":"2026-08-10T20:54:02.063408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T20:54:02.067418Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.067418Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:bff0a8747f31bc959b0c0e00d786d7bd043824b2b769c43d052ed4b9f29fa3b6","observation_id":"2d2fe6f1-c841-45f2-a154-7985062c84be","resolution":{"observed_at":"2026-08-10T20:54:02.067418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-10T20:54:02.071072Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.071072Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:75dae388806961c5b2188e348a74d7083b54536da5802b6e95423c1ef7c5c12a","observation_id":"2320637d-67ee-4f2e-b709-1c9e3d35ce82","resolution":{"observed_at":"2026-08-10T20:54:02.071072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.074985Z","title":"Berkay Celik","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.074985Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:e53c1551c4c3bc22205a57c81f41c5f7bdd5135d913b6bae4359453f3f2098fa","observation_id":"71e82385-988b-4d51-9e8a-bc6ca1b06298","resolution":{"observed_at":"2026-08-10T20:54:02.074985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.078843Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.078843Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:50c6078bfa36572003d41b342fd9082e51d69e30d0bf69b7b206cb11726017b9","observation_id":"11fceb6e-415b-49f5-94fd-6366f32272ab","resolution":{"observed_at":"2026-08-10T20:54:02.078843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-10T20:54:02.082316Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.082316Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:6d930acb76f716c362691a6b723f20e0e78d1082059a52cd143cac5ff7f7725b","observation_id":"dd6e64d5-4ce1-4f4d-abea-fe6a2cff3d28","resolution":{"observed_at":"2026-08-10T20:54:02.082316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.086091Z","title":"Claude 2.1 model card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.086091Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:4879221e376535bd712336a570287a3e6cefcc4496e775ff116dbd26de020b24","observation_id":"745ddf9b-c294-4ab2-8a07-e663e61bec8d","resolution":{"observed_at":"2026-08-10T20:54:02.086091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T20:54:02.089721Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.089721Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:af19022159a8140f4b995df8123efc24bd70fccf46aeca8d7533f465a5b632ed","observation_id":"c0f9f6ed-ae70-4d8b-93ae-3a1f3deef052","resolution":{"observed_at":"2026-08-10T20:54:02.089721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-13T15:18:04.411100Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-10T20:54:02.096331Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.096331Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:dfa5745677ded2bfad282b1f2fe41c3828f0d4872c81f6e4a552ae8d0df71856","observation_id":"f8072b34-19f6-4572-999c-fecd73c524d4","resolution":{"observed_at":"2026-08-10T20:54:02.096331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-10T20:54:02.100332Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.100332Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:46d6a3c4aad2441e8b8daf7b4742f0dcea9d8ced253ad82286d38289e2d4c117","observation_id":"620c4cc6-e3c9-4eca-a133-013a26907290","resolution":{"observed_at":"2026-08-10T20:54:02.100332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.104556Z","title":"Transformers are SSM s: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.104556Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:f1716689eb1ce525b5d278756135a037e9da7afadb703be357875a60f9dcb94c","observation_id":"9e3c24f1-d64a-4c22-9cc9-8dcdbfa8247f","resolution":{"observed_at":"2026-08-10T20:54:02.104556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.108199Z","title":"Mpt-7b: How we scaled to train the world's largest open-source model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.108199Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:45aa8ad31ea66bc86ac31472e95876f5df6f4ecffd95f38f95810cc64e188702","observation_id":"500e964a-2772-4318-b08f-e8986998d485","resolution":{"observed_at":"2026-08-10T20:54:02.108199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-10T20:54:02.111522Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.111522Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:78a6ce5a905bb108ffbfb586d3d901f280152e5fb9eb6ef9a31974e0f8f2776d","observation_id":"3c526ebc-31c5-411a-950a-8a978bb560d9","resolution":{"observed_at":"2026-08-10T20:54:02.111522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03208","last_updated":"2023-04-06T16:43:16Z","snapshot_observed_at":"2026-08-13T12:07:54.879744Z","submitted_at":"2023-04-06T16:43:16Z","title":"Cerebras-GPT: Open Compute-Optimal Language Models Trained on the Cerebras Wafer-Scale Cluster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03208","snapshot_observed_at":"2026-08-10T20:54:02.114677Z","title":"Cerebras-gpt: Open compute-optimal language models trained on the cerebras wafer-scale cluster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.114677Z"},"links":{"cited_paper":"/paper/2304.03208","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:c384b1f09cb11565c4a520953eff2c8531daab6f59c5cf6326d7f66e8fc1c5cd","observation_id":"17ce54dc-9bdf-478d-8e8b-159b4dfa5895","resolution":{"observed_at":"2026-08-10T20:54:02.114677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06083","last_updated":"2019-08-17T18:34:11Z","snapshot_observed_at":"2026-08-14T12:46:41.746144Z","submitted_at":"2019-08-17T18:34:11Z","title":"Build it Break it Fix it for Dialogue Safety: Robustness from Adversarial Human Attack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06083","snapshot_observed_at":"2026-08-10T20:54:02.118352Z","title":"Build it break it fix it for dialogue safety: Robustness from adversarial human attack, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.118352Z"},"links":{"cited_paper":"/paper/1908.06083","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:686980b09b7b7bae30d61b422209dd54ec33e6a1514531f1c73fd0292e59fcd9","observation_id":"665d302d-37e6-4b56-992b-cbb4e5602f87","resolution":{"observed_at":"2026-08-10T20:54:02.118352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.122269Z","title":"Measuring the carbon intensity of ai in cloud instances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.122269Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:c0aeb1df851d81c621fa65a3b036184e807215ec96a73a9b2ef8606789861c97","observation_id":"1802e637-0315-493f-abe2-81c4158263af","resolution":{"observed_at":"2026-08-10T20:54:02.122269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.129330Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.129330Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:38b2114ae7b962f1419051f9ab4d600b976b5b50b7336b4fa7de80ba265179a8","observation_id":"2c49ece4-f296-4f06-ae2b-8a317b4b6d0a","resolution":{"observed_at":"2026-08-10T20:54:02.129330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-08-13T10:17:00.791443Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-10T20:54:02.133111Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.133111Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:fcdba1e09559699dbc4d82c7829e8489c10f345ba161dab015add897897d3499","observation_id":"3cc63d1a-799e-46e8-8f24-a53bb8ac485f","resolution":{"observed_at":"2026-08-10T20:54:02.133111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-10T20:54:02.136349Z","title":"The P ile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.136349Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:f7377d70d946129b478241becd7977f6ab09a15e375d3fbe369d30b8d2b7bacc","observation_id":"d7d70984-70d3-4e0e-840e-47c57aa7773f","resolution":{"observed_at":"2026-08-10T20:54:02.136349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.140349Z","title":"A framework for few-shot language model evaluation, 12 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.140349Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:962b215b3cdc358af164c0d28307a63f05e711dc3bd37ec164263697b77f29cd","observation_id":"b77448b8-6375-44ba-9d28-855f93286586","resolution":{"observed_at":"2026-08-10T20:54:02.140349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.144639Z","title":"Openllama: An open reproduction of llama, May 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.144639Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:dc03f598e654255aebab5cad0b7f871dc27bc2d6b0229e0eb6660083d4a8526e","observation_id":"4b5f0ed7-9e0a-47b2-b4fe-04e8dc1286ea","resolution":{"observed_at":"2026-08-10T20:54:02.144639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-10T20:54:02.147830Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.147830Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:bbf649ea8baa35990839fe63ad78550f9056a43b7d3d49983d3f0fd6a0f626f7","observation_id":"9faaac25-56ca-4b78-88ce-6602d87306ab","resolution":{"observed_at":"2026-08-10T20:54:02.147830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T20:54:02.151311Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.151311Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:98df2215f86b5234c93d14e854ce165dbeaa77a5c772d7360d7181be095d64e8","observation_id":"e02df997-f95e-4d92-97dd-3e27849233d9","resolution":{"observed_at":"2026-08-10T20:54:02.151311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-10T20:54:02.155176Z","title":"Olmo: Accelerating the science of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.155176Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:7997899197dbabcc1e3f0fd2e7c6619dddd2aa625e01cda3cff584f0f48cc35c","observation_id":"41635d41-28b7-476e-80a8-269d0057f979","resolution":{"observed_at":"2026-08-10T20:54:02.155176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-10T20:54:02.159446Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.159446Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:70685ecd9f51bcdd81f126c518183562a35f2dd9fb9664c735917c5841186397","observation_id":"99c9f3ce-63b8-4508-bcbd-56b96cc00e00","resolution":{"observed_at":"2026-08-10T20:54:02.159446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-10T20:54:02.163641Z","title":"Textbooks are all you need","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.163641Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:6cb39e9e791723aa0eb8e32b6f9eddf8eadb6b8d5851b93e1e863790de8b228d","observation_id":"cbe8a428-2578-4ee3-9822-7cecafdaa0a4","resolution":{"observed_at":"2026-08-10T20:54:02.163641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00220","last_updated":"2022-11-29T08:59:40Z","snapshot_observed_at":"2026-08-13T15:12:54.338774Z","submitted_at":"2022-07-01T06:25:15Z","title":"Pile of Law: Learning Responsible Data Filtering from the Law and a 256GB Open-Source Legal Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00220","snapshot_observed_at":"2026-08-10T20:54:02.167170Z","title":"Krass*, Lucia Zheng, Neel Guha, Christopher D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.167170Z"},"links":{"cited_paper":"/paper/2207.00220","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:975926ad960b506438a728c00271474e9bb8e0f2c224f581a1d6895ed232ae5e","observation_id":"377b48e5-89ed-4b0d-a99b-c6ab94cf3c84","resolution":{"observed_at":"2026-08-10T20:54:02.167170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.171187Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.171187Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:955dbf55830623827ffc2e576670481eaeb65d7802db0b46c949caa0dae09a6c","observation_id":"e37e348a-888a-4f97-ae71-b057a7d4ea76","resolution":{"observed_at":"2026-08-10T20:54:02.171187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.174107Z","title":"Scaling laws and interpretability of learning from repeated data, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.174107Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:4e16d4a9c1ce6a1cb92308fe1741a3584cae6ae7a67bb3254e8255c358083615","observation_id":"f3d54395-f465-46cc-9e3b-3821f6a517ab","resolution":{"observed_at":"2026-08-10T20:54:02.174107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.177541Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.177541Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:ed4518df89a1e31d1d501505382994d201faf7f5cf06e72d7a8a50fa0505dcba","observation_id":"5325d773-ce83-463a-b940-e68cce82adcf","resolution":{"observed_at":"2026-08-10T20:54:02.177541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T20:54:02.180688Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.180688Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:229ff2f521c1950ab551f8fa9b0cb4c80bdce0cc61214cb087b50a42440db8e3","observation_id":"019bd9f7-cc7d-43c8-9bc3-a389d6834dee","resolution":{"observed_at":"2026-08-10T20:54:02.180688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-10T20:54:02.184639Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.184639Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:65b033a311779d6fbef2ba8008c1bf06e9e0a6f9e3e77f3c0c33959526652c4f","observation_id":"04a9b181-53cc-4dbd-87d9-511039fadd5c","resolution":{"observed_at":"2026-08-10T20:54:02.184639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-13T01:26:47.642290Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-10T20:54:02.188363Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.188363Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:f1d1485da2063cc65056d6fa2eabc9abe9a5aa3710cf14146d021c2ab48ef583","observation_id":"15571009-fc40-49e2-b260-bef286dbf032","resolution":{"observed_at":"2026-08-10T20:54:02.188363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.192535Z","title":"Pubmedqa: A dataset for biomedical research question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.192535Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:2a02db0d1ae63e59f762a143589cdbf782e910b11b901530fd255c4a1a4f87a4","observation_id":"dc8b8ae4-7d60-429a-bff1-b104b48a1384","resolution":{"observed_at":"2026-08-10T20:54:02.192535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12688","last_updated":"2022-10-25T08:28:58Z","snapshot_observed_at":"2026-08-13T15:37:21.824248Z","submitted_at":"2022-05-25T11:48:47Z","title":"ProsocialDialog: A Prosocial Backbone for Conversational Agents","version":2},"cited_work":{"arxiv_id":"2205.12688","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.12688","snapshot_observed_at":"2026-08-10T20:54:03.241496Z","title":"ProsocialDialog: A Prosocial Backbone for Conversational Agents","venue":"cs.CL","work_id":"19cb476e-2c57-49a7-96c5-95e50438ec5a","year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.195859Z"},"links":{"cited_paper":"/paper/2205.12688","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:7c27f75afd449000ec9a7c14840c172643a0f3c13aafa6cdc120b454b9a66272","observation_id":"8a727b01-f1b0-422f-a0c3-e0b97f204c1d","resolution":{"observed_at":"2026-08-10T20:54:03.247928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.199547Z","title":"Reducing activation recomputation in large transformer models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.199547Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:e1c5ad61a87df00444ab3d5f6f4df5ed7357f6dc7b60cb036bcef2e1d65924d1","observation_id":"b145c6c1-3727-4b12-90a0-e0f9b34b67e0","resolution":{"observed_at":"2026-08-10T20:54:02.199547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.203992Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.203992Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:cd82fb3c7427e1e0fe4d6f7adca02f13db80cd53569340424c987c8e36a671bb","observation_id":"d80d1715-a930-418b-af5c-4fb7b296707a","resolution":{"observed_at":"2026-08-10T20:54:02.203992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-14T21:06:35.519870Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-08-10T20:54:02.207771Z","title":"Race: Large-scale reading comprehension dataset from examinations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.207771Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:1763901ff9e95c37b8baade1b2cf6a0020e5e264855acd6552ebff4d6a8f2390","observation_id":"867df05e-ff7f-4362-96f3-e6604ffbbaa0","resolution":{"observed_at":"2026-08-10T20:54:02.207771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.211814Z","title":"Amp: Automatically finding model parallel strategies with heterogeneity awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.211814Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:0300334584cab82357d57448b1819dc8100cf11ea150f9d3f2c1487fddfa0146","observation_id":"79945661-1790-45bd-b89b-76ecfc9a2961","resolution":{"observed_at":"2026-08-10T20:54:02.211814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-10T20:54:02.215712Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.215712Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:120f67789f21059e33fc7d9bc1bf660200d7fdae80f0466414f58e5a3cd3db66","observation_id":"72d2d7cd-df33-489b-8151-edcb3e122410","resolution":{"observed_at":"2026-08-10T20:54:02.215712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-10T20:54:02.219380Z","title":"Starcoder: may the source be with you! arXiv preprint arXiv:2305.06161, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.219380Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:2cdf8b858a0a77181842a37ddf075b6564b9c890c70f0e21df95873baefcd7a2","observation_id":"cc166aed-8f57-46ec-9290-45d1c0aabcde","resolution":{"observed_at":"2026-08-10T20:54:02.219380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03191","last_updated":"2024-11-28T13:43:50Z","snapshot_observed_at":"2026-08-14T16:19:18.071274Z","submitted_at":"2023-11-06T15:29:30Z","title":"DeepInception: Hypnotize Large Language Model to Be Jailbreaker","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03191","snapshot_observed_at":"2026-08-10T20:54:02.223259Z","title":"Deepinception: Hypnotize large language model to be jailbreaker","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.223259Z"},"links":{"cited_paper":"/paper/2311.03191","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:cd59dfe641f4a9d7627a32bdfe539e575367d6ac9845ef60c17dd2494dadefa6","observation_id":"76c1f094-4242-437c-848a-a1e86a42b946","resolution":{"observed_at":"2026-08-10T20:54:02.223259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-10T20:54:02.226972Z","title":"Textbooks are all you need ii: phi-1.5 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.226972Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:cbbd9f51a12520ac252f6d5e57c4527e12eb297625077622cd7b9fb772efa1f7","observation_id":"0c0de2d0-6fa5-46c1-9f6c-e60b38fa38d7","resolution":{"observed_at":"2026-08-10T20:54:02.226972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.230532Z","title":"Against the achilles' heel: A survey on red teaming for generative models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.230532Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:3be8fb31f92c38dd0950362c2098f42d81f65ba00cfc302d3de3fccd00cada67","observation_id":"ac1dd331-5d0f-4cb7-bf85-552a2c51d7f7","resolution":{"observed_at":"2026-08-10T20:54:02.230532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.233747Z","title":"Truthfulqa: Measuring how models mimic human falsehoods, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.233747Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:a0ed69a3843410009e606c62cb437838846ab35ab0b3e951247fa4a0bcf7dde3","observation_id":"09d746df-dcec-428f-9498-20a3734e6b20","resolution":{"observed_at":"2026-08-10T20:54:02.233747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17389","last_updated":"2023-10-26T13:35:41Z","snapshot_observed_at":"2026-08-13T05:39:52.864124Z","submitted_at":"2023-10-26T13:35:41Z","title":"ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17389","snapshot_observed_at":"2026-08-10T20:54:02.236804Z","title":"Toxicchat: Unveiling hidden challenges of toxicity detection in real-world user-ai conversation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.236804Z"},"links":{"cited_paper":"/paper/2310.17389","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:1c10f0699a33a627ca3ca21cb5d1fe51fb92dc03f507cb4a6dcbd0665addea82","observation_id":"bfd16ff5-243f-48be-8b4e-a9f4127b063a","resolution":{"observed_at":"2026-08-10T20:54:02.236804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T20:54:02.240581Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.240581Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:a02fd42399dbfedb93f55f3f635c250856848a8da7b97dad692c6edba35625b1","observation_id":"e6119b63-645e-4fc5-aba1-bc75ed39954d","resolution":{"observed_at":"2026-08-10T20:54:02.240581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.244556Z","title":"Goal-oriented prompt attack and safety evaluation for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.244556Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:e87d67a114cb34f5686cf7ab8f121be6ca37e451779f7be3dde029c0287c4dd8","observation_id":"0cd7980e-610b-49d6-befe-0a085fb9fe08","resolution":{"observed_at":"2026-08-10T20:54:02.244556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.247757Z","title":"Logiqa 2.0—an improved dataset for logical reasoning in natural language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.247757Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:c8db05def61077474fb29cfbd979ec99f2a4d5c1767003b745e83a5dea904b13","observation_id":"e21b2f94-9be7-4401-b0f4-580752f4d2f2","resolution":{"observed_at":"2026-08-10T20:54:02.247757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05499","last_updated":"2025-12-29T02:25:27Z","snapshot_observed_at":"2026-07-06T15:40:27.639368Z","submitted_at":"2023-06-08T18:43:11Z","title":"Prompt Injection attack against LLM-integrated Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05499","snapshot_observed_at":"2026-08-10T20:54:02.251901Z","title":"Prompt injection attack against llm-integrated applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.251901Z"},"links":{"cited_paper":"/paper/2306.05499","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:99bf336e419c5aff57ef297d9903fcc42d45bf81ba8359bf380d13a66a46d835","observation_id":"2ff9f191-945d-4bcf-b78b-9dc5f8da0586","resolution":{"observed_at":"2026-08-10T20:54:02.251901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06550","last_updated":"2023-12-11T17:39:00Z","snapshot_observed_at":"2026-08-13T05:04:55.673675Z","submitted_at":"2023-12-11T17:39:00Z","title":"LLM360: Towards Fully Transparent Open-Source LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06550","snapshot_observed_at":"2026-08-10T20:54:02.256160Z","title":"Llm360: Towards fully transparent open-source llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.256160Z"},"links":{"cited_paper":"/paper/2312.06550","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:b4549d4c723701259d428d6b81d69a9dcbca908fbc6a00b295b0972a13ccefff","observation_id":"542add97-136b-468a-a54b-75501854fe1a","resolution":{"observed_at":"2026-08-10T20:54:02.256160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.259959Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.259959Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:50357a039582a4df0eae46a181d775c2ae309f51d2dc87d40b99b1b31403107b","observation_id":"72ba1396-22b3-4e23-b784-47c5fab262fb","resolution":{"observed_at":"2026-08-10T20:54:02.259959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.263440Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.263440Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:acd047bf9a8592b66bd0ff1399421d64b6a2a0b4543375e5724bc58427a94484","observation_id":"5fe49e8b-9b45-41dc-8283-4ae44f9daa5c","resolution":{"observed_at":"2026-08-10T20:54:02.263440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13688","last_updated":"2023-02-14T16:33:33Z","snapshot_observed_at":"2026-08-05T20:18:14.325590Z","submitted_at":"2023-01-31T15:03:44Z","title":"The Flan Collection: Designing Data and Methods for Effective Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13688","snapshot_observed_at":"2026-08-10T20:54:02.266755Z","title":"The flan collection: Designing data and methods for effective instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.266755Z"},"links":{"cited_paper":"/paper/2301.13688","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:d926b2f63a9eb2c19cd56d3b2c5276f23aa5c39991f371785ea8ba1acafd58e5","observation_id":"3e7ff170-1ce7-4598-9f69-437e880b870b","resolution":{"observed_at":"2026-08-10T20:54:02.266755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-10T20:54:02.270581Z","title":"Starcoder 2 and the stack v2: The next generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.270581Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:00f5d41c35795b251594614dcd92d75da30dfd0b5ebb0cf5c0c55003f0ccd3bf","observation_id":"b51fcd39-1874-432e-b5b8-36942066a195","resolution":{"observed_at":"2026-08-10T20:54:02.270581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-10T20:54:02.274300Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.274300Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:2b6a541e09b3d3f311a40bcce79c7d938f0be1f349d113fb3c46f30ab14d9c4c","observation_id":"3ea9b17c-4447-4e72-86c2-1e3b52be9c68","resolution":{"observed_at":"2026-08-10T20:54:02.274300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.277701Z","title":"Introducing meta llama 3: The most capable openly available llm to date, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.277701Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:7fd8f917659ea740b37a4238204616159d74c82f7af8c567086aa7fdbb297f06","observation_id":"5a7f8115-75e3-4b52-898b-ec1748c49fa7","resolution":{"observed_at":"2026-08-10T20:54:02.277701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.281307Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.281307Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:932914b786aaef5c64a4e5d2124532fa6bf92e0013ad3ded36962d4d10c17455","observation_id":"f846330e-948a-4a92-b447-9ce66143fda4","resolution":{"observed_at":"2026-08-10T20:54:02.281307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01786","last_updated":"2023-05-29T16:40:37Z","snapshot_observed_at":"2026-08-14T23:23:23.284660Z","submitted_at":"2022-11-03T13:19:32Z","title":"Crosslingual Generalization through Multitask Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01786","snapshot_observed_at":"2026-08-10T20:54:02.285019Z","title":"Crosslingual generalization through multitask finetuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.285019Z"},"links":{"cited_paper":"/paper/2211.01786","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:e89b40c1f59ffc0229bcd404bd7e3798acade05c1deb4bd8b4bb02e70c4abd39","observation_id":"353657b0-39cc-4b40-83df-16a9c7bab53d","resolution":{"observed_at":"2026-08-10T20:54:02.285019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07124","last_updated":"2024-02-18T09:46:06Z","snapshot_observed_at":"2026-08-13T10:34:55.330090Z","submitted_at":"2023-08-14T13:53:54Z","title":"OctoPack: Instruction Tuning Code Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07124","snapshot_observed_at":"2026-08-10T20:54:02.288356Z","title":"Octopack: Instruction tuning code large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.288356Z"},"links":{"cited_paper":"/paper/2308.07124","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:4b94bee12dcd34e0b8fa7b1ba43aff5a7e00f015ed6131cfca59e9f865dc1915","observation_id":"12aa9019-3dc4-4a0f-87c8-8a55e4c1961f","resolution":{"observed_at":"2026-08-10T20:54:02.288356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-08-15T00:07:51.079800Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-10T20:54:02.291740Z","title":"Olmoe: Open mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.291740Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:db8b583c13001b3dbef39a44ffcaf406f0455200e51db324078593543ff13eaa","observation_id":"bcd71929-54f8-4010-a38a-41c0d3be8ac2","resolution":{"observed_at":"2026-08-10T20:54:02.291740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.295140Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.295140Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:7fab69bc368b8d5b54694832e9c1f369928706f40845ca2085835103705c6626","observation_id":"c43956bb-d0ef-41bb-9819-4b5c5f1fae0a","resolution":{"observed_at":"2026-08-10T20:54:02.295140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.298396Z","title":"Pipedream: Generalized pipeline parallelism for dnn training","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.298396Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:6ac43ce985649bc528b145f1a1e3e11f7f56d4aec5055bded478c752e4390f17","observation_id":"feb5e4f5-1390-458c-ada9-a52aea10514a","resolution":{"observed_at":"2026-08-10T20:54:02.298396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.302336Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.302336Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:aea885daac8994edbc51713d23cb96591d7389d6e320720bcbb3a6f5d06e2f82","observation_id":"6412da5c-14a2-4153-ad18-0a6f1342978c","resolution":{"observed_at":"2026-08-10T20:54:02.302336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.306122Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.306122Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:4eabcad3bdab20c6b6748c33ac70424d6fddaf023283cbdcc8b35e9d07bf88cc","observation_id":"de3f0b55-32de-4602-9e3a-e9848c6574c9","resolution":{"observed_at":"2026-08-10T20:54:02.306122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.310216Z","title":"Grok-1: Explainable ai system","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.310216Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:3b3f774f8454c2fbf0f4af67015a918ba5dec14b82b59e5b9f463aa2e6718047","observation_id":"f67a740a-c36b-407b-a5f7-5bee299582d3","resolution":{"observed_at":"2026-08-10T20:54:02.310216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12387","last_updated":"2024-04-18T17:59:48Z","snapshot_observed_at":"2026-08-13T00:27:11.609683Z","submitted_at":"2024-04-18T17:59:48Z","title":"Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12387","snapshot_observed_at":"2026-08-10T20:54:02.313497Z","title":"Reka core, flash, and edge: A series of powerful multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.313497Z"},"links":{"cited_paper":"/paper/2404.12387","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:76980fbc9e27bcecc769ccf28c5adbf35aafe2fae24eed8a8a308a8ba6ae1cdb","observation_id":"f7a866fc-febe-41f6-8dce-43297f6a59de","resolution":{"observed_at":"2026-08-10T20:54:02.313497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.316876Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.316876Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:5f1addabbe8f95f14cf966c6d5c7e2ce4ec9e07528b446230d4d6724703584a5","observation_id":"023d7c34-7e5c-4458-95b9-03a59bda5e8a","resolution":{"observed_at":"2026-08-10T20:54:02.316876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16819","last_updated":"2024-02-27T15:22:57Z","snapshot_observed_at":"2026-08-13T04:09:48.475736Z","submitted_at":"2024-02-26T18:43:45Z","title":"Nemotron-4 15B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16819","snapshot_observed_at":"2026-08-10T20:54:02.320492Z","title":"Nemotron-4 15b technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.320492Z"},"links":{"cited_paper":"/paper/2402.16819","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:38bc14f65efd994d1be0e0ed114a09ae32af03f7ae5cc965b907e7a3b442c6f1","observation_id":"a43284d0-6a4f-4d19-8bfb-f6b2e6f56e71","resolution":{"observed_at":"2026-08-10T20:54:02.320492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08193","last_updated":"2022-03-16T01:35:45Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T16:43:46Z","title":"BBQ: A Hand-Built Bias Benchmark for Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08193","snapshot_observed_at":"2026-08-10T20:54:02.323853Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.323853Z"},"links":{"cited_paper":"/paper/2110.08193","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:5f4573008294fa8ce69463c3742f47e9ca6319380477820fafab76146165bca8","observation_id":"2058f417-e1a3-47d0-9406-3be02f93d793","resolution":{"observed_at":"2026-08-10T20:54:02.323853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:02.327870Z","title":"Openwebmath: An open dataset of high-quality mathematical web text, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.327870Z"},"links":{"citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:a01c00900ab3173f3902c9bae7826a6bd4caa7299da392395cb1fc8dd7080d28","observation_id":"3d2c8ee2-1ab4-44e5-b939-561b88c95719","resolution":{"observed_at":"2026-08-10T20:54:02.327870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10350","last_updated":"2021-04-23T14:26:29Z","snapshot_observed_at":"2026-07-06T11:02:18.405330Z","submitted_at":"2021-04-21T04:44:25Z","title":"Carbon Emissions and Large Neural Network Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10350","snapshot_observed_at":"2026-08-10T20:54:02.331862Z","title":"Carbon emissions and large neural network training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:02.331862Z"},"links":{"cited_paper":"/paper/2104.10350","citing_paper":"/paper/2501.07124"},"observation_digest":"sha256:d986dbcccf14897d31228ea6d1e1954d06f1d6daf9522a9daa5ce7033e20e8df","observation_id":"c7372d9d-0fc7-49d3-9f4e-1f76f1322290","resolution":{"observed_at":"2026-08-10T20:54:02.331862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":165},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 165 outbound references and 4 inbound Pith citation observations for arXiv:2501.07124."}