{"as_of":"2026-08-17T23:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:762b704466156022317bc7148894f8ec1d5128f58ba0f3649b242041c640edd4","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:32:06.165668Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:03:29.441119Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T08:02:25.041239Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15431","snapshot_observed_at":"2026-08-15T20:03:29.441119Z","title":"InProceedings of the Sec- ond Workshop on Trolling, Aggression and Cyberbul- lying, pages 132–136, Marseille, France","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13513","last_updated":"2025-06-16T14:08:23Z","snapshot_observed_at":"2026-08-17T00:44:07.238388Z","submitted_at":"2025-06-16T14:08:23Z","title":"K/DA: Automated Data Generation Pipeline for Detoxifying Implicitly Offensive Language in Korean","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:29.441119Z"},"links":{"cited_paper":"/paper/2504.15431","citing_paper":"/paper/2506.13513"},"observation_digest":"sha256:ecc7fe73363d827142c95b81b5db4695a8b0e109cd864278f3764cc4d04c8293","observation_id":"cee8e276-868b-439f-9936-ef9122f21985","resolution":{"observed_at":"2026-08-15T20:03:29.441119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15431","snapshot_observed_at":"2026-08-15T15:52:00.680376Z","title":"Trillion 7b technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21013","last_updated":"2026-07-01T00:59:13Z","snapshot_observed_at":"2026-08-16T11:56:42.286800Z","submitted_at":"2025-09-25T11:20:38Z","title":"Predicting LLM Reasoning Performance with Small Proxy Model","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:00.680376Z"},"links":{"cited_paper":"/paper/2504.15431","citing_paper":"/paper/2509.21013"},"observation_digest":"sha256:706c32e7a26fa77bf29a1486f714222d377de2a73eab4ee87b043f2fcdf192a4","observation_id":"2fbfaac3-093a-4bbd-b242-cc0e700716c4","resolution":{"observed_at":"2026-08-15T15:52:00.680376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"cited_work":{"arxiv_id":"2504.15431","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15431","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2504.15431","venue":null,"work_id":"f32958c0-5664-42dc-a81e-f0b3eb772f0a","year":null},"citing_paper":{"arxiv_id":"2604.16235","last_updated":"2026-04-17T16:53:14Z","snapshot_observed_at":"2026-08-05T13:25:08.254604Z","submitted_at":"2026-04-17T16:53:14Z","title":"Optimizing Korean-Centric LLMs via Token Pruning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T07:59:57.505776Z"},"links":{"cited_paper":"/paper/2504.15431","citing_paper":"/paper/2604.16235"},"observation_digest":"sha256:0af58ba856d78bd5bf606cd010a1f370a9a8a6bcfc0dd59042954c7de1106d73","observation_id":"f5ad7615-def5-4240-a127-7a9f6a04bda4","resolution":{"observed_at":"2026-05-10T08:02:25.042527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.15431/citation-record","integrity":"/paper/2504.15431/integrity","json":"/paper/2504.15431/citation-record.json","paper":"/paper/2504.15431"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-16T11:32:05.835060Z","title":"Austin, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.835060Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:473d23768f68b218d48391310db35282e7b8be9b99c11bb6d8b3f3f0cf5b9649","observation_id":"04bcd168-fc58-4b6e-ab23-7b644ff77eb0","resolution":{"observed_at":"2026-08-16T11:32:05.835060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-08-16T13:45:47.666351Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-16T11:32:05.839964Z","title":"Blakeney, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.839964Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:6d852d31b96b194d28b0747bb7ff8b9e04c8ebd2492f14f0fb2d7f1eba08cef2","observation_id":"3e7ade0a-6bfe-48a3-9f91-44de13f1efe8","resolution":{"observed_at":"2026-08-16T11:32:05.839964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T11:32:05.844076Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.844076Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:142812246133bbeabf4a5cb237bec0df66d2d27b0772656aac903c8d432ba816","observation_id":"e0677841-d2d8-4ad6-acdc-cd7493fce581","resolution":{"observed_at":"2026-08-16T11:32:05.844076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-16T11:32:05.848367Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.848367Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:c2387682685da2bd21c5a7010dda959bdd759d3767d4ede24a00560c30ebdfe6","observation_id":"2b280196-efb6-4587-9893-72abba6e6cf9","resolution":{"observed_at":"2026-08-16T11:32:05.848367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:32:05.852567Z","title":"Chiang, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.852567Z"},"links":{"citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:62f154ac864d131a921f02de5c888627999805d5020a91900256b830a68b3459","observation_id":"dfb5884a-4314-4699-b180-d9363a12e695","resolution":{"observed_at":"2026-08-16T11:32:05.852567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-16T11:32:05.856367Z","title":"Clark, I","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.856367Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:6224d2d001a471f1b6e25e0de4633bf542b539d2c68ecf85126ec673642d022e","observation_id":"16e3dbd2-70b4-4fb6-8096-07d41f25dfdc","resolution":{"observed_at":"2026-08-16T11:32:05.856367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T11:32:05.864732Z","title":"Cobbe, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.864732Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:8762ad63c7a86916c7e0181cb29f901a0fce426250c6c39cd575add7451661b1","observation_id":"cf3e3ddc-25c2-4c88-bcd6-5e77402e3270","resolution":{"observed_at":"2026-08-16T11:32:05.864732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-16T11:32:05.868867Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.868867Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:b49f51496c719eac797cdfe3f40528bc9aeb2fa22a4be25410deb0b9c63b7ee3","observation_id":"a8fc0701-5a0a-4623-a5ec-6d91747f6277","resolution":{"observed_at":"2026-08-16T11:32:05.868867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-16T11:32:05.872924Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.872924Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:0a3dd1a29e33a2163f2ecf74801426faea036529cad81874b3262f37ad332057","observation_id":"9ce578b1-3417-427f-b679-7ad00e07a1f7","resolution":{"observed_at":"2026-08-16T11:32:05.872924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15796","last_updated":"2025-01-15T02:48:59Z","snapshot_observed_at":"2026-08-16T14:07:07.590212Z","submitted_at":"2024-03-23T11:03:31Z","title":"Understanding Emergent Abilities of Language Models from the Loss Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15796","snapshot_observed_at":"2026-08-16T11:32:05.876823Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.876823Z"},"links":{"cited_paper":"/paper/2403.15796","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:ca5d8f89ddeb88579d081b8d80aeb6a7001499f7f20508d38643e0a2513ec532","observation_id":"37f6ba26-cf76-476a-9c59-829f10b6e539","resolution":{"observed_at":"2026-08-16T11:32:05.876823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:32:05.880611Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.880611Z"},"links":{"citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:01c29140e4b70d03a8a8875f9fe6add69e032ca3fe2b12b4d60b0b505c5cfa3c","observation_id":"f07ec0b1-dc1e-439e-9b37-f5dec4c983d0","resolution":{"observed_at":"2026-08-16T11:32:05.880611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-16T23:36:44.216328Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-16T11:32:05.884077Z","title":"Gloeckle, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.884077Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:231e5bbea78bea749ce59ecae97c93cb1c0c5eb1bca79b3b355fd1802b225433","observation_id":"87af04c1-cf21-4bf6-816e-7e81b8487fdf","resolution":{"observed_at":"2026-08-16T11:32:05.884077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T11:32:05.887890Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.887890Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:aa85a4e23dd885f8f35fd0f97682c74cedaab68df9f03a4666a9c4b295ce246c","observation_id":"f777e512-1719-4c02-a976-7d46f8c2a88d","resolution":{"observed_at":"2026-08-16T11:32:05.887890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-16T11:32:05.892108Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.892108Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:78f73e89fccf4561c02f523e1788e67669b9d7cf599ecd72ed6fd5a873d5baa5","observation_id":"18f3bfa6-9745-478f-8b5c-089c8c9801f7","resolution":{"observed_at":"2026-08-16T11:32:05.892108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-16T11:32:05.895903Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.895903Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:7337a8db9826a7c87a6af4e77219698d4e0bbe8bcf12d7e46cd350d670e5f5be","observation_id":"a8fefd73-6801-40bd-8a0a-03567bb75651","resolution":{"observed_at":"2026-08-16T11:32:05.895903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:32:07.238946Z","title":"Hendrycks, C","venue":null,"work_id":"c6c7115f-762d-4717-88b2-375917e80733","year":2021},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.899066Z"},"links":{"citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:c9d7f5f9a483d23daba79f7a32e5e4e4b41dee7042785d0a7d46856f6f22537c","observation_id":"97987a3b-2c2e-4cfa-91a5-0b02f3d359f9","resolution":{"observed_at":"2026-08-16T11:32:07.243146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-16T11:32:05.902311Z","title":"Hoffmann, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.902311Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:52fbfd5b0b2ac3f21c3c143f18d2a4f45923130c415da150b14ac14c81ab7668","observation_id":"5436b784-4f44-4e04-8087-cfdbc89cd0f9","resolution":{"observed_at":"2026-08-16T11:32:05.902311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-16T11:32:05.905684Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.905684Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:7c66309954d4d46ab85bdbc2c69d814a0a5ac8c92035b4ffb43be0f1dbb75727","observation_id":"ffec1bd2-d350-4dfd-86cb-e43d6f7adb55","resolution":{"observed_at":"2026-08-16T11:32:05.905684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-08-16T13:48:31.034274Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-16T11:32:05.909089Z","title":"Hägele, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.909089Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:0cecde488de9c4fa57bdbf38f68e4020f4f31ed9ca317a85359462aea50ac092","observation_id":"0b1cf965-f320-43ba-be7d-75782d723954","resolution":{"observed_at":"2026-08-16T11:32:05.909089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:32:07.226543Z","title":null,"venue":null,"work_id":"774b942f-9c6d-4784-848d-66846bd898e7","year":2022},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.912991Z"},"links":{"citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:f4fda3ebc892494ae05b3d2ffa720f8212123d8c8b6f8a80c432e3f4d8a8cd77","observation_id":"9023e88b-6531-4c36-820c-3cd9b907acaf","resolution":{"observed_at":"2026-08-16T11:32:07.230768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T11:32:05.917270Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.917270Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:64982aef044ff80a40fd39f96c857b71acf6776233c26035642a8f8cb205c221","observation_id":"20c231ad-60ae-4a14-8c63-74098a47dfb8","resolution":{"observed_at":"2026-08-16T11:32:05.917270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19103","snapshot_observed_at":"2026-08-16T11:32:05.921550Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.921550Z"},"links":{"cited_paper":"/paper/2411.19103","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:125e28f6b25e86352acd43f6c533924d2950b6e3b008bb19e79f6f94c6b112d5","observation_id":"2583fd38-dae0-441c-9b15-995c90ca35da","resolution":{"observed_at":"2026-08-16T11:32:05.921550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T11:32:05.925276Z","title":"Kaplan, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.925276Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:cf11ecdd36bfe376704b1d815464ce33291c81296349902021eaad02788ed5a7","observation_id":"e98d4396-fb00-41c4-a1ae-6649fdb09f54","resolution":{"observed_at":"2026-08-16T11:32:05.925276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:32:07.214635Z","title":null,"venue":null,"work_id":"737229e8-d0b6-4499-99cf-d466ffba8f4c","year":1999},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.929369Z"},"links":{"citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:2c1ee0d11789fb2a99c84d4777d50b026d85566bb4b2f5ec1dab5ec432fda61a","observation_id":"de5f98e3-f64f-4fca-80c8-a08cafd9f3da","resolution":{"observed_at":"2026-08-16T11:32:07.218738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04650","last_updated":"2021-11-28T10:56:27Z","snapshot_observed_at":"2026-08-16T17:57:38.268815Z","submitted_at":"2021-09-10T03:32:19Z","title":"What Changes Can Large-scale Language Models Bring? Intensive Study on HyperCLOVA: Billions-scale Korean Generative Pretrained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.04650","snapshot_observed_at":"2026-08-16T11:32:05.932970Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.932970Z"},"links":{"cited_paper":"/paper/2109.04650","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:c5cb4dc6a750167a436c0af2504befa928fad67990fe54bf050b32c50be49643","observation_id":"06623267-7a52-4679-af2d-ef38e62055c3","resolution":{"observed_at":"2026-08-16T11:32:05.932970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:32:07.200905Z","title":null,"venue":null,"work_id":"3d25883c-464c-4f60-adc1-d75574e7c3a6","year":null},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.937281Z"},"links":{"citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:b5d5994f23ebe7bdfa2b875d7a081dad4b06be02ee31949b71af826a5b0903c0","observation_id":"188d4b17-d28b-4d31-9102-68a398888846","resolution":{"observed_at":"2026-08-16T11:32:07.205847Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-16T13:44:47.609069Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-16T11:32:05.941324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.941324Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:970df1cfffbd7dec833c566e71e2d9e4ed265b7e9bc5d52acfe1897adbb5df5e","observation_id":"022857c0-015a-464c-bfbd-d7c1624d3580","resolution":{"observed_at":"2026-08-16T11:32:05.941324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-16T13:55:51.395455Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-16T11:32:05.945961Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.945961Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:be84db48fa25120e2d68dce867a4ebd0df2d4292919e5d66aaf7404e5096960b","observation_id":"6f389968-28ad-466b-bb34-36db4df252fc","resolution":{"observed_at":"2026-08-16T11:32:05.945961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02254","last_updated":"2023-06-06T03:27:33Z","snapshot_observed_at":"2026-08-16T15:26:50.074570Z","submitted_at":"2023-06-04T04:04:04Z","title":"A Technical Report for Polyglot-Ko: Open-Source Large-Scale Korean Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02254","snapshot_observed_at":"2026-08-16T11:32:05.950467Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.950467Z"},"links":{"cited_paper":"/paper/2306.02254","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:4e2c459dc94e83a73312ac72fe95f97387bb17197c7429692d9e866bd64cc42c","observation_id":"e3140f0b-9a9a-4ce7-a779-303ddef43b1d","resolution":{"observed_at":"2026-08-16T11:32:05.950467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02448","last_updated":"2025-01-31T07:32:07Z","snapshot_observed_at":"2026-08-16T12:59:42.986521Z","submitted_at":"2025-01-05T05:57:22Z","title":"Understand, Solve and Translate: Bridging the Multilingual Mathematical Reasoning Gap","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02448","snapshot_observed_at":"2026-08-16T11:32:05.955784Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.955784Z"},"links":{"cited_paper":"/paper/2501.02448","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:f8c523717d455140463c426ed9344a552057d863a12683a4dd1e0c514e3efd3f","observation_id":"ed4495f9-e541-4059-99a8-a9c2424c6c26","resolution":{"observed_at":"2026-08-16T11:32:05.955784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07327","last_updated":"2023-10-31T11:38:07Z","snapshot_observed_at":"2026-08-16T15:40:20.636325Z","submitted_at":"2023-04-14T18:01:29Z","title":"OpenAssistant Conversations -- Democratizing Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07327","snapshot_observed_at":"2026-08-16T11:32:05.960061Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.960061Z"},"links":{"cited_paper":"/paper/2304.07327","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:a615293257c2346809c30113e41770d5c232b1a6f186036398ee288d55745a02","observation_id":"28a08679-a95b-47b9-b40c-ab7252959343","resolution":{"observed_at":"2026-08-16T11:32:05.960061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-16T11:32:05.963941Z","title":"Lambert, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.963941Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:c9e51a66b7ac64d8754eff1fb1f33bfe4d098e0db869d92b8d986c7fb8d42c02","observation_id":"b0b100b1-83da-4a04-bbdd-085f3c9be74a","resolution":{"observed_at":"2026-08-16T11:32:05.963941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03782","last_updated":"2025-06-05T17:58:57Z","snapshot_observed_at":"2026-08-17T22:33:49.443304Z","submitted_at":"2024-12-05T00:05:11Z","title":"The broader spectrum of in-context learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03782","snapshot_observed_at":"2026-08-16T11:32:05.968242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.968242Z"},"links":{"cited_paper":"/paper/2412.03782","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:71e6ec9574cababa622604e4e191ef85f980fefe5a01ca4ce2e237f63350c1cc","observation_id":"908e76b1-75a8-4102-84ab-fdc0b78a0328","resolution":{"observed_at":"2026-08-16T11:32:05.968242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04541","last_updated":"2022-03-21T17:57:13Z","snapshot_observed_at":"2026-08-16T17:50:40.088634Z","submitted_at":"2021-10-09T11:05:16Z","title":"The Inductive Bias of In-Context Learning: Rethinking Pretraining Example Design","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04541","snapshot_observed_at":"2026-08-16T11:32:05.972119Z","title":"Levine, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.972119Z"},"links":{"cited_paper":"/paper/2110.04541","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:c936c128d53ba38d372b2219332215e52843f79bd246d8be5b66ed30965c3e79","observation_id":"a608e41d-3d75-4d21-8021-033cc9064d1a","resolution":{"observed_at":"2026-08-16T11:32:05.972119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-16T11:32:05.975999Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.975999Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:d785d55daa739007e96edc5eb873eefa75024eebdae6bd69b6c49853ea7a5913","observation_id":"3c78c0d4-416b-49fe-89b9-05eb82d5641a","resolution":{"observed_at":"2026-08-16T11:32:05.975999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-16T11:32:05.979888Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.979888Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:0dc23f5684df889a73189e9ebb529e6f976f323352388b03a1b9124e4dc479ba","observation_id":"fcba55e9-0962-4d6a-8d92-17362f4b694d","resolution":{"observed_at":"2026-08-16T11:32:05.979888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13169","last_updated":"2023-11-13T14:50:06Z","snapshot_observed_at":"2026-08-16T15:31:01.501526Z","submitted_at":"2023-05-22T15:57:53Z","title":"A Pretrainer's Guide to Training Data: Measuring the Effects of Data Age, Domain Coverage, Quality, & Toxicity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13169","snapshot_observed_at":"2026-08-16T11:32:05.984232Z","title":"Longpre, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.984232Z"},"links":{"cited_paper":"/paper/2305.13169","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:0ec9c84c8a801a8e1808ec5114aa6377e76c5404dc2bbe701e7cae1e0d7bd3d6","observation_id":"0bdd92bb-6bdf-46d2-9552-b3e586dd9189","resolution":{"observed_at":"2026-08-16T11:32:05.984232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01786","last_updated":"2023-05-29T16:40:37Z","snapshot_observed_at":"2026-08-17T05:58:22.357239Z","submitted_at":"2022-11-03T13:19:32Z","title":"Crosslingual Generalization through Multitask Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01786","snapshot_observed_at":"2026-08-16T11:32:05.988429Z","title":"Muennighoff, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.988429Z"},"links":{"cited_paper":"/paper/2211.01786","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:58dba9d71d7d8d96068a864df54fd315d280de21713213164a811f62e4605084","observation_id":"f3ed91ed-1d82-4afe-9749-bd44bc95ba28","resolution":{"observed_at":"2026-08-16T11:32:05.988429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-17T13:58:40.683829Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-16T11:32:05.991938Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.991938Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:8c007671759a603b41915f91db5b80644fd8ad236efeb64125d4131c9e705e67","observation_id":"b8bd1b4c-0b7f-4177-9b81-3570c16ebc27","resolution":{"observed_at":"2026-08-16T11:32:05.991938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:32:05.996464Z","title":"Achiam, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.996464Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:d157490a85a2a9f1bd4f6664b33a1a7edb5f1cfbc8ed3fc6f0cb960168bb4b55","observation_id":"e526c803-8d8d-4788-bed3-c077e203c9a4","resolution":{"observed_at":"2026-08-16T11:32:05.996464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.03030","last_updated":"2019-07-18T18:09:19Z","snapshot_observed_at":"2026-08-17T03:15:47.107921Z","submitted_at":"2019-05-08T12:27:20Z","title":"Meta-learning of Sequential Strategies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.03030","snapshot_observed_at":"2026-08-16T11:32:06.000041Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.000041Z"},"links":{"cited_paper":"/paper/1905.03030","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:29182942f8240c9ae5fa216c6682c69b3e9c6d248aee101830039a67698f87dc","observation_id":"3e52e8f0-f052-4a6f-94b7-af56ab106407","resolution":{"observed_at":"2026-08-16T11:32:06.000041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.57967/hf/2440","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:32:06.204792Z","title":null,"venue":null,"work_id":"6eeaccee-bca2-4ead-bca6-45c85f11d319","year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.004180Z"},"links":{"citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:32c30854d12af844ad4cda6b15bda439f2e9f0094fee91d323dca03d68a7ba48","observation_id":"512164ec-3ca0-4d6d-ac65-438799578762","resolution":{"observed_at":"2026-08-16T11:32:06.209619Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-14T14:43:02.130172Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-16T11:32:06.008010Z","title":"Penedo, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.008010Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:f3383883988fcd9867740f36b608a35c7fc42af2ff0d88fa143d322da7d97187","observation_id":"faf613a1-7174-418d-a56d-26f693e12696","resolution":{"observed_at":"2026-08-16T11:32:06.008010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04556","last_updated":"2025-02-25T17:31:36Z","snapshot_observed_at":"2026-08-16T13:20:39.792531Z","submitted_at":"2024-09-06T18:33:38Z","title":"How Does Code Pretraining Affect Language Model Task Performance?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04556","snapshot_observed_at":"2026-08-16T11:32:06.012307Z","title":"Petty, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.012307Z"},"links":{"cited_paper":"/paper/2409.04556","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:64cb6751a94269ec8ef00fa2925ff46e908d010d0ddabc1978de70e922db0291","observation_id":"8cb7fc23-b309-425f-8368-199465a71f3d","resolution":{"observed_at":"2026-08-16T11:32:06.012307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-16T11:32:06.016567Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.016567Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:524c2111f1db39d5f9b399054bf732cf8b8c12869e7ad6cfdec911db318ba86d","observation_id":"ce8c4e26-4717-4871-9077-b7dac5914548","resolution":{"observed_at":"2026-08-16T11:32:06.016567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-16T11:32:06.022005Z","title":"Rafailov, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.022005Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:dc98e65a32186b1e3d67cf25e2a51f7136984609d147b55db1eae5ad7bf4a68c","observation_id":"44d3132a-8b98-44d7-9bd0-2609dccf8122","resolution":{"observed_at":"2026-08-16T11:32:06.022005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-16T07:06:07.822225Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-16T11:32:06.027360Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.027360Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:dbce413d644e4df853dc7f7cbf5f16112f1fdfa8c2c393e4a4c95d0874c811d0","observation_id":"1389ae17-385e-48d8-8f5f-8cfe6e1563ff","resolution":{"observed_at":"2026-08-16T11:32:06.027360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:32:07.186755Z","title":null,"venue":null,"work_id":"65710a28-04a7-4301-b604-243086a4268a","year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.032644Z"},"links":{"citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:44aac9d226c7c501bd2cb8a222d0a2a410c1ac39172ae117de799547663eb451","observation_id":"eeb02b56-a3d5-4d8c-ac6c-51a1d3316109","resolution":{"observed_at":"2026-08-16T11:32:07.191707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:32:06.037274Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.037274Z"},"links":{"citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:c4769c83518c905ef3e967df5ee42941d9d33450422584e1698488dca3d158c5","observation_id":"6ab76ca2-8a06-4f39-9079-e7b196f1c8db","resolution":{"observed_at":"2026-08-16T11:32:06.037274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:32:06.042593Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.042593Z"},"links":{"citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:a9ebea7f0bc5e3ae09c250c019fef52105945a8606c5985e32b9a32020326b30","observation_id":"bc5b5dcc-ebf0-454c-990a-f817d06271f9","resolution":{"observed_at":"2026-08-16T11:32:06.042593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12560","last_updated":"2025-02-21T14:41:19Z","snapshot_observed_at":"2026-08-16T12:57:27.460553Z","submitted_at":"2025-02-18T05:54:56Z","title":"How does a Language-Specific Tokenizer affect LLMs?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12560","snapshot_observed_at":"2026-08-16T11:32:06.046705Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.046705Z"},"links":{"cited_paper":"/paper/2502.12560","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:40c247e8d30f0ee716685ae2ddfbab9bde364ad0311039be0b3188060f6bd9ac","observation_id":"42f24c84-d62d-452c-9fab-c9378463a0f9","resolution":{"observed_at":"2026-08-16T11:32:06.046705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T11:32:06.050657Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.050657Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:0e8d5cf64cf785ae1d8ee599149c7bfcd4a7b73098dd736b54edd0d1571eae3f","observation_id":"9e5d18b3-d643-43be-a45d-a8543a105b28","resolution":{"observed_at":"2026-08-16T11:32:06.050657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-16T11:32:06.054535Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.054535Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:b1f8f91ba51b6eeee0442dce8d87fab3beebf342dd025b3dbc190e78363a8609","observation_id":"52983d57-b6e5-490e-98cc-8c3ab1eac37b","resolution":{"observed_at":"2026-08-16T11:32:06.054535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-16T11:32:06.058584Z","title":"Shoeybi, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.058584Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:5bbaeaf3dd0848d615739c1526f7ff3796a26246da0e1ccd4cd47ec01060c037","observation_id":"bf18a09f-c2c9-4bba-9b68-02a053024571","resolution":{"observed_at":"2026-08-16T11:32:06.058584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03304","last_updated":"2025-02-19T13:30:23Z","snapshot_observed_at":"2026-08-11T22:30:47.514883Z","submitted_at":"2024-12-04T13:27:09Z","title":"Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03304","snapshot_observed_at":"2026-08-16T11:32:06.062578Z","title":"Singh, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.062578Z"},"links":{"cited_paper":"/paper/2412.03304","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:22932dac1cd0183abdd3ba9951078f585cd6734cc48db8785c4e5520c07fc92a","observation_id":"de166877-9114-4b9b-93a3-b45a2db4e221","resolution":{"observed_at":"2026-08-16T11:32:06.062578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02706","last_updated":"2024-03-20T16:56:48Z","snapshot_observed_at":"2026-08-16T15:02:58.494523Z","submitted_at":"2023-09-06T04:38:16Z","title":"HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02706","snapshot_observed_at":"2026-08-16T11:32:06.066391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.066391Z"},"links":{"cited_paper":"/paper/2309.02706","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:89c329b2a0d9d59bba2938923fc7d567ed3671739c0edd2a4042284ef1e4de49","observation_id":"4b75a84f-1207-41fb-b1cb-41747e08530b","resolution":{"observed_at":"2026-08-16T11:32:06.066391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11548","last_updated":"2024-06-06T12:23:58Z","snapshot_observed_at":"2026-08-16T14:17:37.398281Z","submitted_at":"2024-02-18T11:41:07Z","title":"KMMLU: Measuring Massive Multitask Language Understanding in Korean","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11548","snapshot_observed_at":"2026-08-16T11:32:06.070319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.070319Z"},"links":{"cited_paper":"/paper/2402.11548","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:21b8ebb7143388fedcd401c37665d0bf29f4c269f95bea27120c9aab602f93c8","observation_id":"18cbc2a5-7bc6-4d32-917f-7017b0c656e9","resolution":{"observed_at":"2026-08-16T11:32:06.070319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-16T11:32:06.074336Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.074336Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:3121dca61c7c846e1f40036763918680c502e762cf500dc346330f8e031031e0","observation_id":"d5ab652a-d770-4291-9a76-b7501cfa6e1f","resolution":{"observed_at":"2026-08-16T11:32:06.074336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-16T11:32:06.079010Z","title":"Suzgun, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.079010Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:7200dc777070e75c0417ac4be5e0358f65a85033f8f4af08ec29c61a333a9bf1","observation_id":"1652c657-4c63-43ea-8e8d-05ef74895200","resolution":{"observed_at":"2026-08-16T11:32:06.079010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13623","last_updated":"2024-11-01T02:41:36Z","snapshot_observed_at":"2026-08-16T13:33:00.004600Z","submitted_at":"2024-07-18T15:58:54Z","title":"Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13623","snapshot_observed_at":"2026-08-16T11:32:06.083327Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.083327Z"},"links":{"cited_paper":"/paper/2407.13623","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:de80c2dadcb43e6b6c47273baf343015b32de2fcb3b3e71fe75b01e099dcab68","observation_id":"d184b6cd-05a8-427b-9dbc-ef1c9c4c192b","resolution":{"observed_at":"2026-08-16T11:32:06.083327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-16T11:32:06.087951Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.087951Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:aa48a62f81fc186c172024aaa8a85f412b6ada7f1263072b194bdf7bee367349","observation_id":"bba9d950-6d05-48de-8787-f83a143b1e49","resolution":{"observed_at":"2026-08-16T11:32:06.087951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T11:32:06.092680Z","title":"Touvron, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.092680Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:3ca9d402f3fee3e913689eb83d0f0f371cab4266a2d008691685ad3a2027c842","observation_id":"6fc76b5f-3572-4ee2-b5df-a9c827417d23","resolution":{"observed_at":"2026-08-16T11:32:06.092680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-17T01:19:18.409791Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-16T11:32:06.096974Z","title":"Vaswani, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.096974Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:9ca887936a25e771f9aa678a272a0bf7d7485dfccfaa784bc1991945455d1dab","observation_id":"799cd68c-d325-4194-b8f2-cb656789a260","resolution":{"observed_at":"2026-08-16T11:32:06.096974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01801","last_updated":"2025-04-22T06:19:26Z","snapshot_observed_at":"2026-08-16T12:44:33.685062Z","submitted_at":"2025-04-02T15:09:58Z","title":"Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01801","snapshot_observed_at":"2026-08-16T11:32:06.102511Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.102511Z"},"links":{"cited_paper":"/paper/2504.01801","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:8a36e7ee2b29fd0217e8a9386bb08e258ed7a952a235b028bb97ca9497e5db61","observation_id":"75daefeb-1c33-4e0e-b899-b03e1ca80958","resolution":{"observed_at":"2026-08-16T11:32:06.102511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10588","last_updated":"2024-06-08T11:15:14Z","snapshot_observed_at":"2026-08-17T04:04:31.196189Z","submitted_at":"2024-02-16T11:21:28Z","title":"Do Llamas Work in English? On the Latent Language of Multilingual Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10588","snapshot_observed_at":"2026-08-16T11:32:06.106379Z","title":"Wendler, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.106379Z"},"links":{"cited_paper":"/paper/2402.10588","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:a9583cdd008ae8d6e955ce8c558ea0ed407195e0dbc4c21512a73ee6332b0fc3","observation_id":"721d49f8-5c5c-48c4-aaa2-a2049a30770a","resolution":{"observed_at":"2026-08-16T11:32:06.106379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-16T11:32:06.110113Z","title":"Workshop, :, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.110113Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:1b6170f6ec61d3f20767789ea8767b772afe394ff9dc662b15cd3c7edf6d4663","observation_id":"274b361e-4245-4f1b-b5ad-35630e64a27c","resolution":{"observed_at":"2026-08-16T11:32:06.110113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05482","last_updated":"2022-07-01T23:48:19Z","snapshot_observed_at":"2026-08-16T17:15:31.660459Z","submitted_at":"2022-03-10T17:03:49Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05482","snapshot_observed_at":"2026-08-16T11:32:06.113579Z","title":"Wortsman, G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.113579Z"},"links":{"cited_paper":"/paper/2203.05482","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:7d57bb3f568a21aac666a67c7cdfaeff30bf92a5de70c41727195d79b0a17a1a","observation_id":"fc2957c2-776c-439f-83ce-fc4cbf762141","resolution":{"observed_at":"2026-08-16T11:32:06.113579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-16T11:32:06.117439Z","title":"Xiong, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.117439Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:bd58e7632d4666c8d51954eaa6908f0c08dcda86c010dc80e51ae9b660a89a0f","observation_id":"cdea5cac-3103-42ef-b352-3f11788b9353","resolution":{"observed_at":"2026-08-16T11:32:06.117439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11934","last_updated":"2021-03-11T18:45:13Z","snapshot_observed_at":"2026-08-17T02:24:20.015689Z","submitted_at":"2020-10-22T17:58:14Z","title":"mT5: A massively multilingual pre-trained text-to-text transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11934","snapshot_observed_at":"2026-08-16T11:32:06.121487Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.121487Z"},"links":{"cited_paper":"/paper/2010.11934","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:b76678d786623ec191690955ff969fcfe1efafc971e9717387315562567aae15","observation_id":"cca65cda-40af-4d0d-98aa-70ea1c9ad0af","resolution":{"observed_at":"2026-08-16T11:32:06.121487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06688","last_updated":"2023-06-11T14:03:09Z","snapshot_observed_at":"2026-08-16T15:24:48.407584Z","submitted_at":"2023-06-11T14:03:09Z","title":"Language Versatilists vs. Specialists: An Empirical Revisiting on Multilingual Transfer Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06688","snapshot_observed_at":"2026-08-16T11:32:06.125551Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.125551Z"},"links":{"cited_paper":"/paper/2306.06688","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:4a38dab36009f1b9dc0619b4fae0595c11263ce511719c8e4f31833152a00fb6","observation_id":"fb505a61-c51f-40e6-bd99-fd99f05301e4","resolution":{"observed_at":"2026-08-16T11:32:06.125551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02460","last_updated":"2025-06-11T05:32:20Z","snapshot_observed_at":"2026-08-16T13:03:17.956422Z","submitted_at":"2024-11-04T06:31:26Z","title":"Code-Switching Curriculum Learning for Multilingual Transfer in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02460","snapshot_observed_at":"2026-08-16T11:32:06.129310Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.129310Z"},"links":{"cited_paper":"/paper/2411.02460","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:b3febf7e3725ff7a9a676b3eab3ab15485b564a2d103df953c5dc4792d04cef4","observation_id":"ef03d872-8937-4578-ae39-dde03ff53c3a","resolution":{"observed_at":"2026-08-16T11:32:06.129310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01954","last_updated":"2024-04-13T15:06:19Z","snapshot_observed_at":"2026-08-16T14:04:18.060321Z","submitted_at":"2024-04-02T13:48:49Z","title":"HyperCLOVA X Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01954","snapshot_observed_at":"2026-08-16T11:32:06.133353Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.133353Z"},"links":{"cited_paper":"/paper/2404.01954","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:f2cd0b3ed4534e6ac625773f8b745b21f2704fbe93c3770b9a4f340b3b1d23f4","observation_id":"7d62fe99-1f2f-4d83-b837-1bc688024f22","resolution":{"observed_at":"2026-08-16T11:32:06.133353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-16T11:32:06.137853Z","title":"Zellers, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.137853Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:7168416a09acf82d5c9ebc224a1612849c9946387dc27a0741af4f6f3a578c00","observation_id":"d0b48026-e44a-47c9-b790-9a28c7d625d0","resolution":{"observed_at":"2026-08-16T11:32:06.137853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07467","last_updated":"2019-10-16T16:44:22Z","snapshot_observed_at":"2026-08-08T08:22:25.110228Z","submitted_at":"2019-10-16T16:44:22Z","title":"Root Mean Square Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07467","snapshot_observed_at":"2026-08-16T11:32:06.141984Z","title":"Zhang and R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.141984Z"},"links":{"cited_paper":"/paper/1910.07467","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:bfd4c398837817dbc7c22aa24fe9e23db331de468ce8e4893fe5211508512ae6","observation_id":"b663ba48-adcc-4465-85ac-1ee898e7a80b","resolution":{"observed_at":"2026-08-16T11:32:06.141984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-16T11:32:06.146187Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.146187Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:e7a21d8610081ebf54219deefe8d2e1e77dd6bc549c94fdf08a307054540a50a","observation_id":"f7ec2889-3780-4241-a9f2-73e38a9f031e","resolution":{"observed_at":"2026-08-16T11:32:06.146187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:32:06.150036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.150036Z"},"links":{"citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:e243702fe1da467e0291c7984138a528df741d91c79278582d2fde257367f2af","observation_id":"a23183da-3b96-44dd-b6d7-c446ac5f5ccb","resolution":{"observed_at":"2026-08-16T11:32:06.150036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18815","last_updated":"2024-11-10T12:49:15Z","snapshot_observed_at":"2026-08-16T14:14:19.170830Z","submitted_at":"2024-02-29T02:55:26Z","title":"How do Large Language Models Handle Multilingualism?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18815","snapshot_observed_at":"2026-08-16T11:32:06.153692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.153692Z"},"links":{"cited_paper":"/paper/2402.18815","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:8940a2325137d07af79c77543472e99b0d876ba0512e897d592e4c57a4eb9969","observation_id":"97e4446c-c0fa-461f-9ccd-48f1799f5c42","resolution":{"observed_at":"2026-08-16T11:32:06.153692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-16T11:32:06.157746Z","title":"Zheng, W.-L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.157746Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:92b29be02d9bfe2c05f01800210fbd7bd1c8217b8ac020270f15408e14486a3f","observation_id":"36edc9bd-408f-418a-be67-6f9122dec057","resolution":{"observed_at":"2026-08-16T11:32:06.157746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-16T11:32:06.165668Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.165668Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:3a3acde20be5aadd3812c3d6e17b820eee1a7ef9e8c521c6bfca8529a1c967b9","observation_id":"53508021-71e9-4b2f-b8f8-5e11ee0e060e","resolution":{"observed_at":"2026-08-16T11:32:06.165668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":77,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 3 inbound Pith citation observations for arXiv:2504.15431."}