{"as_of":"2026-08-10T12:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:17127353db5a8315cc2c41dbaf9acac846aa7ee9daf35dabbf6cd6f3ef7031e1","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:27:57.561399Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.01804/citation-record","integrity":"/paper/2502.01804/integrity","json":"/paper/2502.01804/citation-record.json","paper":"/paper/2502.01804"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-08-09T14:27:57.391563Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.391563Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:639ad6df2b4c441c97716400eecbe7a1a35ab7ad32866df58b814c2ad20264d1","observation_id":"d8853291-31a6-4438-838c-e8177ea277fc","resolution":{"observed_at":"2026-08-09T14:27:57.391563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.396007Z","title":"Ensemble of averages: Improving model selection and boosting performance in domain generalization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.396007Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:dd8ee248206b2b43a002817dd3e938a9092ef37c2e4ee15d616f03a2dfdacf0e","observation_id":"36c7597e-646b-4b7d-9bcc-b4aa6344e198","resolution":{"observed_at":"2026-08-09T14:27:57.396007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-09T14:27:57.400087Z","title":"A., Adeli, E., Altman, R., Arora, S., von Arx, S., Bernstein, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.400087Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:892f2fcd54808b1195c072d02c0e84c7be6282b9260ba2ebec1bd8941ba9f458","observation_id":"dd5c57d8-ee63-42bb-95dd-e47857dbbeb0","resolution":{"observed_at":"2026-08-09T14:27:57.400087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.404425Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.404425Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:154b300a9c41a558b828ff06516ed9a32d920cd90e1741b98f1a4af9bdb0951b","observation_id":"f408d395-f482-4108-a0ad-dba645e9922d","resolution":{"observed_at":"2026-08-09T14:27:57.404425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03044","last_updated":"2022-04-06T18:54:48Z","snapshot_observed_at":"2026-08-05T18:37:24.892453Z","submitted_at":"2022-04-06T18:54:48Z","title":"Fusing finetuned models for better pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03044","snapshot_observed_at":"2026-08-09T14:27:57.408331Z","title":"Fusing finetuned models for better pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.408331Z"},"links":{"cited_paper":"/paper/2204.03044","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:cb9017fc87ef2c492f641d81f99ff715759d004bf54f58502e3fab995094877d","observation_id":"feb98c8f-41b0-4247-8458-6caf21c33376","resolution":{"observed_at":"2026-08-09T14:27:57.408331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-09T14:27:57.412285Z","title":"X., Gao, H., Chen, D., Li, J., Zeng, W., Yu, X., Wu, Y., Xie, Z., Li, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.412285Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:c28c8da50247575b3133325290721dfe76fecc6c49ea6b34b235d96071e423f2","observation_id":"60b0b9d2-5d8d-402c-a46a-6a79e9e9d94b","resolution":{"observed_at":"2026-08-09T14:27:57.412285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-09T14:27:57.416519Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.416519Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:a912c01eaea983351f8642a10b39c8aa4f13235a5e9192e23a09f6a8965c23e0","observation_id":"73f5ab54-1ee5-447a-8adc-e30fed190887","resolution":{"observed_at":"2026-08-09T14:27:57.416519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.080983Z","title":"Pareto manifold learning: Tackling multiple tasks via ensembles of single-task models","venue":null,"work_id":"584b489d-12e0-47fb-86b9-85f78a734e43","year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.420385Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:374591863c206e37faf50ffc23a2bf835624cdbdf9c6842360eb384619a7c422","observation_id":"d5fca2ec-fa38-4895-bcc6-21d032854460","resolution":{"observed_at":"2026-08-09T14:27:58.086718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15796","last_updated":"2025-01-15T02:48:59Z","snapshot_observed_at":"2026-08-04T02:07:01.235387Z","submitted_at":"2024-03-23T11:03:31Z","title":"Understanding Emergent Abilities of Language Models from the Loss Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15796","snapshot_observed_at":"2026-08-09T14:27:57.423803Z","title":"Understanding emergent abilities of language models from the loss perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.423803Z"},"links":{"cited_paper":"/paper/2403.15796","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:1d35bd9bacd74c6c5a2f556de32fe5251e76bd09756739f68eae180f7016b35b","observation_id":"e84ceb55-0f61-4ce1-b195-7ba48fdcab56","resolution":{"observed_at":"2026-08-09T14:27:57.423803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T14:27:57.427749Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.427749Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:2efc5a8bd73f8946262530da1d915db0d737b9fd319ecdc5d318791b46217f5c","observation_id":"78e44852-42e8-403c-b09c-12ae7f0cb577","resolution":{"observed_at":"2026-08-09T14:27:57.427749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15393","last_updated":"2024-02-05T16:33:05Z","snapshot_observed_at":"2026-08-09T06:27:27.325450Z","submitted_at":"2023-10-23T22:51:58Z","title":"DoGE: Domain Reweighting with Generalization Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15393","snapshot_observed_at":"2026-08-09T14:27:57.431339Z","title":"Doge: Domain reweighting with generalization estimation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.431339Z"},"links":{"cited_paper":"/paper/2310.15393","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:6b697f6ca8bca5d37661b2a66e334148b34b5c10613a3be33e3315a7ae6264ae","observation_id":"253c7a5c-2696-4055-82b8-a1b0bab31ecc","resolution":{"observed_at":"2026-08-09T14:27:57.431339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02498","last_updated":"2024-10-03T14:00:44Z","snapshot_observed_at":"2026-08-09T06:28:00.253928Z","submitted_at":"2024-10-03T14:00:44Z","title":"Dynamic Gradient Alignment for Online Data Mixing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02498","snapshot_observed_at":"2026-08-09T14:27:57.434779Z","title":"Dynamic gradient alignment for online data mixing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.434779Z"},"links":{"cited_paper":"/paper/2410.02498","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:fb463d2b895d8c1985f7a8d89d4a3398b08753e9f637c22080fa1d464da4b295","observation_id":"161d34cb-2394-49f7-9871-818fd68db1ec","resolution":{"observed_at":"2026-08-09T14:27:57.434779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01667","last_updated":"2022-09-04T18:00:29Z","snapshot_observed_at":"2026-08-04T15:45:56.618823Z","submitted_at":"2022-09-04T18:00:29Z","title":"A Review of Sparse Expert Models in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01667","snapshot_observed_at":"2026-08-09T14:27:57.438208Z","title":"A review of sparse expert models in deep learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.438208Z"},"links":{"cited_paper":"/paper/2209.01667","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:c4fe6dea799cffd4370ba77b364367becd2cb6c1ab1fa964c586112a9cdd36aa","observation_id":"11e84925-235f-4796-9d8d-0207ad581f70","resolution":{"observed_at":"2026-08-09T14:27:57.438208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.066838Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"928f3691-2b3b-417e-84df-bf6f35258b21","year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.441375Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:e734d97f41aeb5cf709b50e8c68a66ed69b853e81bea65585108ab54f21ef956","observation_id":"dfe26220-49f0-4b71-a9b3-2ebac4de105f","resolution":{"observed_at":"2026-08-09T14:27:58.071793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08540","last_updated":"2024-06-14T20:21:05Z","snapshot_observed_at":"2026-07-06T17:43:56.860733Z","submitted_at":"2024-03-13T13:54:00Z","title":"Language models scale reliably with over-training and on downstream tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08540","snapshot_observed_at":"2026-08-09T14:27:57.445085Z","title":"Y., Smyrnis, G., Shankar, V., Gururangan, S., Wortsman, M., Shao, R., Mercat, J., Fang, A., Li, J., Keh, S., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.445085Z"},"links":{"cited_paper":"/paper/2403.08540","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:d32cf81b8db698975840172999c68cc6f552209e03fb1a17bfb675b8ec338fb4","observation_id":"51ea79ca-b8ea-4326-9a21-2ceaa9d89f8f","resolution":{"observed_at":"2026-08-09T14:27:57.445085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-09T14:27:57.449094Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.449094Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:0cbba697553e849bab7797e8cf363ba1ab3866ab05caa237eda904f8f72da34c","observation_id":"e56c246c-31cd-4f83-a061-a65fcaf2b04a","resolution":{"observed_at":"2026-08-09T14:27:57.449094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04037","last_updated":"2024-09-12T19:54:37Z","snapshot_observed_at":"2026-08-07T11:18:39.827875Z","submitted_at":"2022-12-08T02:21:47Z","title":"Demystifying Prompts in Language Models via Perplexity Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04037","snapshot_observed_at":"2026-08-09T14:27:57.452868Z","title":"A., and Zettlemoyer, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.452868Z"},"links":{"cited_paper":"/paper/2212.04037","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:81fd6e3a25800622e4dac84450834ff2c742b414e9c82300df44fa555e9ab7a1","observation_id":"c269444f-8b4a-4398-a1f9-52d7e5fa46c4","resolution":{"observed_at":"2026-08-09T14:27:57.452868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.054716Z","title":"Adaptive training distributions with scalable online bilevel optimization","venue":null,"work_id":"75bb4f0a-5dac-49ee-b749-5636de6276e7","year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.456462Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:ec3d70079e85511166c59e1290b3799583eed83ae07d7bf5100fab85a4140b89","observation_id":"82923042-9307-4469-b0eb-b2f623bfbf6a","resolution":{"observed_at":"2026-08-09T14:27:58.059125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03735","last_updated":"2025-03-11T00:20:30Z","snapshot_observed_at":"2026-08-09T06:27:43.634379Z","submitted_at":"2024-09-30T20:49:54Z","title":"Task-Adaptive Pretrained Language Models via Clustered-Importance Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03735","snapshot_observed_at":"2026-08-09T14:27:57.460128Z","title":"Task-adaptive pretrained language models via clustered-importance sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.460128Z"},"links":{"cited_paper":"/paper/2410.03735","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:edc6a80530f3133883d7a4d85122e441055206adb26c3ba4f3c8522bf688457d","observation_id":"b08e76ba-e5e0-4789-ae2f-033f557d9885","resolution":{"observed_at":"2026-08-09T14:27:57.460128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.042523Z","title":"Hard mixtures of experts for large scale weakly supervised vision","venue":null,"work_id":"0340b64c-6f1e-4a07-8e13-57a004a3c378","year":2017},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.463977Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:b5c8e8b5abf0e3aa96d96adb3decb4b457eb1603cb8325b1b2422a42976679bd","observation_id":"84c69eca-4bc3-4985-9bb4-c61d6c11baf3","resolution":{"observed_at":"2026-08-09T14:27:58.046874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.029765Z","title":"MiniLLM : Knowledge distillation of large language models","venue":null,"work_id":"b91222f0-2616-476e-ab13-9d03493b0dd4","year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.467487Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:5a76fe3faca0400cbd1ead5792612091b5800196775eb2e967e15161db58d0ae","observation_id":"88c8c2b4-1ca4-47fa-8016-cb09b1ebf898","resolution":{"observed_at":"2026-08-09T14:27:58.034269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-09T14:27:57.471035Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.471035Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:2ed960b99090706120544b535a6de097e8aa7476a919348d44bffed51a5bab73","observation_id":"d14bff1a-2729-4624-a010-25750b77502a","resolution":{"observed_at":"2026-08-09T14:27:57.471035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13269","last_updated":"2024-08-19T03:31:19Z","snapshot_observed_at":"2026-07-06T15:58:08.777051Z","submitted_at":"2023-07-25T05:39:21Z","title":"LoraHub: Efficient Cross-Task Generalization via Dynamic LoRA Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13269","snapshot_observed_at":"2026-08-09T14:27:57.474822Z","title":"Y., Pang, T., Du, C., and Lin, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.474822Z"},"links":{"cited_paper":"/paper/2307.13269","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:1d0eb99910f15c79f681f489f6b237e4eb9778012b838c32b431551acb438c56","observation_id":"b40ae42d-0f3e-4bb2-b432-76a066acc317","resolution":{"observed_at":"2026-08-09T14:27:57.474822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-09T14:27:57.478584Z","title":"T., Wortsman, M., Gururangan, S., Schmidt, L., Hajishirzi, H., and Farhadi, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.478584Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:8058362c61b39d69add5070291071825151142cc37ab4c7f72c237f22ed2ecbf","observation_id":"0c026c98-4752-4671-8734-56aaf4aeb769","resolution":{"observed_at":"2026-08-09T14:27:57.478584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-09T14:27:57.482212Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.482212Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:aae726847a78f7868afe362801c73841a4fe32ce880008485db9a7ecad78d649","observation_id":"b3d6253a-fe63-4121-ad08-89e0ec34babb","resolution":{"observed_at":"2026-08-09T14:27:57.482212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-09T14:27:57.486070Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.486070Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:08f059eeb08f6a278bcf01137b6ca589c27dd7566f7194d0097ab4f8511168a2","observation_id":"dfde294a-c936-4492-9067-f943d5e6baa1","resolution":{"observed_at":"2026-08-09T14:27:57.486070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-09T14:27:57.490125Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.490125Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:16e9cf6b45b860ae2e2d7a8624905382ea1d868c48e394d5ce632fdd10cbcbd6","observation_id":"c19c0c4b-8781-48de-b369-9a39376106a6","resolution":{"observed_at":"2026-08-09T14:27:57.490125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-10T05:40:29.232133Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-09T14:27:57.493957Z","title":"Scaling laws for fine-grained mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.493957Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:e9b6110ff626858d97075957d19fd0e5c8fb383cae30862472f0acb04b2688ab","observation_id":"2745ea1f-7427-405e-851a-79a3be989fa8","resolution":{"observed_at":"2026-08-09T14:27:57.493957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.016618Z","title":"Evaluating quantized large language models","venue":null,"work_id":"5900b305-4998-450d-aa8f-06d2afc06fe2","year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.497889Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:0c212d4f98122368808df54758970e0b54e43a53e7e29d3a874a71f36c9292c3","observation_id":"bf38f286-0ecc-4312-a1c4-35e60eafe9e7","resolution":{"observed_at":"2026-08-09T14:27:58.021236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.002899Z","title":"LLM-Pruner : On the structural pruning of large language models","venue":null,"work_id":"ab9cf913-a78c-4448-b9bd-2ccb02f9c877","year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.501526Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:265d0d74fed4d9ba69fbbb7b1eac725104014586a2a085acdd6bc7af566f6240","observation_id":"dfa78e05-8bbf-47bd-9645-58cc9e40dd9a","resolution":{"observed_at":"2026-08-09T14:27:58.007734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.990281Z","title":"Task arithmetic in the tangent space: Improved editing of pre-trained models","venue":null,"work_id":"f448c2b0-015d-497b-8bb2-9b51fc74925d","year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.505793Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:f81bb8026b7280a4541d9e80c4603b5fffce030693da956ec0389931b10b02e2","observation_id":"58b1f7da-f0d7-44b4-91dd-d26fec265c93","resolution":{"observed_at":"2026-08-09T14:27:57.994722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05567","last_updated":"2024-04-08T14:39:49Z","snapshot_observed_at":"2026-08-08T01:59:38.874840Z","submitted_at":"2024-04-08T14:39:49Z","title":"Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05567","snapshot_observed_at":"2026-08-09T14:27:57.509397Z","title":"Dense training, sparse inference: Rethinking training of mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.509397Z"},"links":{"cited_paper":"/paper/2404.05567","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:657c5a32a66bac61884476933157a2f1abe8e7fc6b6525d2d548644d15dab07f","observation_id":"427b3fff-99d2-4f59-8d94-36d76c0383d9","resolution":{"observed_at":"2026-08-09T14:27:57.509397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.976129Z","title":"Diverse weight averaging for out-of-distribution generalization","venue":null,"work_id":"9de225a1-4d3d-4400-a561-b5c8345c9276","year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.513283Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:961d32ecedd18b37fee3efd5dcdd0ff89f6326694a7624f05c6844d3720273eb","observation_id":"4f337655-4d5b-4423-9baa-1ac280c93dfa","resolution":{"observed_at":"2026-08-09T14:27:57.981377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.963724Z","title":"Model ratatouille: Recycling diverse models for out-of-distribution generalization","venue":null,"work_id":"23b5926d-d3c2-438b-886b-ea0ddeec6745","year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.516804Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:517bd4808361175a6001c3ae1ffe0469ed5204b3f4f7c918512c36a5a668352c","observation_id":"46644d6d-fc48-48b0-bc87-de9253bcb8f6","resolution":{"observed_at":"2026-08-09T14:27:57.967482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.952101Z","title":"Rewarded soups: towards pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards","venue":null,"work_id":"90d0caab-313a-4480-b19f-9ca5671f1903","year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.520952Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:d1df8d961a37aadfea784c94abbf43b6bcf0024184bb02d0dd935c80e79c5321","observation_id":"27462a9f-c869-4aaf-9e3c-930437dfe036","resolution":{"observed_at":"2026-08-09T14:27:57.956064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-09T14:27:57.524414Z","title":"G., Hardin, C., Bhupatiraju, S., Hussenot, L., Mesnard, T., Shahriari, B., Ram \\'e , A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.524414Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:a2f553458d42d8e0d395d0bd67e044f4ff7a25c754f49c8d9e68cef5cfdab53a","observation_id":"c4d32ccf-b590-4ca8-b125-6fa924230722","resolution":{"observed_at":"2026-08-09T14:27:57.524414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-09T14:27:57.527885Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.527885Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:230f12de28cfe30f5d0d4c343e6f6627b8796a5c459bcc3082ceea25ee41d76d","observation_id":"e4f29297-d2e5-435b-b527-e50f9296ed6a","resolution":{"observed_at":"2026-08-09T14:27:57.527885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18314","last_updated":"2024-09-26T21:44:20Z","snapshot_observed_at":"2026-07-06T19:23:06.818254Z","submitted_at":"2024-09-26T21:44:20Z","title":"Realistic Evaluation of Model Merging for Compositional Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18314","snapshot_observed_at":"2026-08-09T14:27:57.531857Z","title":"Realistic evaluation of model merging for compositional generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.531857Z"},"links":{"cited_paper":"/paper/2409.18314","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:df52c6774a5235e427d35b829414701f540cdb16414ae5c3e5b3b78299bd849b","observation_id":"bdf10fbd-1173-4d8d-92af-32373de6e98e","resolution":{"observed_at":"2026-08-09T14:27:57.531857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.939701Z","title":"Efficient large language models: A survey","venue":null,"work_id":"648ba7e3-b9ab-49d9-8916-0b1a180297cd","year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.535349Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:66e71f975ee49f4478a45e10a5f676b40205cb3785b294379245d215834ddd42","observation_id":"025f7d6c-2553-4731-87aa-2563046a66ed","resolution":{"observed_at":"2026-08-09T14:27:57.944220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.927484Z","title":"T., Wu, T., Song, D., Mittal, P., and Jia, R","venue":null,"work_id":"1f2af1d0-9054-49cb-9fed-c11bbead597a","year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.538832Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:8253d6c03353fbc9ce81e02657887660296f1061430301caf3bed28a17ecb185","observation_id":"3043a95d-cf58-44b5-9822-d5c72ff727a3","resolution":{"observed_at":"2026-08-09T14:27:57.931671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-09T14:27:57.542454Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.542454Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:e71fbb46520c2b0fa38f78619ada986cc702137c9e5b0f366c870713ef191b02","observation_id":"2faa9b3a-7af2-45e2-becb-87d3f888bdad","resolution":{"observed_at":"2026-08-09T14:27:57.542454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.913670Z","title":"Y., Roelofs, R., Gontijo-Lopes, R., Morcos, A","venue":null,"work_id":"20de32c5-13e5-4ea7-8d65-e441bb2435fe","year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.546212Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:7cb64beeee04c215d8c41b22397cfa0cf58fe79df7ed6b180804347ae1cf0eb6","observation_id":"4d0d2575-1cf5-4df2-a85a-ac6c08caa8c3","resolution":{"observed_at":"2026-08-09T14:27:57.919199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.549919Z","title":"Structured pruning learns compact and accurate models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.549919Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:6efcd0e8d3e2ec69729ce828c22079b554d31f79b6ad787396382793d6f50fee","observation_id":"cda5a5a6-bfab-46eb-a2c2-8ed6b42dd7dd","resolution":{"observed_at":"2026-08-09T14:27:57.549919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-09T14:27:57.553441Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.553441Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:c50f280828780a3dc401e89c9aca33becbfe1cc5b1b8b30da9929abe9babf0eb","observation_id":"bb2ab740-b7eb-4d1f-ba23-f443ee314bdf","resolution":{"observed_at":"2026-08-09T14:27:57.553441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10429","last_updated":"2023-11-21T02:01:53Z","snapshot_observed_at":"2026-08-09T06:27:16.635132Z","submitted_at":"2023-05-17T17:58:13Z","title":"DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10429","snapshot_observed_at":"2026-08-09T14:27:57.557385Z","title":"M., Pham, H., Dong, X., Du, N., Liu, H., Lu, Y., Liang, P., Le, Q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.557385Z"},"links":{"cited_paper":"/paper/2305.10429","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:ee63dde86f5ed99d10daebc7a25634380a36b447df2192b9321f5ed1fe30fd56","observation_id":"aa434cf1-ebd4-4aef-9ead-0802752e0920","resolution":{"observed_at":"2026-08-09T14:27:57.557385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.561399Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.561399Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:5f8637321c38aca49956da291f96a2a1300f2d24de99ce0f34d9d40e6031b1ad","observation_id":"c1156ac8-7ef6-4773-9ce7-1b3eacfd4c53","resolution":{"observed_at":"2026-08-09T14:27:57.561399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T10:17:54.108594Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2502.01804."}