{"as_of":"2026-08-09T14:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e730414c7988990e8fbcea120ce64fa56eb3e3b18c94f73a5f543e4d4f57ad9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:33:09.418737Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":26,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T08:09:12.716163Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2212.04089"},"observation_digest":"sha256:5546a687746a79a71fcdec5cdba792a20b5c8974494494e710c449df85cc6ee4","observation_id":"93a51336-5131-4fde-a1f8-d295bbeafd7f","resolution":{"observed_at":"2026-05-13T08:09:13.060337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2408.01119","last_updated":"2026-05-12T18:55:05Z","snapshot_observed_at":"2026-08-03T11:44:22.495911Z","submitted_at":"2024-08-02T09:00:03Z","title":"Task Prompt Vectors: Effective Initialization through Multi-Task Soft-Prompt Transfer","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T22:11:59.206066Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2408.01119"},"observation_digest":"sha256:b11b8b1536813e5fae605780bea94a3223ef545ada85fb11d6d9e65f61c52a91","observation_id":"1a67f19a-4f70-4387-8c2c-84c82cd66125","resolution":{"observed_at":"2026-05-23T22:13:30.125991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-05-17T22:16:04.386706Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2408.07666"},"observation_digest":"sha256:df7ce54efdfcdf81a9453a890efea03155c56b8e9ff0f9a42fb8f742ba0a2f51","observation_id":"01bb3cee-ca4e-496c-a52b-66f6bff67e97","resolution":{"observed_at":"2026-05-17T22:16:04.906658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-08T22:33:09.418737Z","title":"A., and Zettlemoyer, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04506","last_updated":"2025-02-06T21:13:44Z","snapshot_observed_at":"2026-08-09T04:44:07.719948Z","submitted_at":"2025-02-06T21:13:44Z","title":"When One LLM Drools, Multi-LLM Collaboration Rules","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T22:33:09.418737Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2502.04506"},"observation_digest":"sha256:aa8225fd1cecbcd002330b0ebbe33c8b12c62b24a42ca12f752c98b4d5ea186d","observation_id":"d91b4050-c3d9-4312-9c0b-14dd26beb3d9","resolution":{"observed_at":"2026-08-08T22:33:09.418737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:32993479164c75d08499aa117971caf5ebd71297559a1fb27221772ef3bc512c","observation_id":"204ed7b1-527f-4820-beff-4f0ec9fed988","resolution":{"observed_at":"2026-05-22T19:32:00.952905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-07T15:42:21.516966Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.516966Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:685921c13efeaceb01619bab0450bd4d819efd676a04942cf47098d7290f557e","observation_id":"7b058177-784b-435a-a3ff-7acf76772da6","resolution":{"observed_at":"2026-08-07T15:42:21.516966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-07T04:20:02.441768Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models.arXiv preprint arXiv:2208.03306,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-08T07:52:54.572018Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.441768Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:b37e00b94b8adcc4a0d60bffc42b036fc9ec40976ba4bf6c1d51eda3b7199614","observation_id":"b4b1e656-90ed-4aec-8020-cb5f269abe2c","resolution":{"observed_at":"2026-08-07T04:20:02.441768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-07T00:57:21.433548Z","title":"Smith, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12388","last_updated":"2025-06-14T07:56:18Z","snapshot_observed_at":"2026-08-08T14:42:57.474609Z","submitted_at":"2025-06-14T07:56:18Z","title":"Group then Scale: Dynamic Mixture-of-Experts Multilingual Language Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:21.433548Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2506.12388"},"observation_digest":"sha256:eba052c3a6559349c313ddae6e76be6d9974f1516c3f087b7ffbb82dc9061cc8","observation_id":"c4151b25-40eb-487f-81f6-58055bca8106","resolution":{"observed_at":"2026-08-07T00:57:21.433548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-07T00:56:26.216747Z","title":"Smith, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12597","last_updated":"2025-06-14T18:34:38Z","snapshot_observed_at":"2026-08-07T00:43:00.229748Z","submitted_at":"2025-06-14T18:34:38Z","title":"Automatic Expert Discovery in LLM Upcycling via Sparse Interpolated Mixture-of-Experts","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:56:26.216747Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2506.12597"},"observation_digest":"sha256:949a7d90bcd0c9202dfe35cd590252cd49720df3c668f21f40679914b6e4e1eb","observation_id":"3719c411-dbc3-4766-89de-cea2be10bd24","resolution":{"observed_at":"2026-08-07T00:56:26.216747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-06T20:59:04.662169Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.662169Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:f3fbf4c3db88f3184b04b70597dfa9716d4f860adb51190d18db168ba2ea6f16","observation_id":"24e3a7d0-fe10-400a-8c73-3d34e3d9eb7e","resolution":{"observed_at":"2026-08-06T20:59:04.662169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-06T18:57:16.051548Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07024","last_updated":"2025-08-23T00:44:49Z","snapshot_observed_at":"2026-08-08T13:03:17.550361Z","submitted_at":"2025-07-09T16:54:21Z","title":"FlexOlmo: Open Language Models for Flexible Data Use","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:16.051548Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2507.07024"},"observation_digest":"sha256:3325774b30dd3f2801466d2e00f52c585f97b7d3b6fc6d487bd2585d49f449c9","observation_id":"c829d2a0-d80c-476b-b417-ce674ea619e4","resolution":{"observed_at":"2026-08-06T18:57:16.051548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2604.02719","last_updated":"2026-04-03T04:22:30Z","snapshot_observed_at":"2026-07-06T22:52:02.162758Z","submitted_at":"2026-04-03T04:22:30Z","title":"MOMO: Mars Orbital Model Foundation Model for Mars Orbital Applications","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T20:47:51.509798Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2604.02719"},"observation_digest":"sha256:b6d26e96011702505e7ded744ad144df52b372bc5d1a28117dd67a76f3d4394d","observation_id":"8f5852f7-d3e2-406d-bf99-b68c77247d1c","resolution":{"observed_at":"2026-05-13T20:48:15.103016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2604.18473","last_updated":"2026-04-20T16:24:41Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T16:24:41Z","title":"Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-10T05:52:28.822723Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2604.18473"},"observation_digest":"sha256:39b0a2347abab0208cfa0d56686ef089443823de252e53c40ad6887383bf601a","observation_id":"27729a76-23bc-495a-aab5-fcad434f7204","resolution":{"observed_at":"2026-05-10T05:56:11.347027Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2605.11170","last_updated":"2026-06-02T13:57:02Z","snapshot_observed_at":"2026-08-02T02:13:17.912919Z","submitted_at":"2026-05-11T19:28:33Z","title":"Unlearning with Asymmetric Sources: Improved Unlearning-Utility Trade-off with Public Data","version":1},"reference_index":162,"source":"arxiv_source","source_observed_at":"2026-05-13T05:56:38.042978Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2605.11170"},"observation_digest":"sha256:b912e53d8db14342f385040cb2bdbdb5539beeeb7573c7c16ae14aff218274dc","observation_id":"4602cde6-ba2d-4709-b06d-03129ada670e","resolution":{"observed_at":"2026-05-13T05:57:21.795138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2605.13997","last_updated":"2026-05-13T18:07:12Z","snapshot_observed_at":"2026-07-06T23:25:29.856145Z","submitted_at":"2026-05-13T18:07:12Z","title":"HodgeCover: Higher-Order Topological Coverage Drives Compression of Sparse Mixture-of-Experts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T05:54:32.496951Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2605.13997"},"observation_digest":"sha256:de3c6b63860b9a42c2a79206dbc5b971dc498efd43628671110614c0fb500317","observation_id":"3dd25be9-893f-46ef-be1f-1dafa8d7d156","resolution":{"observed_at":"2026-05-15T05:55:04.758253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2605.14289","last_updated":"2026-05-14T02:48:23Z","snapshot_observed_at":"2026-08-06T17:26:19.586193Z","submitted_at":"2026-05-14T02:48:23Z","title":"MetaMoE: Diversity-Aware Proxy Selection for Privacy-Preserving Mixture-of-Experts Unification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T02:21:10.641070Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2605.14289"},"observation_digest":"sha256:dbdac1fc117c35a1a55b07663c77cdad3e51c37a1cb370fa1bf99db8600ea3eb","observation_id":"30bd7b97-324e-431d-9077-40337fc42078","resolution":{"observed_at":"2026-05-15T02:23:31.881288Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2605.19095","last_updated":"2026-05-18T20:31:49Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T20:31:49Z","title":"ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-20T12:22:30.263086Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2605.19095"},"observation_digest":"sha256:70190d88bf654b5651b428b8c53ff667534552d4ad9379c7a583f68d8fd8fbae","observation_id":"6bef364a-0d99-4d45-9728-c51e1b4e1419","resolution":{"observed_at":"2026-05-20T12:23:16.769512Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2606.24722","last_updated":"2026-07-03T16:29:30Z","snapshot_observed_at":"2026-07-12T12:29:29.101092Z","submitted_at":"2026-06-23T15:47:33Z","title":"Decentralised AI Training and Inference with BlockTrain","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-06-25T23:32:43.585170Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2606.24722"},"observation_digest":"sha256:7c6caa909085d895188fcfda9868b6c3e7ee9bc123108f48c80f94a2df613855","observation_id":"a6aac792-d8ae-41bb-b993-f2616357ffba","resolution":{"observed_at":"2026-07-04T17:40:00.431608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-07-12T12:29:35.403453Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.24722","last_updated":"2026-07-03T16:29:30Z","snapshot_observed_at":"2026-07-12T12:29:29.101092Z","submitted_at":"2026-06-23T15:47:33Z","title":"Decentralised AI Training and Inference with BlockTrain","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-12T12:29:35.403453Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2606.24722"},"observation_digest":"sha256:be4fd4a4d898a9efa887f34891682008f45429609655d84a45234fd80a9203a4","observation_id":"cd94ee50-d4a0-4886-b0fe-3a2337f9ecdb","resolution":{"observed_at":"2026-07-12T12:29:35.403453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2606.31796","last_updated":"2026-07-23T16:29:18Z","snapshot_observed_at":"2026-08-09T07:09:32.790592Z","submitted_at":"2026-06-30T15:14:38Z","title":"CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T05:46:40.510955Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2606.31796"},"observation_digest":"sha256:d445e74642bebd4fdd1110187dd573764182c0b9c9b4f9d9c0d349883c4d7d25","observation_id":"256c947c-611d-4a69-baa4-1ab1b55861fc","resolution":{"observed_at":"2026-07-01T10:15:44.043684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-02T09:24:14.388774Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.31796","last_updated":"2026-07-23T16:29:18Z","snapshot_observed_at":"2026-08-09T07:09:32.790592Z","submitted_at":"2026-06-30T15:14:38Z","title":"CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T09:24:14.388774Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2606.31796"},"observation_digest":"sha256:6f8a61e1f6686fb52dd10a5a02dd15b0bd89649e504a94b2f394e73c0f865dcc","observation_id":"93570348-03da-426a-ba90-993117dbef4a","resolution":{"observed_at":"2026-08-02T09:24:14.388774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2607.00620","last_updated":"2026-07-01T08:40:46Z","snapshot_observed_at":"2026-07-07T00:06:14.968413Z","submitted_at":"2026-07-01T08:40:46Z","title":"Identifying Latent Concepts and Structures for Generalized Category Discovery","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-07-02T14:42:01.334822Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2607.00620"},"observation_digest":"sha256:7b76529f09c430368dc9954bc2d9484ddb6d13dc5310a1a035e93e828a0dbedf","observation_id":"f25ca2e0-bf00-4380-9012-68d56b699d0d","resolution":{"observed_at":"2026-07-02T14:47:03.350280Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-07-12T01:22:51.284207Z","title":"Smith and Luke Zettlemoyer , title =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03585","last_updated":"2026-07-03T20:02:28Z","snapshot_observed_at":"2026-08-02T18:24:57.296412Z","submitted_at":"2026-07-03T20:02:28Z","title":"Modular Foundation Models for Time-Series Perception in Digital Twins","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-12T01:22:51.284207Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2607.03585"},"observation_digest":"sha256:3fd8896cb24cb68aff2ccb40bb91113bbc46c7fa304ad70d56d44904e86c159c","observation_id":"f601a8d1-a5d2-4f76-965d-e75617e19f10","resolution":{"observed_at":"2026-07-12T01:22:51.284207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-08T00:41:22.247867Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04084","last_updated":"2026-08-04T18:00:01Z","snapshot_observed_at":"2026-08-08T23:10:58.871169Z","submitted_at":"2026-08-04T18:00:01Z","title":"SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-08T00:41:22.247867Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2608.04084"},"observation_digest":"sha256:8394e96ef0e01e9e1688efa6c9aef99588aabf37e8093bae68a53eb45705c4ba","observation_id":"c2433688-1c4c-4442-a014-c6bea26815e8","resolution":{"observed_at":"2026-08-08T00:41:22.247867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2208.03306/citation-record","integrity":"/paper/2208.03306/integrity","json":"/paper/2208.03306/citation-record.json","paper":"/paper/2208.03306"},"outbound":[],"paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2208.03306."}