{"as_of":"2026-08-09T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9b3743a3c2ef707c4a018b7df8c65cb2afe0afbe2f6f5ce04ab82bdd8e81557","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:25.419709Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:43:52.414007Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T11:24:08.572672Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14136","snapshot_observed_at":"2026-08-06T14:43:52.414007Z","title":"Local mixtures of experts: Essentially free test-time training via model merging","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18122","last_updated":"2025-07-24T06:17:39Z","snapshot_observed_at":"2026-08-06T14:36:16.245142Z","submitted_at":"2025-07-24T06:17:39Z","title":"Maximizing Prefix-Confidence at Test-Time Efficiently Improves Mathematical Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:52.414007Z"},"links":{"cited_paper":"/paper/2505.14136","citing_paper":"/paper/2507.18122"},"observation_digest":"sha256:6f02bbc2fd3237236ab7164509cb2e10e5d7e6af87f5c5afeb39ed0d537885f1","observation_id":"b2ec1165-c56b-4de8-86c4-693909690b61","resolution":{"observed_at":"2026-08-06T14:43:52.414007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"cited_work":{"arxiv_id":"2505.14136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bertolissi, J","venue":null,"work_id":"db0f5b76-4220-4028-84c4-b6f604d9ea2f","year":2025},"citing_paper":{"arxiv_id":"2507.18809","last_updated":"2026-05-13T07:56:01Z","snapshot_observed_at":"2026-07-06T22:02:32.276277Z","submitted_at":"2025-07-24T21:11:39Z","title":"Test-time Offline Reinforcement Learning on Goal-related Experience","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T02:18:34.690441Z"},"links":{"cited_paper":"/paper/2505.14136","citing_paper":"/paper/2507.18809"},"observation_digest":"sha256:a7e8edc3c446aa8b988bbab4fd85daeafb165550b9ec39d34dc21fd579ebe0e4","observation_id":"0a3eaa3e-d678-4834-a968-72cee0f7f207","resolution":{"observed_at":"2026-05-19T02:21:59.692656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"cited_work":{"arxiv_id":"2505.14136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bertolissi, J","venue":null,"work_id":"db0f5b76-4220-4028-84c4-b6f604d9ea2f","year":2025},"citing_paper":{"arxiv_id":"2603.02945","last_updated":"2026-04-08T16:06:46Z","snapshot_observed_at":"2026-08-06T12:04:41.509217Z","submitted_at":"2026-03-03T12:53:04Z","title":"ACE-Merging: Data-Free Model Merging with Adaptive Covariance Estimation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T16:58:36.575824Z"},"links":{"cited_paper":"/paper/2505.14136","citing_paper":"/paper/2603.02945"},"observation_digest":"sha256:cecd1f6a86930c0e4d6d4ac68b407fa8ede4376c673317f102587889389538f6","observation_id":"ac7f9dc3-5666-4c9c-970b-37406f13d5e7","resolution":{"observed_at":"2026-05-15T17:00:10.120979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"cited_work":{"arxiv_id":"2505.14136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bertolissi, J","venue":null,"work_id":"db0f5b76-4220-4028-84c4-b6f604d9ea2f","year":2025},"citing_paper":{"arxiv_id":"2605.20189","last_updated":"2026-03-23T07:18:02Z","snapshot_observed_at":"2026-08-01T19:18:00.278267Z","submitted_at":"2026-03-23T07:18:02Z","title":"SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T11:21:30.867480Z"},"links":{"cited_paper":"/paper/2505.14136","citing_paper":"/paper/2605.20189"},"observation_digest":"sha256:5ac46e6f2c4892a0077b6b67d437e6643fdb0c81ae61dd8f66af0d5606ebaf55","observation_id":"d8beb062-cc2d-4c57-96b5-d2c1bfa2bf2e","resolution":{"observed_at":"2026-05-21T11:24:08.574065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14136/citation-record","integrity":"/paper/2505.14136/integrity","json":"/paper/2505.14136/citation-record.json","paper":"/paper/2505.14136"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:17.246421Z","title":"Git re-basin: Merging models modulo permutation symmetries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.246421Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:8c0bf7b9bb3ee49009d859f4981fdcc78f98994e3ee26b9a9cf7b77eb8b2bf2d","observation_id":"50c9dd35-8559-43fd-a765-23f1301ad6f2","resolution":{"observed_at":"2026-08-07T15:42:17.246421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:17.310853Z","title":"The surprising effectiveness of test-time training for few-shot-learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.310853Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:f79e2b9937db5f27ed1395b27ea27372b4c7f5e358bce53f30b222033baedf3a","observation_id":"0afa14f2-6d19-4cda-be0a-d8b806d03f0c","resolution":{"observed_at":"2026-08-07T15:42:17.310853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:17.456548Z","title":"Locally weighted learning","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.456548Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:02fb8dcfb221424a6a7fda802bec0c20edb48a9a09e9c86b622fc105a9a36663","observation_id":"ec076363-d9cb-4e52-b4e3-dc6d099facc7","resolution":{"observed_at":"2026-08-07T15:42:17.456548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:37.680062Z","title":"Active fine-tuning of multi-task policies","venue":null,"work_id":"ae277d76-6db4-45f0-b075-115e78f0aea0","year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.556677Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:2662a2712e3ec566f49c5b83b803dc6ab85ce8027e82b42eeb86e3388a971503","observation_id":"345f48a3-5e76-4ad6-8d84-67a525d34949","resolution":{"observed_at":"2026-08-07T15:42:37.774529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:37.434677Z","title":"Improving language models by retrieving from trillions of tokens","venue":null,"work_id":"8d856d14-a10b-43bc-aa00-51468f06e774","year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.677799Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:7690a683aa54a1d15eafae9c580d1df50c438d8da64af6da9e82532c4a797d36","observation_id":"60f4df47-51a7-41a4-89ac-692a1c23e792","resolution":{"observed_at":"2026-08-07T15:42:37.540777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:37.275756Z","title":"Local learning algorithms","venue":null,"work_id":"da0ba176-aac5-435c-a299-1e716b8e0179","year":1992},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.755383Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:c2ede1eb04fd1a79d354c3dc8e6702072baec853874ff7cad05433069bc51cfd","observation_id":"8e79969c-6f29-4420-86cb-aa44ffb4019d","resolution":{"observed_at":"2026-08-07T15:42:37.366099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T15:42:17.863956Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.863956Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:53756c929434d32960802d2949cda89a2024085bd20e0ce93256a85f7d290b62","observation_id":"688f2454-ccf2-41e7-9e34-6e53f9ed9882","resolution":{"observed_at":"2026-08-07T15:42:17.863956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08755","last_updated":"2024-04-22T19:17:49Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:53:47Z","title":"DAM: Dynamic Adapter Merging for Continual Video QA Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08755","snapshot_observed_at":"2026-08-07T15:42:17.967046Z","title":"Dam: Dynamic adapter merging for continual video qa learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.967046Z"},"links":{"cited_paper":"/paper/2403.08755","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:e47616ed4ed0ab4954d0c398da3e548ed3ddbc129e8377d60b55fd1338c4030e","observation_id":"5d8ffe5e-1075-4853-adee-58d21fefa0bc","resolution":{"observed_at":"2026-08-07T15:42:17.967046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:37.102933Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":"cbdcb0e6-ada1-4ddd-8265-c5b41890d7fc","year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.080648Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:77f9e99bf7f13bfe047e229b80234651a58d07993ae67990e3ff6c8223b7c078","observation_id":"44a6c1ea-a4d2-4c98-8933-6c94ba5857a4","resolution":{"observed_at":"2026-08-07T15:42:37.199967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:36.882586Z","title":"Robust locally weighted regression and smoothing scatterplots","venue":null,"work_id":"747174c6-cca6-4767-8193-49051edd5c8f","year":1979},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.164433Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:07a21368f677cee7c5be83238687c7eb405846fae0e772d7b37e2eb70120e221","observation_id":"483a20bf-93cf-4200-9ef4-e29202e8640b","resolution":{"observed_at":"2026-08-07T15:42:36.975901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:36.651699Z","title":"Locally weighted regression: an approach to regression analysis by local fitting","venue":null,"work_id":"b140c35a-0e0d-4cdd-8e2d-8b2d9987b5b6","year":1988},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.311932Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:810eb387268d4393a7677269ba51340770f80e4f244c6cd18df877628206965a","observation_id":"9417b1c5-3187-4c34-8acc-ae01b255b9af","resolution":{"observed_at":"2026-08-07T15:42:36.750851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:36.480533Z","title":"Model merging by uncertainty-based gradient matching","venue":null,"work_id":"bf5b3720-e268-46db-a7a9-1f1b890a8458","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.401728Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:b7ef9c876b4c7a9cad2a509a1a1d3c838139e7ceafcd74c93d779e42aae694d9","observation_id":"0b1db69c-92f7-4711-bd59-c8a1f9032710","resolution":{"observed_at":"2026-08-07T15:42:36.546646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-07T15:42:18.488521Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.488521Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:9bb5aa12c3a723fb568d068640ed777f74164a2d9064cf4a069dab1b9ad9dadb","observation_id":"c690fa08-63e9-425e-8535-ae3539ae7763","resolution":{"observed_at":"2026-08-07T15:42:18.488521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05298","last_updated":"2025-04-07T17:56:31Z","snapshot_observed_at":"2026-08-07T16:07:51.376018Z","submitted_at":"2025-04-07T17:56:31Z","title":"One-Minute Video Generation with Test-Time Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05298","snapshot_observed_at":"2026-08-07T15:42:18.611106Z","title":"One-minute video generation with test-time training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.611106Z"},"links":{"cited_paper":"/paper/2504.05298","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:56a29fb1d41ad751ac0bae2f97130ec6e54b191d4c35c3d77df86b71a22f3244","observation_id":"3c14d67b-c186-4474-a289-0dbcca338076","resolution":{"observed_at":"2026-08-07T15:42:18.611106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:36.209009Z","title":"Ensemble methods in machine learning","venue":null,"work_id":"541a9cb4-d837-49ab-85c3-bdb28154eab2","year":2000},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.725297Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:fd2e77321db8ad1906f7c9f947967a2c194c90ef51baadd0a4999d4a8eb5871f","observation_id":"6cdbec9b-fee1-4bcc-866b-f52df688ae82","resolution":{"observed_at":"2026-08-07T15:42:36.340165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.965750Z","title":"Test-time training with masked autoencoders","venue":null,"work_id":"c845e78e-223d-4d62-a46e-24da754ec1ed","year":2021},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.808003Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:08a216a08f2b2ab4f42a5ffdd9a885fac591bb84abb92ca0d80861884017eec1","observation_id":"894aa328-5123-4dda-a541-a4320cd983f2","resolution":{"observed_at":"2026-08-07T15:42:36.072414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.713544Z","title":"Loss surfaces, mode connectivity, and fast ensembling of dnns","venue":null,"work_id":"d779ce86-b1e4-4457-813c-dc929f5fcb47","year":2018},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.955075Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:7dd6ed46dad71ff4067b9787f0674374f96d2d15b433db9f46ec641ad52914e8","observation_id":"b6d68517-0b9b-4287-9774-455ddacbf745","resolution":{"observed_at":"2026-08-07T15:42:35.865538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:42:19.084909Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.084909Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:4b63ed76f0cf278325af384033f3277ff65fb84e72b54872c45d509067edcb67","observation_id":"b09027ed-38c5-4c40-a951-96d0bc23b0d3","resolution":{"observed_at":"2026-08-07T15:42:19.084909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:42:19.207296Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.207296Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:94a6bdd6f8bc7ed507a5c4eeaa1fb6dcbb489317f87304a639ecb87c36ec66de","observation_id":"0366fb06-50ce-4186-9a52-3582be47e2a4","resolution":{"observed_at":"2026-08-07T15:42:19.207296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14177","last_updated":"2023-03-24T17:38:58Z","snapshot_observed_at":"2026-08-01T15:00:39.464566Z","submitted_at":"2023-03-24T17:38:58Z","title":"Scaling Expert Language Models with Unsupervised Domain Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14177","snapshot_observed_at":"2026-08-07T15:42:19.320715Z","title":"Scaling expert language models with unsupervised domain discovery","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.320715Z"},"links":{"cited_paper":"/paper/2303.14177","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:2ff4d3ef2c76af2519f7a100587f561684a5163ead37fc22919b77a5e9c60e8b","observation_id":"b700499a-34f2-4a2c-ac60-b4c67ed46b52","resolution":{"observed_at":"2026-08-07T15:42:19.320715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.486151Z","title":"Retrieval augmented language model pre-training","venue":null,"work_id":"4a0f9092-d70b-4186-832e-e82f932fe9fc","year":2020},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.419162Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:63a6db90afdebea0f6c1860fe9f205fa475b8690a1fc0262f1081555d72e48f7","observation_id":"6c76160d-314f-42c2-8740-83ce8aaec0d9","resolution":{"observed_at":"2026-08-07T15:42:35.595720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.244928Z","title":"Test-time training on nearest neighbors for large language models","venue":null,"work_id":"dfaadc89-1a71-49e9-b405-98dee4420761","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.545328Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:d312ba80e8014dc95eea0e27ff3ee71aec5b4ea1a4082c640526d60fbc9cf9b9","observation_id":"5e0acaeb-7170-4ee4-bf16-6b65c82fa891","resolution":{"observed_at":"2026-08-07T15:42:35.368500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:19.657209Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.657209Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:c05fc71818ce7617b699ae17cce18d2db1af6592333281cf171b69acfa57214b","observation_id":"3403c4c1-1f84-4793-99b5-27938cbd7adf","resolution":{"observed_at":"2026-08-07T15:42:19.657209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:19.778274Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.778274Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:897fb6dbe69e6f4af465404eb3d5849b989930d5f69bf204adf467e8f757e479","observation_id":"d46d9d77-0fd0-4e4b-929b-c56649afbb54","resolution":{"observed_at":"2026-08-07T15:42:19.778274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.002324Z","title":"Transductive active learning: Theory and applications","venue":null,"work_id":"49570d1a-ae05-41a4-8c8b-cb9c67d5242b","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.881368Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:657c02a3ed90c36739b34633d5c26b2e14c72684966f1b8b7154aca620556b08","observation_id":"45241f8a-5b7b-4ef4-b3b1-5fbdbacec3a8","resolution":{"observed_at":"2026-08-07T15:42:35.114607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.857358Z","title":"Efficiently learning at test-time: Active fine-tuning of llms","venue":null,"work_id":"8ff9f4b2-ec35-4cbc-abe1-7873cfd6f7a7","year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.982053Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:3eeb0fafd171dc225d64a4b88a8ffe08e5e239e2be279ce8ee98a965127d0440","observation_id":"0c564aba-5a74-4273-b9cd-5c6f695e9d14","resolution":{"observed_at":"2026-08-07T15:42:34.926933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.708087Z","title":"Editing models with task arithmetic","venue":null,"work_id":"a13d3f7a-d890-4562-9f6d-44932c315939","year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.214130Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:12dc8d386f420b79d19f591f29a0051d2258df9f3e0d82554d627d99fff5c061","observation_id":"6f7ca5ab-1e17-4361-8dee-193cb466653d","resolution":{"observed_at":"2026-08-07T15:42:34.773176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.482035Z","title":"Averaging weights leads to wider optima and better generalization","venue":null,"work_id":"4c8bec5b-ba9d-4e44-a9b0-3a7494518e29","year":2018},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.306518Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:db0f627668e5afffaed8206b0ab47fb2ecc1f82d9ae645cf3186d599c3782dd7","observation_id":"9c6a4e22-1c80-4049-b499-04669cfdd062","resolution":{"observed_at":"2026-08-07T15:42:34.599954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.286837Z","title":"Data clustering: 50 years beyond k-means","venue":null,"work_id":"3f529c46-ca49-408c-a7b9-ead7348f4c2a","year":2010},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.514328Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:d9e81659dbbecfa1bbc3b1a67c5f9c969454e78086116da0ca85d9d0b78e1217","observation_id":"a647910f-62ea-485d-adc6-3380a52256a3","resolution":{"observed_at":"2026-08-07T15:42:34.376808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.127794Z","title":"Online domain adaptation of a pre-trained cascade of classifiers","venue":null,"work_id":"3448cf25-e53a-49a6-81f8-e6bdd38e7686","year":2011},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.599411Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:0b2219b0f96d966fe2634fc91c1cff2796968088f64cd21920d184c5d33f4c90","observation_id":"ce90a2cb-2155-48bf-82ff-2cc9dbe9d09b","resolution":{"observed_at":"2026-08-07T15:42:34.206858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.942812Z","title":"Llm-blender: Ensembling large language models with pairwise ranking and generative fusion","venue":null,"work_id":"a3f068e2-807c-41da-bc28-8ac86288489c","year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.701258Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:efdab329a550bf84277b0771b94435603aed71a8bd5d202b2762f8f8c5d66a6f","observation_id":"7224f32c-663a-4394-88e0-45346641c877","resolution":{"observed_at":"2026-08-07T15:42:34.038607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.778166Z","title":"Dataless knowledge fusion by merging weights of language models","venue":null,"work_id":"cabe209e-4ed1-4663-ab26-e66c1cfc5a61","year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.789395Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:b3cb2582c75b8e6a8c92cf1888cc1ae67b0151a225141634815c4eb625e8dc59","observation_id":"efa7732b-6d4a-477f-86fc-a3d06da64fd3","resolution":{"observed_at":"2026-08-07T15:42:33.853625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19098","last_updated":"2026-05-22T15:30:44Z","snapshot_observed_at":"2026-08-07T23:04:10.083357Z","submitted_at":"2024-12-26T07:42:06Z","title":"SyMerge: From Non-Interference to Synergistic Merging via Single-Layer Adaptation","version":4},"cited_work":{"arxiv_id":"2412.19098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19098","snapshot_observed_at":"2026-08-07T15:42:25.988601Z","title":"SyMerge: From Non-Interference to Synergistic Merging via Single-Layer Adaptation","venue":"cs.LG","work_id":"b00a9daa-b797-4532-a5ec-878803052562","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.895955Z"},"links":{"cited_paper":"/paper/2412.19098","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:0307a27c884870ddf47bcc7598957a06246db6584c19a90bfc3775986dc88f47","observation_id":"bbf018a9-c097-4be0-9c40-6836b3cc0816","resolution":{"observed_at":"2026-08-07T15:42:26.033203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.597996Z","title":"Generalization through memorization: Nearest neighbor language models","venue":null,"work_id":"584e7544-0f1c-4dea-8b18-50f05d49752e","year":2020},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.985893Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:48898b6b5fb2eea65676e5c8b665f5ca2e7f492fa62068f6c62e6c65b7de592e","observation_id":"67cedf8f-cfe0-4e81-b7a1-a8cc98a7ce46","resolution":{"observed_at":"2026-08-07T15:42:33.684198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.396620Z","title":"Dynamic evaluation of neural sequence models","venue":null,"work_id":"959dd573-2473-49df-a4d2-b165a3401255","year":2018},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.068964Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:3ae7768b10cd9a90a772827e627a4d93d68dec6a9681852d74c18c8c3a445d1d","observation_id":"6f1bf15d-9dfb-48d3-a371-b59a6c68310a","resolution":{"observed_at":"2026-08-07T15:42:33.485743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08378","last_updated":"2019-04-17T17:26:01Z","snapshot_observed_at":"2026-08-05T20:05:19.093291Z","submitted_at":"2019-04-17T17:26:01Z","title":"Dynamic Evaluation of Transformer Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08378","snapshot_observed_at":"2026-08-07T15:42:21.167110Z","title":"Dynamic evaluation of transformer language models","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.167110Z"},"links":{"cited_paper":"/paper/1904.08378","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:e6c2b306d80c415ffd34010821b33e496d929570786e25bd98b52d2f729836fd","observation_id":"200186a7-a4ba-4468-a194-526ef02e0711","resolution":{"observed_at":"2026-08-07T15:42:21.167110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04411","last_updated":"2026-07-20T03:20:46Z","snapshot_observed_at":"2026-08-09T18:37:08.614761Z","submitted_at":"2025-02-06T11:26:30Z","title":"Mediator: Memory-efficient LLM Merging with Less Parameter Conflicts and Uncertainty Based Routing","version":3},"cited_work":{"arxiv_id":"2502.04411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04411","snapshot_observed_at":"2026-08-07T15:42:25.856629Z","title":"Mediator: Memory-efficient LLM Merging with Less Parameter Conflicts and Uncertainty Based Routing","venue":"cs.LG","work_id":"3c6af1aa-b4fb-4d6d-a896-75ac891d4fd5","year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.281499Z"},"links":{"cited_paper":"/paper/2502.04411","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:fc25d1f9a44a785061a5e9e7fc5a9f7839bb328940c915cbde66805bb685549f","observation_id":"1c92c14e-10c5-49a3-bdaf-8a6e5ac0f3ab","resolution":{"observed_at":"2026-08-07T15:42:25.897996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.228962Z","title":"u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt \\","venue":null,"work_id":"349a910c-1182-4222-8adc-32da79898357","year":2019},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.412505Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:378a120439060880ccf178479f8553bd912f565f7bc4cea13f92e97100ed59f1","observation_id":"f679da36-a06e-4377-b785-798b607e6162","resolution":{"observed_at":"2026-08-07T15:42:33.312813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-07T15:42:21.516966Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.516966Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:685921c13efeaceb01619bab0450bd4d819efd676a04942cf47098d7290f557e","observation_id":"7b058177-784b-435a-a3ff-7acf76772da6","resolution":{"observed_at":"2026-08-07T15:42:21.516966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.062127Z","title":"Dexperts: Decoding-time controlled text generation with experts and anti-experts","venue":null,"work_id":"270fb671-3508-4d6b-93c7-f0eac921f3c6","year":2021},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.630172Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:d2bf1f9d60ab444d595b1d5736a65474e43b6d0c06efaff54bb5be747df16c34","observation_id":"4f00b3f1-55ff-4655-bdb2-be73a8482d96","resolution":{"observed_at":"2026-08-07T15:42:33.133666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.892178Z","title":"Multivariable functional interpolation and adaptive networks","venue":null,"work_id":"9f426f1d-be8f-45f7-ba22-5d17231338e7","year":1988},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.747338Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:c28db71e2ac2cc6a8afa7b0710348619990c9f2ad641434f919a2408b1e021bc","observation_id":"44720ceb-7c44-4c5e-828e-da27d467246a","resolution":{"observed_at":"2026-08-07T15:42:32.984327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.741938Z","title":"Twin-merging: Dynamic integration of modular expertise in model merging","venue":null,"work_id":"46e883fa-755b-4ecd-acdd-eb7dfecae170","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.824509Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:620edfd9090212ff0121fb2326551879be95c3bc59a53fdc2c2f180542dce257","observation_id":"61f9c57b-1992-4462-89ad-7e254663a618","resolution":{"observed_at":"2026-08-07T15:42:32.812385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.517722Z","title":"Merging models with fisher-weighted averaging","venue":null,"work_id":"f39378d7-3f24-4f8c-8417-80a7043279bc","year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.902766Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:aeb05241d6cc75e721dbfb4f13991bed2d16c809de94149a83a55c835ddd73d8","observation_id":"aa047537-5670-4847-a76c-e6796bae7f0d","resolution":{"observed_at":"2026-08-07T15:42:32.659125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.251559Z","title":"Pack of llms: Model fusion at test-time via perplexity optimization","venue":null,"work_id":"21161dae-fc62-4b1d-8e81-d8a9c82efe93","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.963114Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:d6905c56269026410c25e582e18b257f9eca1fe5ef9992b0260a2c72f6a18cd4","observation_id":"0c60b6b0-0436-4e20-a6aa-a3c936fe74e8","resolution":{"observed_at":"2026-08-07T15:42:32.401434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:31.871346Z","title":"Fast learning in networks of locally-tuned processing units","venue":null,"work_id":"ccf7ce7f-af95-4c22-a9a0-5298eaa17bef","year":1989},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.042426Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:ac233e4a9c9a320b9ce492ba116012aaec5716d5f4ebff86aae7db16e008f92f","observation_id":"78603686-6705-43da-bbb9-d6ad620f54d5","resolution":{"observed_at":"2026-08-07T15:42:32.063336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:31.481754Z","title":"On estimating regression","venue":null,"work_id":"24426426-314a-4367-ab47-a661e87ce22f","year":1964},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.166824Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:f589118d61b358b60bd189f4bc77dc0892e7596fc58aa7199eeabe31315c4df1","observation_id":"4d3067e0-6e61-495d-9aa5-fea18cb004b0","resolution":{"observed_at":"2026-08-07T15:42:31.629098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:31.191896Z","title":"Dawin: Training-free dynamic weight interpolation for robust adaptation","venue":null,"work_id":"427706aa-82bf-4e60-a2dc-eb1b581e03ad","year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.245145Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:d0ed7ec528da96e8f6d0b784a7b90834d657264f531b0cb4bd8d7ad47446a871","observation_id":"f9ca9869-a205-42c4-9428-b0eecfeebcdd","resolution":{"observed_at":"2026-08-07T15:42:31.289886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:30.996588Z","title":"On estimation of a probability density function and mode","venue":null,"work_id":"c6ac9a92-27c1-475e-b70d-a69d19c1c1e5","year":1962},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.317921Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:140908df6ce5b7e69bdbc18d360f042d1458ae17d7faa1e472cdce651c5ba8fa","observation_id":"8fff8a72-3484-4727-94c2-9c2f1244d29f","resolution":{"observed_at":"2026-08-07T15:42:31.079364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-07T15:42:22.417681Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.417681Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:36fe480f200f494edecd99708e6d8db3fa547e799f2a8953c4222824424d7464","observation_id":"733b3e81-8f4d-43fd-b2ba-ba7a8eb33670","resolution":{"observed_at":"2026-08-07T15:42:22.417681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:22.509217Z","title":"Mingle: Mixtures of null-space gated low-rank experts for test-time continual model merging","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.509217Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:6f9a61442fd36c96298c58d3bc4071f223e78e7a28d408501ce036da3f83a4bb","observation_id":"a392aea4-7edc-4ab1-a210-2eebc33457ae","resolution":{"observed_at":"2026-08-07T15:42:22.509217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:30.580074Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":"6f2274e5-8740-40b6-ba58-9ccd3c9e473d","year":2019},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.583606Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:a6a1754d19bf547ae7244fdd473841059a119c302cda44c5a3e8a4b68b946e63","observation_id":"baa14e24-7dd0-4c58-93b4-1abe85b19cc3","resolution":{"observed_at":"2026-08-07T15:42:30.761505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:30.248644Z","title":"Remarks on Some Nonparametric Estimates of a Density Function","venue":null,"work_id":"6949125d-854d-4b0f-ade3-54a00478a444","year":1956},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.657787Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:4540abbc0fbdd511507684ec1507841d7d52ee5a3aa9906906ce7d71b398b5ae","observation_id":"fc9962c5-04c2-4d4f-b506-c9f2d499b581","resolution":{"observed_at":"2026-08-07T15:42:30.404692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:22.738268Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.738268Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:a300ebc3d2e361072bf080e6130e66f9f8d601466f92584d4880e19aac133458","observation_id":"88a80c22-1f81-44db-a666-cc27371b6d47","resolution":{"observed_at":"2026-08-07T15:42:22.738268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.993110Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"1b1c1c62-ab16-4d4d-a51c-57f600f79018","year":2017},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.826317Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:7202daaf40cc1a472c5636c5b9ef3ede0c5f8aadfc14f1133da6ee935628eeb5","observation_id":"b92bbd08-3c22-4ae7-a312-9ec539f64ffd","resolution":{"observed_at":"2026-08-07T15:42:30.145939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.751113Z","title":"zero-shot","venue":null,"work_id":"65ea57aa-93fd-426f-aa6d-bae1afb6c5ab","year":2018},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.923014Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:569106a188e37f3162ca863f2a20607a83da072c56c42ee768ec07f8f198e120","observation_id":"0e12106d-8fa4-4938-b008-9ac07166fd39","resolution":{"observed_at":"2026-08-07T15:42:29.873608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00735","last_updated":"2025-03-05T11:50:24Z","snapshot_observed_at":"2026-08-07T17:36:26.589079Z","submitted_at":"2025-03-02T05:16:43Z","title":"LADDER: Self-Improving LLMs Through Recursive Problem Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00735","snapshot_observed_at":"2026-08-07T15:42:23.014357Z","title":"Ladder: Self-improving llms through recursive problem decomposition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.014357Z"},"links":{"cited_paper":"/paper/2503.00735","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:31bdac2449e8c0f28921981f1b75e04becf0b9caf0dd0c86070472c378890f50","observation_id":"a274a264-6174-4a1a-8172-681ab2628e82","resolution":{"observed_at":"2026-08-07T15:42:23.014357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.497671Z","title":"Mpnet: Masked and permuted pre-training for language understanding","venue":null,"work_id":"c1821b7d-e8fc-4cad-8fce-1aa31ceb7bf6","year":2020},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.136802Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:900bfdbeb1222dac53d306bd3a0be8ba5b6f52d4f8e693302e424d913d9c599d","observation_id":"5e7fb700-a741-407a-92e9-0b52eb222296","resolution":{"observed_at":"2026-08-07T15:42:29.595292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07816","last_updated":"2024-03-12T16:54:58Z","snapshot_observed_at":"2026-07-06T17:43:27.034067Z","submitted_at":"2024-03-12T16:54:58Z","title":"Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07816","snapshot_observed_at":"2026-08-07T15:42:23.213346Z","title":"Branch-train-mix: Mixing expert llms into a mixture-of-experts llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.213346Z"},"links":{"cited_paper":"/paper/2403.07816","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:4fc894c39147a52adc46bac0bfdfd70f0a02f7f416e984c2d3249827242aeece","observation_id":"dfe73e53-d8b5-4f2e-b67b-30beea896380","resolution":{"observed_at":"2026-08-07T15:42:23.213346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.186097Z","title":"Test-time training with self-supervision for generalization under distribution shifts","venue":null,"work_id":"4d914018-d035-42d3-a252-c60997e61e83","year":2020},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.341237Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:bb22a8d8d7f79703ad5dda7aa2c1b6de87adfb5a2e860ad30717d7b15a742946","observation_id":"fc00bfb9-95cf-45aa-94f2-935c82dfdc72","resolution":{"observed_at":"2026-08-07T15:42:29.365063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-08-07T15:42:23.423287Z","title":"Learning to (learn at test time): Rnns with expressive hidden states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.423287Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:540f26d07e7cfe2d79e5634260e3eb18a7260e67084e470b72713e25b55874dd","observation_id":"3b8bc1b6-06ca-4ae7-b765-9bda8c1de3b6","resolution":{"observed_at":"2026-08-07T15:42:23.423287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:28.867618Z","title":"Merging multi-task models via weight-ensembling mixture of experts","venue":null,"work_id":"2d42f97f-51fa-4246-ad80-70d2602edb42","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.542167Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:6738427668e348c7a86ef0381ba02d1bf8ef448c3e0cb2209737462002543113","observation_id":"68cf8490-0673-4f87-b70d-d8acc74993ca","resolution":{"observed_at":"2026-08-07T15:42:28.982827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:28.515267Z","title":"Parameter efficient multi-task model fusion with partial linearization","venue":null,"work_id":"b0667454-6b15-4f07-b0b6-109453efab88","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.635419Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:8b5987cfff24951d8988cbf831a484ae56263c2ccf4ae6722a44121954e7333b","observation_id":"7f389d98-efe0-4723-9799-74d1c7253320","resolution":{"observed_at":"2026-08-07T15:42:28.688694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09522","last_updated":"2025-01-16T13:17:24Z","snapshot_observed_at":"2026-08-09T07:26:12.858254Z","submitted_at":"2025-01-16T13:17:24Z","title":"Merging Models on the Fly Without Retraining: A Sequential Approach to Scalable Continual Model Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09522","snapshot_observed_at":"2026-08-07T15:42:23.729292Z","title":"Merging models on the fly without retraining: A sequential approach to scalable continual model merging","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.729292Z"},"links":{"cited_paper":"/paper/2501.09522","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:c5f761345398c070504729d7bfe7960bdcab1791475c2a3ca51b83f89f8971d2","observation_id":"ca64357b-b85a-4813-8636-237212ceaa2f","resolution":{"observed_at":"2026-08-07T15:42:23.729292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:23.825753Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.825753Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:84a6fc27714e80e329930969ea3e0e3c6ed4a5042b2f457353931adef4c31473","observation_id":"443ec839-e33c-41fb-a228-ffd1e81b1747","resolution":{"observed_at":"2026-08-07T15:42:23.825753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:28.149458Z","title":"Smooth regression analysis","venue":null,"work_id":"e95db55b-060d-42c2-8c40-333879c305df","year":1964},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.921104Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:4c9feeb0b086ae95d0cadbe72c14b66717fdba2704bcd4770aa42b94ed30fd5c","observation_id":"6cf2d74d-87f5-4b26-a911-bbfc510117fb","resolution":{"observed_at":"2026-08-07T15:42:28.279502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:24.011817Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.011817Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:bc94e95898f8d2cdf9ec693b166fe9a12a77774486b6a4986ead4a9c762a972a","observation_id":"b87c8307-b345-4f50-bd13-3f1c59dfc8c0","resolution":{"observed_at":"2026-08-07T15:42:24.011817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:27.831143Z","title":"Wikimedia downloads, 2025","venue":null,"work_id":"f8351b5b-375a-4c19-86fd-1facd0a8dfbe","year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.112741Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:d1ccf9911246b25d2a4a55763a74139f81030fde2b64fb896ddd86d162626538","observation_id":"b5cae1f6-1492-45b4-a5e6-ca02acfa4eba","resolution":{"observed_at":"2026-08-07T15:42:28.013645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02113","last_updated":"2025-07-10T13:56:52Z","snapshot_observed_at":"2026-08-07T17:39:13.854586Z","submitted_at":"2025-03-03T22:56:04Z","title":"Deep Learning is Not So Mysterious or Different","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02113","snapshot_observed_at":"2026-08-07T15:42:24.192013Z","title":"Deep learning is not so mysterious or different","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.192013Z"},"links":{"cited_paper":"/paper/2503.02113","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:ff06b405590c30d704bf7a6af8b7f2496731b90fcc107d09f979005a7a541598","observation_id":"8c4aaa53-4f58-45a3-812a-b2f826223c0f","resolution":{"observed_at":"2026-08-07T15:42:24.192013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:27.575015Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"e42d35cd-e6da-42e0-b2bd-2f38b7e0a65b","year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.277341Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:de06ca5c175e7a9c2f703a26dcb1ebce5ba2460cbec5487b63f2af8f1ab29f2e","observation_id":"578e2044-36f4-482a-afcf-82e20bc674e0","resolution":{"observed_at":"2026-08-07T15:42:27.648451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:27.319885Z","title":"Ties-merging: Resolving interference when merging models","venue":null,"work_id":"84696721-ac92-4afc-ac12-1a69ea6cc08c","year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.437332Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:aa30da4507cf75f6e87ac4f83b401e95d04ec3fd38fd4c1aff47f92be1873690","observation_id":"39f33703-f07d-43f9-9e5a-dc7511446229","resolution":{"observed_at":"2026-08-07T15:42:27.492986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:42:24.508001Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.508001Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:4cd7a5fb4e0908bd188053ab16d5f6ac56ad952ef1f349c0452fe3a318f97ed8","observation_id":"891c9306-9037-4552-aca2-1ec5d8b41430","resolution":{"observed_at":"2026-08-07T15:42:24.508001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-07T15:42:24.591607Z","title":"Model merging in llms, mllms, and beyond: Methods, theories, applications and opportunities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.591607Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:edf0e450cc7066e2817fba219b556ebc520ee0eec5a25ded2e99dae9ec600c3d","observation_id":"7e35ebee-1598-4686-8fb5-0ffad5eedf35","resolution":{"observed_at":"2026-08-07T15:42:24.591607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:26.995806Z","title":"Adamerging: Adaptive model merging for multi-task learning","venue":null,"work_id":"e5e90ce5-62ca-49dc-a4e8-c30ff048ab11","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.699948Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:167d65d43c9415bb8301c65dd87dee2bb4975438230fd88019e7dd37198700f1","observation_id":"9d33e034-3b0c-4395-9b6b-061d185616d8","resolution":{"observed_at":"2026-08-07T15:42:27.138095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:26.598358Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch","venue":null,"work_id":"d5bb42e1-eb66-4f7f-b7a6-2570f5e6dc9c","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.781502Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:0013d3ef34ab5fc21e916f04b021d7c8a589d76e3c8d4b90b99c179c7a651cbf","observation_id":"40204dd1-77a3-41d2-8ba5-c3827029260e","resolution":{"observed_at":"2026-08-07T15:42:26.855130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19048","last_updated":"2025-01-23T16:01:22Z","snapshot_observed_at":"2026-08-07T06:21:24.878689Z","submitted_at":"2024-12-26T04:05:28Z","title":"Jasper and Stella: distillation of SOTA embedding models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19048","snapshot_observed_at":"2026-08-07T15:42:24.855271Z","title":"Jasper and stella: distillation of sota embedding models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.855271Z"},"links":{"cited_paper":"/paper/2412.19048","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:916ee6fd432e8e16127685499a86373494a5e4bdcb31088edca3c365d93d0553","observation_id":"b53a7650-fd37-4c8e-b3b8-aee7469ecc20","resolution":{"observed_at":"2026-08-07T15:42:24.855271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:26.256993Z","title":"Bam! just like that: Simple and efficient parameter upcycling for mixture of experts","venue":null,"work_id":"b3926db6-c5bd-46f2-8c81-bdd5df936818","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.949450Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:ac57d412ad2f8ed4625ae566b87412bdaaedcaaa6f91f7d462efee2741d1e904","observation_id":"41b49fd7-6fc4-4990-8850-8b7532f87536","resolution":{"observed_at":"2026-08-07T15:42:26.390475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00075","last_updated":"2025-01-31T07:54:34Z","snapshot_observed_at":"2026-08-08T16:25:12.403074Z","submitted_at":"2025-01-31T07:54:34Z","title":"BTS: Harmonizing Specialized Experts into a Generalist LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00075","snapshot_observed_at":"2026-08-07T15:42:25.004379Z","title":"Bts: Harmonizing specialized experts into a generalist llm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.004379Z"},"links":{"cited_paper":"/paper/2502.00075","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:ee1a71c8393e8cb3f218a351a5bf836e7142dc42edbffb00a07a748bb3de80ad","observation_id":"44264d05-83d7-41fc-a250-54f05126a1ae","resolution":{"observed_at":"2026-08-07T15:42:25.004379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:26.196248Z","title":"Mixture-of-experts with expert choice routing","venue":null,"work_id":"343e347c-a2c8-4249-b3a5-bf7b59775e7e","year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.066864Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:fd447c781c8ed2b96226ab3e252fd050f5d808878b58b00e4839177a97674901","observation_id":"5a3b67ce-acc5-45bc-9f56-0f731d495933","resolution":{"observed_at":"2026-08-07T15:42:26.222828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-07T15:42:25.150277Z","title":"Ttrl: Test-time reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.150277Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:87b758aa0cc87de44fb4e9ade3717403804b1a18c80c198a2a90ae8c3f6028ff","observation_id":"fd4dd804-8c1e-4860-9a4b-008189c67119","resolution":{"observed_at":"2026-08-07T15:42:25.150277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:25.216642Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.216642Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:424f1c8912a75534dc0bd885a597fd6c1b2abbf836864589dd651ec5b2b6d20c","observation_id":"0e4176ed-33f1-4360-9fc6-50259d6a4032","resolution":{"observed_at":"2026-08-07T15:42:25.216642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:25.292648Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.292648Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:0a7158bc86732b2e61490642908dc8120190add37b9efd6dbe393339e493f20b","observation_id":"746b7b7a-64df-4eab-8ffc-804e5633876c","resolution":{"observed_at":"2026-08-07T15:42:25.292648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:25.349473Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.349473Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:70995e44aab28b91d98ff1a430c9ff9570d02b9c87ef3232077c7341cbcafa12","observation_id":"0219b703-648f-4db5-8aad-38335cbee857","resolution":{"observed_at":"2026-08-07T15:42:25.349473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:25.419709Z","title":"G5ɞ8E(wZ N8,q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.419709Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:7d2063137155621c78764fb7f44cb7ab77639630117a717696dc5cd43d2f158a","observation_id":"e87997e7-541e-41c7-8a76-4cfb075a44ea","resolution":{"observed_at":"2026-08-07T15:42:25.419709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T08:04:31.821815Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":48},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 4 inbound Pith citation observations for arXiv:2505.14136."}