{"as_of":"2026-08-17T07:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6268a1ae43824059710486855caf9d7d67ffa725cff332d5d92919cf10bb0261","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:58:48.223776Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:34:48.033757Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T11:56:56.020482Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14126","snapshot_observed_at":"2026-08-05T17:34:48.033757Z","title":"Less is more: Undertraining experts improves model upcycling.arXiv preprint arXiv:2506.14126, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16084","last_updated":"2025-08-22T04:20:58Z","snapshot_observed_at":"2026-08-10T15:06:44.230590Z","submitted_at":"2025-08-22T04:20:58Z","title":"Intrinsic Strain-Driven Topological Evolution in SrRuO3 via Flexural Strain Engineering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:34:48.033757Z"},"links":{"cited_paper":"/paper/2506.14126","citing_paper":"/paper/2508.16084"},"observation_digest":"sha256:b8fdec8bda2cad0e8355faec079a2fcd12943a1ff2acc84736d59d1b689f37a1","observation_id":"280baf4d-7d34-4999-8a9c-240772f633fe","resolution":{"observed_at":"2026-08-05T17:34:48.033757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"cited_work":{"arxiv_id":"2506.14126","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.14126","snapshot_observed_at":"2026-07-02T11:56:56.020482Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","venue":"cs.LG","work_id":"779a8af2-8280-4345-b2ca-3f16fbe7f622","year":2025},"citing_paper":{"arxiv_id":"2606.06418","last_updated":"2026-06-04T17:22:58Z","snapshot_observed_at":"2026-08-16T10:17:57.703806Z","submitted_at":"2026-06-04T17:22:58Z","title":"Double Preconditioning (DoPr): Optimization for Test-Time Performance, not Validation Loss","version":1},"reference_index":180,"source":"arxiv_source","source_observed_at":"2026-06-28T02:35:39.845487Z"},"links":{"cited_paper":"/paper/2506.14126","citing_paper":"/paper/2606.06418"},"observation_digest":"sha256:610421de26ddd2c8d83a58b2d0900ce256bada86322703cd277d474bbffea8f5","observation_id":"494394b3-1467-4e9f-b5e4-6f1ccd68891e","resolution":{"observed_at":"2026-07-02T11:56:56.021856Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14126","snapshot_observed_at":"2026-07-12T05:28:12.811678Z","title":"Horoi, G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03011","last_updated":"2026-07-03T06:46:09Z","snapshot_observed_at":"2026-08-14T19:59:41.437798Z","submitted_at":"2026-07-03T06:46:09Z","title":"Can Model Merging Improve Aggregation in DiLoCo?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T05:28:12.811678Z"},"links":{"cited_paper":"/paper/2506.14126","citing_paper":"/paper/2607.03011"},"observation_digest":"sha256:ee61ebf695afec19e5b5b1accef948052b246deb8a96c9725ba4785f02a01b3c","observation_id":"cca2cb2c-5734-4bc6-bdd3-a8292f594343","resolution":{"observed_at":"2026-07-12T05:28:12.811678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14126","snapshot_observed_at":"2026-08-02T06:50:46.438907Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11997","last_updated":"2026-07-15T11:14:47Z","snapshot_observed_at":"2026-08-15T13:04:28.039862Z","submitted_at":"2026-07-13T16:08:30Z","title":"Are we Merging the Right Models? Impact of Expert Training Duration on Model Merging for LLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T06:50:46.438907Z"},"links":{"cited_paper":"/paper/2506.14126","citing_paper":"/paper/2607.11997"},"observation_digest":"sha256:0a1b053f4cba2a33f3958bc92d5772dc314f8b4f4fcda7a972af4c63780e6867","observation_id":"295c6de6-2825-41f3-a601-d3454334ba90","resolution":{"observed_at":"2026-08-02T06:50:46.438907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14126/citation-record","integrity":"/paper/2506.14126/integrity","json":"/paper/2506.14126/citation-record.json","paper":"/paper/2506.14126"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:49.177089Z","title":"Abnar, M","venue":null,"work_id":"964c20e0-fc46-4b3f-837f-1025185cbc1a","year":2022},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.929825Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:ce72e44726ed98c4227a1138c729ec1ed67360555e044cdcbc91350fec8bdd90","observation_id":"659fbd12-e022-4672-adb5-ddcd79a2c374","resolution":{"observed_at":"2026-08-15T19:58:49.181604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09327","last_updated":"2024-07-18T17:37:59Z","snapshot_observed_at":"2026-08-16T14:18:34.234611Z","submitted_at":"2024-02-14T17:17:30Z","title":"Information Complexity of Stochastic Convex Optimization: Applications to Generalization and Memorization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09327","snapshot_observed_at":"2026-08-15T19:58:47.935070Z","title":"Attias, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.935070Z"},"links":{"cited_paper":"/paper/2402.09327","citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:24f78e408350132a1f4036c0ffcde1ee5a3a5494bd7c36602ce9d5d209a69047","observation_id":"06262961-6531-433b-b705-53dc226253de","resolution":{"observed_at":"2026-08-15T19:58:47.935070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:49.162011Z","title":"Beeching, C","venue":null,"work_id":"3c166f6a-9131-466c-ae58-7003432f59a9","year":2023},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.940279Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:dee881c32b15ee2ad18ffb1f2ebb5ebd42f7a20c21dbc7d020a368524158d4a1","observation_id":"83752407-c83f-4293-afef-6afd28062d40","resolution":{"observed_at":"2026-08-15T19:58:49.166816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:49.147149Z","title":"Cheng, J","venue":null,"work_id":"50cf2d54-efc6-43ea-b9f4-9d705649adfb","year":2017},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.945067Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:3d1693ec017c4db5b8aa06dc21837be3853afa3c235163dee282eb55067ea005","observation_id":"8d2b98b1-fda9-4de9-b5d6-85fdee71ff10","resolution":{"observed_at":"2026-08-15T19:58:49.151681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:49.130237Z","title":"Choshen, E","venue":null,"work_id":"ca0da4ce-1e3d-4640-9128-ac9e3d10cbc5","year":2022},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.949966Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:e85d3befffc84372ffc28f1e43458ed903e2db464e8d2d484a90a209ee6b6101","observation_id":"554ea925-838d-4682-a2e4-0c60d53fc13d","resolution":{"observed_at":"2026-08-15T19:58:49.135868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:49.116656Z","title":"Cimpoi, S","venue":null,"work_id":"92b8e971-7142-4abe-a4de-3f3feb929ce7","year":2014},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.954516Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:ef8da3220ecf4ff7abf9bd960243122b0e895c5763517ef6451699075efcfb2d","observation_id":"ba580b97-39dd-4af0-af2a-8e0e9bc46790","resolution":{"observed_at":"2026-08-15T19:58:49.120826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:49.103540Z","title":"Davari and E","venue":null,"work_id":"f9f2657e-0301-402d-a250-141406ade228","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.959391Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:a3f7d390b98fc59c6ceb3eca29391b3fc2f57e6b52fd5704bc1624cca2eb91df","observation_id":"32c3f6bf-842f-48c1-a781-2e82827c067d","resolution":{"observed_at":"2026-08-15T19:58:49.107706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:49.089618Z","title":null,"venue":null,"work_id":"f1d0d6a8-8e5d-4908-be8f-2e7f2fbfca6d","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.964374Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:60b05ea79352c6668cb909cabfeef15842a11ee253451da795f9828478490a9d","observation_id":"f8aa1c4c-d8ca-4ec5-b2ab-6248bf2a9373","resolution":{"observed_at":"2026-08-15T19:58:49.094156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:47.968773Z","title":"Deepseek-v3 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.968773Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:6bd2f6394887d46e3a1d162f51a730ab21c5c08423b4da874902861814a2a089","observation_id":"58f51459-40e4-4400-9255-3d98bc4dfe35","resolution":{"observed_at":"2026-08-15T19:58:47.968773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:49.067665Z","title":null,"venue":null,"work_id":"1f0c4349-4b50-4b3c-82c5-7924342681a6","year":2012},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.973340Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:43ac60e9532b93c6fd8ef1bf9f1fcb083eb3148b094d2933ce38887c9a68e2de","observation_id":"0cd1f574-d74e-47d7-86a8-26a8dcb886e7","resolution":{"observed_at":"2026-08-15T19:58:49.071931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:49.053667Z","title":"Dosovitskiy, L","venue":null,"work_id":"808e496c-c21b-4dff-b4d6-6b9b68ac7fa1","year":2021},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.977611Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:aa2cf91857889df1a856788b9c3391db6b8a4988b357d769afbb2c7d28cfb73f","observation_id":"5e545428-35e4-42ea-8ad7-42bc0fb39f98","resolution":{"observed_at":"2026-08-15T19:58:49.058146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:49.040038Z","title":null,"venue":null,"work_id":"97d89293-bc51-4fd7-8747-ebb490f874b4","year":2020},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.982142Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:01703ab253c3284332c975b62257e74900d6da2a18aef7b6f671473dcbe92186","observation_id":"ca4b2429-8546-4e3c-872b-c9b3af05a738","resolution":{"observed_at":"2026-08-15T19:58:49.044254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:49.025784Z","title":"Feldman and C","venue":null,"work_id":"8266fcbb-6910-44eb-b181-3d96d8275a6f","year":2020},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.986986Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:4a10c881ff0a8e5164193d3c4825212bfcbf25e07894f3d7e53cfca83b987e6d","observation_id":"9be3add3-d433-4ef6-8caf-26b9254acef7","resolution":{"observed_at":"2026-08-15T19:58:49.030576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:49.010076Z","title":"Frankle, G","venue":null,"work_id":"00b0b489-76b7-4d79-b1a2-512e9e0f6440","year":2020},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.991224Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:548db2c9f78b7a78d84f331c0f6787f8f7d67ddeaa7bb7195a6c9911b203cc3f","observation_id":"d875dcad-4071-4fc0-a9a6-21d95becf00c","resolution":{"observed_at":"2026-08-15T19:58:49.014673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.995768Z","title":"Goddard, S","venue":null,"work_id":"3b334b7a-5366-4621-b20e-80c9ad46343a","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.995644Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:4912bf394c032cd37c5a2f09a44fff51c08b35b0a2335ebe41e356e814e2a0c0","observation_id":"9930667e-9a61-4785-9790-03284ead7db6","resolution":{"observed_at":"2026-08-15T19:58:48.999907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.982165Z","title":"Grattafiori et al","venue":null,"work_id":"1137f649-21f2-4036-b457-05c44b01fead","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:47.999957Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:2ee86191146475f3fc2a147c9df6483791afbf0069c958fda6e6353fdf80175d","observation_id":"7e609a59-c7e2-46be-b209-68400999d926","resolution":{"observed_at":"2026-08-15T19:58:48.986527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.968446Z","title":null,"venue":null,"work_id":"a7f4ba4b-eb0c-4ebf-964a-0609010668d4","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.004346Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:560aa156f58dc0cd5301f7c3b5575cdce9776f8a803f4a5297ed58f0a39371ab","observation_id":"b262cd00-3ffa-4b07-b2b3-264cd56a2cc6","resolution":{"observed_at":"2026-08-15T19:58:48.972804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.954530Z","title":"Helber, B","venue":null,"work_id":"e2a3f8d8-429a-4bfb-9e5b-afda9a6d43ed","year":2019},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.008782Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:e685eb715ea1a81009a7f9318589b7332eda5096e290b4e3db7758da2bd43f29","observation_id":"e23796dc-ac01-4071-bfed-a1fe9b952e9e","resolution":{"observed_at":"2026-08-15T19:58:48.958980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.940624Z","title":null,"venue":null,"work_id":"674ce4ba-5e60-49ec-9b23-fcfdfbb54c01","year":2022},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.012956Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:4805e0f678d1d619863a36fed018c844208aa25af04ce3880f2410bab9e4c845","observation_id":"acb4558d-e728-431d-9d79-3e823f604491","resolution":{"observed_at":"2026-08-15T19:58:48.945012Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.017358Z","title":"Huang, Q","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.017358Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:c99a8184e05ea0c2d15f7fec352df9cae35c6be2e592302c371dd18833379250","observation_id":"a79e406a-d4c2-40c9-9777-b6eb048e9c19","resolution":{"observed_at":"2026-08-15T19:58:48.017358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.917969Z","title":"Ilharco, M","venue":null,"work_id":"a29ea714-c184-4820-b5f3-3010851f2775","year":2023},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.021759Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:46a51d2221ab899daacb9722463ba4c62e97abccedaf302646c1f1671508785c","observation_id":"b6d77ebc-976e-476f-a8b2-9f5c6955d1ba","resolution":{"observed_at":"2026-08-15T19:58:48.922886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.026391Z","title":"Ilharco, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.026391Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:da8c3e4b79bf930db6321dfe721694c17d1a42c20ddf527c0a298d3b36591f24","observation_id":"9d401b8c-74ee-47f5-a35f-85ee8679aaac","resolution":{"observed_at":"2026-08-15T19:58:48.026391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.895899Z","title":"Izmailov, D","venue":null,"work_id":"90115a46-d3d2-4cc7-9393-84a223592f61","year":2018},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.030522Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:ceb2769f76afe4a6328c7ebfeaf943845a8704cb8248121f877b3dafa3dd3e67","observation_id":"ea651064-6ef2-4d86-8223-3cf956769119","resolution":{"observed_at":"2026-08-15T19:58:48.900545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.880845Z","title":null,"venue":null,"work_id":"40d57364-2a57-4603-b8d9-47b1a26467be","year":2023},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.034699Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:e92892fc215e5c9762765d85aea56aafb1f54ae027119620179f2e5094ca1de6","observation_id":"8f86d92c-da0e-4818-9c45-68adf32346ba","resolution":{"observed_at":"2026-08-15T19:58:48.885586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.865888Z","title":"Kandpal, B","venue":null,"work_id":"4a7a6e2a-f1b4-4748-9412-51ba909c2364","year":2023},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.039066Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:f9aea5d4d67758734148d1ea5b825cbf39978dd8ed28112cf579533701090b6f","observation_id":"df5772ca-0258-4315-b6a1-1056b9633cf9","resolution":{"observed_at":"2026-08-15T19:58:48.870601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.851437Z","title":null,"venue":null,"work_id":"9cca2155-0077-4e4e-add2-e09d49970edb","year":2020},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.043226Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:1e319916575551a71bc3bddbcc12fecaba51b158e7c1e9ce0259aff73f0deef5","observation_id":"a8885488-8c16-46f0-972c-3cff2b898df0","resolution":{"observed_at":"2026-08-15T19:58:48.855841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.837143Z","title":"Krause, M","venue":null,"work_id":"19db4c28-f04a-4eac-a3ad-abbcc4249b76","year":2013},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.047541Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:f17a08540d045ccfdaf948d1460971d8a9864c3ad413ae445b0dd939abfd5d08","observation_id":"b34cee53-e6fc-4b9c-b5c4-d7bd5f61cc1b","resolution":{"observed_at":"2026-08-15T19:58:48.841517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01867","last_updated":"2024-01-03T18:19:51Z","snapshot_observed_at":"2026-08-16T14:30:02.291362Z","submitted_at":"2024-01-03T18:19:51Z","title":"Dataset Difficulty and the Role of Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01867","snapshot_observed_at":"2026-08-15T19:58:48.051839Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.051839Z"},"links":{"cited_paper":"/paper/2401.01867","citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:241a053439d8d283ed66ac6735dbbf9809142e4449c8accd097d96883d8b81cf","observation_id":"c03198bb-352e-4205-8cbe-0b48fe06b977","resolution":{"observed_at":"2026-08-15T19:58:48.051839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.823803Z","title":null,"venue":null,"work_id":"853fb527-026e-4f1f-89ed-ea9b8294b3fa","year":2012},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.056778Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:06ac985079ffa6c01131f3d7a8bf725e8c56e670d19b1c8fad2bc40e1d62b9c5","observation_id":"81f5fefa-31a5-4096-b0dd-af2b678ffa46","resolution":{"observed_at":"2026-08-15T19:58:48.828025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.808932Z","title":null,"venue":null,"work_id":"e27a09e9-ace1-46ad-a885-ae99fe119ff1","year":2022},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.060897Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:e6d3546025c57ebbff3ea4a6a0250fa70d96d04b43f9fa5ccd9f56d3477cae63","observation_id":"6201e75f-c767-48e5-8210-4df35decc8b1","resolution":{"observed_at":"2026-08-15T19:58:48.814208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.065438Z","title":"Loshchilov and F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.065438Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:2c83e7360905e0cc2545ad16ae471f43cc02b81b91bc679254305d0b28cebfbf","observation_id":"df1b0fa3-9bcb-44bc-bb7c-0799f3bb1d06","resolution":{"observed_at":"2026-08-15T19:58:48.065438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.786185Z","title":null,"venue":null,"work_id":"7ba2de6f-c756-4c0b-8f80-a5caa73b0c52","year":2022},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.069687Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:48e33f1ab84551f698fc309ca7c5f2737a60aaabbf15379aa217190da543cad4","observation_id":"5c8310d0-b3ef-4b78-95f7-cf0eb3dd6ea4","resolution":{"observed_at":"2026-08-15T19:58:48.790668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.772730Z","title":"McMahan, E","venue":null,"work_id":"00baa63c-bd54-4212-b264-181d3360c09c","year":2017},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.073880Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:fafd9faf13a04d27b439f520e2c8302edcab61323d063030793756827b6f7aaa","observation_id":"4481dcd7-ae5c-427a-a035-cb95e576f74b","resolution":{"observed_at":"2026-08-15T19:58:48.776874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.759024Z","title":"Muqeeth, H","venue":null,"work_id":"1b9847c4-431c-42c5-8cb8-3ff07550f6fb","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.077989Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:141ec84599367d1f61af103c98b6a9fb5632b69111dd054f0c2bc626d4dcc41e","observation_id":"a3cf5e6c-90da-49bd-975f-03dc4f579af3","resolution":{"observed_at":"2026-08-15T19:58:48.763517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.743791Z","title":"Netzer, T","venue":null,"work_id":"2d4f5eb3-7ffe-4746-89f9-66cbcad740f8","year":2011},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.082167Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:97bb31a9a0bef833d88bdf68842fd2ce6b5fbad8b611b5b6d453391af98888de","observation_id":"315eb7fa-4a36-4b9d-988c-98c3e73fe637","resolution":{"observed_at":"2026-08-15T19:58:48.748287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.728778Z","title":"Neyshabur, H","venue":null,"work_id":"7f8e73cd-3f44-4b57-9b8c-d521a8237e55","year":2020},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.086410Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:8327e9339e05fcf12027cfe1d75d99dc04bf55082cb2194934fb7b41ded74cc7","observation_id":"f93462b8-2591-4c44-b652-409c1a838a77","resolution":{"observed_at":"2026-08-15T19:58:48.734150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.715139Z","title":"Ostapenko, Z","venue":null,"work_id":"4ce6ea19-7558-4277-b767-e406785a66fb","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.090800Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:7fad42a557ec73a5b5e456c89847d925d609653534a18b1f457f547e412b95db","observation_id":"b39cb89e-5c10-4e9b-921f-a68c1a7c1114","resolution":{"observed_at":"2026-08-15T19:58:48.719502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.701579Z","title":null,"venue":null,"work_id":"2458e8b6-b25b-445d-8742-d79c08307456","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.094935Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:83779612482f3a10e9956cf326334c2ae1a8c3b56dbd791bd7f6c20e9f076737","observation_id":"650a63bd-2d40-425e-aa6e-0451eba99dac","resolution":{"observed_at":"2026-08-15T19:58:48.706472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.688638Z","title":"Paszke, S","venue":null,"work_id":"03ccf11f-e787-4176-aa3b-8edb1a0e00e8","year":2019},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.099243Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:32ca6b7d012104ca4c3109f52e29034f2f424f42f219588794bb747488049625","observation_id":"fe5a22bb-1cb6-4a03-9a2f-6aa66a7051bc","resolution":{"observed_at":"2026-08-15T19:58:48.692889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.675213Z","title":null,"venue":null,"work_id":"274b867d-3297-4780-90f0-ce628f7f8099","year":2021},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.103733Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:08c878fa9b75e08d24e523534232ee4e968032bc9bc28d19559c6d840ddd66ee","observation_id":"a307ae03-8f9c-4f2c-b1de-915541ea609c","resolution":{"observed_at":"2026-08-15T19:58:48.679659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.661877Z","title":"Pfeiffer, A","venue":null,"work_id":"bb62ab6c-e0a1-49bd-ae07-2d702f980de8","year":2020},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.107914Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:0c4cb50b934038847594239e3884b3a90db0a5c569782ccc0b26f0203c1378c4","observation_id":"bbd2a2bb-a55e-4c8b-84e8-aff3721b8c72","resolution":{"observed_at":"2026-08-15T19:58:48.666017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.647925Z","title":"Radford, J","venue":null,"work_id":"2afa8c3e-c5e1-4517-8308-17245f599b48","year":2021},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.112191Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:129c963c617df0a5480117383bcab261e994719f6489ac7da10aa8f5cdc7c43c","observation_id":"38f20488-24ac-4c24-a7cc-45ec961f91cc","resolution":{"observed_at":"2026-08-15T19:58:48.652850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.634275Z","title":"Raffel, N","venue":null,"work_id":"9253d307-5b06-4931-96f0-533850f5be9a","year":2020},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.116450Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:b0481fe40bf5a57fbd2397c5cfdbb1824aa79698dc1893b4d14b33b29b284d5c","observation_id":"33c66c8c-c784-4b19-a51c-d9fbf07ed2f2","resolution":{"observed_at":"2026-08-15T19:58:48.638542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.620349Z","title":"Sakaguchi, R","venue":null,"work_id":"7eed1216-5784-4a02-b036-3a2353337ff2","year":2020},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.120859Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:20916a0f3e12ec8997a8e0d00e19baedcebacf6c2f38de407fe677d293843c2b","observation_id":"3443468a-4a66-4393-afc9-ebbd8a269c4f","resolution":{"observed_at":"2026-08-15T19:58:48.624828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12766","last_updated":"2024-10-16T17:41:59Z","snapshot_observed_at":"2026-08-16T13:08:42.814813Z","submitted_at":"2024-10-16T17:41:59Z","title":"The Non-Local Model Merging Problem: Permutation Symmetries and Variance Collapse","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12766","snapshot_observed_at":"2026-08-15T19:58:48.125280Z","title":"Sharma, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.125280Z"},"links":{"cited_paper":"/paper/2410.12766","citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:f72019dd7bfac05be737311f6cf2b185e2f98f4f75de07b83b9afb27b37f7cd4","observation_id":"139fbb2c-07af-48f4-84dd-287c297cc702","resolution":{"observed_at":"2026-08-15T19:58:48.125280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.606653Z","title":"Sharma, J","venue":null,"work_id":"9878f406-036a-454a-9ef0-e27e360a6bfc","year":2018},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.130190Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:238e3ad619744f5eb9a7307ecec8821bb34081bc5a572777bb5991d49193c9f4","observation_id":"dafc7ac2-cce7-4b56-b6cf-6f1e6d5bb6ad","resolution":{"observed_at":"2026-08-15T19:58:48.610900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.592705Z","title":"Shazeer, A","venue":null,"work_id":"26410765-dead-4811-97ba-995beeb51d33","year":2017},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.134493Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:62e7968df7e9212ae3405306fa89813486c86e21283ca23800488cdd10845767","observation_id":"db579324-eb6d-4d26-8a51-30def5516973","resolution":{"observed_at":"2026-08-15T19:58:48.597533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.579780Z","title":"Sorscher, R","venue":null,"work_id":"00d439c5-eaf6-4f2b-971b-d46cc7033129","year":2022},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.138707Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:b59cd09effa39337f2bc9afb6d774eb88182c209b21a30754849a18f4c910fc9","observation_id":"4d987df7-8840-4e4c-8777-568b4ffd8ed4","resolution":{"observed_at":"2026-08-15T19:58:48.583859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.565470Z","title":null,"venue":null,"work_id":"0878cc22-12b4-4d3e-a7ea-36497823f4c9","year":2025},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.143013Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:195404eaabd408a00d21a440448fae100660fad9df864b1b38b83891f8d09a32","observation_id":"e52610b5-bd27-4620-ab6e-ec41094160ec","resolution":{"observed_at":"2026-08-15T19:58:48.569803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.552034Z","title":"Stallkamp, M","venue":null,"work_id":"7aeb2263-15a4-478f-b980-2c78287b4ddc","year":2012},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.147081Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:ec686723893c604b36e920172016438f0a1c1cfdee830168e931033111f9b030","observation_id":"67635cea-6a12-4092-bf5f-e3a6d293e7c4","resolution":{"observed_at":"2026-08-15T19:58:48.556313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.537960Z","title":"On the opportunities and risks of foundation models","venue":null,"work_id":"aead80f2-cad1-4c32-9d1f-5bf3aa9fbd72","year":2021},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.151294Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:86b3126624882ae05c31f062819f67e7d8060b25bb3c64ddac602cc226371205","observation_id":"ad6a9534-a6aa-4a0e-a3e1-a1ded2f4e221","resolution":{"observed_at":"2026-08-15T19:58:48.542993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.524619Z","title":"Stoica, P","venue":null,"work_id":"811812ce-762e-4691-aa4e-ded6eba5bf91","year":2025},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.155699Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:d8fed39b7c3aec418afd441f55548182334a5c5fec26e8d5d61db9644bc03ae0","observation_id":"e16b4086-39b6-4bb1-b051-d6afceaf9599","resolution":{"observed_at":"2026-08-15T19:58:48.528900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.511381Z","title":"Tafjord, M","venue":null,"work_id":"eb7a40e5-0cbf-4df5-bf09-a59ff7e63b17","year":2019},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.159981Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:98f8b93d3c55cde7e7d4ff94634813c06a356e24881fbce6f5df843c424e313e","observation_id":"1cffc3e7-2fe5-4a73-ab4b-23256be5279c","resolution":{"observed_at":"2026-08-15T19:58:48.515607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.498485Z","title":null,"venue":null,"work_id":"c2ee3c81-c323-484c-b87d-11ac299fc06f","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.164118Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:6d30a6c1254740ee6647cf50f10fd46b02223c17042d7bd029d037487fb88a51","observation_id":"81725ac8-c7ce-4976-877c-9c6c9e285c74","resolution":{"observed_at":"2026-08-15T19:58:48.502613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.485060Z","title":null,"venue":null,"work_id":"a9ef0722-efae-4ffa-949e-9254dda86673","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.168289Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:949e9ac7e4f6e8baca74e40ee0e21c3e2f1706a1beb7ddd2ed78c4435816c0b0","observation_id":"bf72907a-da6c-45d8-873e-064c0e591e58","resolution":{"observed_at":"2026-08-15T19:58:48.489710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.471378Z","title":null,"venue":null,"work_id":"00bb3675-dd18-464c-a00f-a80b289fb0e2","year":2025},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.172452Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:d7eb19c43d1e3ca25fd7e95e6b2e03860fd02e924216b5fa4b2705482bd72f1a","observation_id":"0215b9ad-b465-4a2a-a46f-8072cad6fdfa","resolution":{"observed_at":"2026-08-15T19:58:48.475815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.457672Z","title":"Toneva, A","venue":null,"work_id":"b2c59e66-43f2-4245-8c41-804209226ccb","year":2019},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.176480Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:cdad4afc67a1a2d66bfd728da87e946cdb4e7a735c0c74dcce4b519a5b609678","observation_id":"dd4a0fc8-c9b8-4367-8755-28e7e4e724e0","resolution":{"observed_at":"2026-08-15T19:58:48.461998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-15T19:58:48.180609Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.180609Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:f729c3bd051586dc3ad3dc01be355a342e259c73fb264a4d5c1f9fbd1404cd42","observation_id":"3140ebf4-17a0-40b3-9b4c-0364adb3dfdf","resolution":{"observed_at":"2026-08-15T19:58:48.180609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.442963Z","title":"Wortsman, G","venue":null,"work_id":"dd3ae1e3-746e-475c-ab93-8f82dbb84da5","year":2022},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.185458Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:80e93c400e8f11f37167085329c3e3da330d6d414ea8fc9176543be77f40a19d","observation_id":"6b0fac2c-3b16-40e0-ac23-840ecefa0412","resolution":{"observed_at":"2026-08-15T19:58:48.448172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.429706Z","title":null,"venue":null,"work_id":"0e31697f-2a61-454d-be87-0a859abc8afc","year":2010},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.189565Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:3d785f11d162823d9ea177b1c407f89ce600d685146da0480a51a830ac9bb322","observation_id":"1a11d985-6a45-497d-ad75-3137a2b409d4","resolution":{"observed_at":"2026-08-15T19:58:48.433967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.414406Z","title":"Yadav, C","venue":null,"work_id":"9b56b892-654c-46e5-a4ca-35c7c7f05fea","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.193983Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:1bf88c6c343bed3274a7d0c76c71403ca9dbca5d1a2e9c7272bef3983ca452bb","observation_id":"d34340f2-4cc7-4d0b-8077-e969786b1f7a","resolution":{"observed_at":"2026-08-15T19:58:48.419021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.398780Z","title":"Yadav, D","venue":null,"work_id":"1385cbfe-af72-43be-b52e-e602d355422e","year":2023},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.198148Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:e7e95f74e718bd0636e8ef8bf6cdb45d1fd3888d3b0dec47141d4a053be033e6","observation_id":"fe2430d3-92c7-4d51-8aa6-58eff06ee523","resolution":{"observed_at":"2026-08-15T19:58:48.404458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-15T19:58:48.202324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.202324Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:481be4d04e663a431267bc532987a358799f2eeeda189f4a1a66b22fd4363988","observation_id":"00117e22-b20a-4743-8088-ebe0800c8acc","resolution":{"observed_at":"2026-08-15T19:58:48.202324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.384017Z","title":"Yang, W.-t","venue":null,"work_id":"7347a8ea-249b-4e61-9a87-889ee21cb104","year":2015},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.206860Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:2c47d949dd11c1751834926b2c2dceb76219b35a89fa6b4ee35365c30e9afdcf","observation_id":"2d0ed009-191e-4d4a-b047-4312ef916727","resolution":{"observed_at":"2026-08-15T19:58:48.388561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.369798Z","title":null,"venue":null,"work_id":"7ee11782-9842-47c6-9523-0b8e351792a3","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.210960Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:90ee217ecb46e5190d45b3669716fc3cc889f9c18517942d7c9796eae331b3bd","observation_id":"cfc94818-883d-4332-8e8b-615e74af2901","resolution":{"observed_at":"2026-08-15T19:58:48.374304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.356052Z","title":"Zhang, N","venue":null,"work_id":"6072b137-0a4d-4d70-b6f5-343fd3164c74","year":2024},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.215039Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:aa23339254d9638e6f9527f00a1b8a8f94343fd8684891598826e2a0a155480a","observation_id":"b7ff5475-2bbc-4a5d-8f54-f18ded4f2e34","resolution":{"observed_at":"2026-08-15T19:58:48.360412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.342311Z","title":"Zhang, J","venue":null,"work_id":"6082498f-c46f-4370-884a-0fd3258c3d13","year":2019},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.219392Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:e2f419f51b2d296db2034ff4a581a0164f53dfced11f959f1b2d1cff6d0f5281","observation_id":"477db986-ce96-4a4e-84b4-ee2a8375e325","resolution":{"observed_at":"2026-08-15T19:58:48.346736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:58:48.326120Z","title":null,"venue":null,"work_id":"d30bcb8d-0f12-4f11-9d95-dd542346703d","year":2025},"citing_paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T19:58:48.223776Z"},"links":{"citing_paper":"/paper/2506.14126"},"observation_digest":"sha256:ccedaed71fdc0144272ace167e3b4bf999be095a8204c6cb94d639a302fc87a6","observation_id":"6b629286-6e3e-449f-ab1b-cbebb883a3cc","resolution":{"observed_at":"2026-08-15T19:58:48.331737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14126","last_updated":"2026-06-16T20:21:45Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T19:51:53.159813Z","submitted_at":"2025-06-17T02:42:10Z","title":"From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 4 inbound Pith citation observations for arXiv:2506.14126."}