{"as_of":"2026-08-19T14:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea73d9c80608226c47c14d169d47c4b484ba0efe1f9bfc8584adcf98d001d8db","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:28:03.497703Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09907/citation-record","integrity":"/paper/2608.09907/integrity","json":"/paper/2608.09907/citation-record.json","paper":"/paper/2608.09907"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.632606Z","title":"Moe-llava: Mixture of experts for large vision-language models","venue":null,"work_id":"f4b1895f-71cf-421b-8412-43512c6cdb6b","year":2026},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.223641Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:b522d5d0d240284536db15526c0c0099640686cd57653398c773e3932a885c31","observation_id":"334858df-7240-43a7-b16d-83096baeda08","resolution":{"observed_at":"2026-08-15T14:28:04.639653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.612429Z","title":"The revolution of multimodal large language models: A survey.Findings of the association for computational linguistics: ACL 2024, pages 13590–13618, 2024","venue":null,"work_id":"aeb0c23c-5ded-4a0a-be80-e60eb6c813b5","year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.229672Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:e9c11ac13e3b1264b888e4027bb457d85ac3129af3e4b98b411ba4db8312587d","observation_id":"ba29f426-5e72-44b1-bc25-5494617eeda7","resolution":{"observed_at":"2026-08-15T14:28:04.619524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.235214Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.235214Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:0dd784c8e010859486566ed1287280334760e8cdf58f588acaf4be789b197fd8","observation_id":"366ac47f-dead-4af2-8181-7612d2141d0d","resolution":{"observed_at":"2026-08-15T14:28:03.235214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-15T14:28:03.240670Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.240670Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:ce585045752a949c8fa2c94871e2f182eb5651bdfb18f20eeb1068f66a3d4907","observation_id":"94c59ba7-3525-4d63-a396-d42ecd34fd5b","resolution":{"observed_at":"2026-08-15T14:28:03.240670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-16T15:17:42.537490Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-15T14:28:03.246532Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.246532Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:53f700cc440cff3f4a848496c5e9ac053b36e37a0249148034ff194de9489995","observation_id":"c72adca5-ade3-400e-9386-1962ca20f2de","resolution":{"observed_at":"2026-08-15T14:28:03.246532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.252089Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.252089Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:3086f8d3198b6eaaa7e6c728023205f1cafb38c542752debf8086e4cc3214392","observation_id":"b5a79f69-402a-4a7b-83d2-f9545b2606e4","resolution":{"observed_at":"2026-08-15T14:28:03.252089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.258123Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.258123Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:1824bbb4be9e8825950ac8499999b175acc51508544f84daa7fea265b1fac01b","observation_id":"91739d52-682a-4d82-a064-4e427a967fcc","resolution":{"observed_at":"2026-08-15T14:28:03.258123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.541117Z","title":"Scaling vision-language models with sparse mixture of experts","venue":null,"work_id":"f2a46d1a-9a3b-4f81-8508-eee8260f1ed2","year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.264372Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:238e3648b3f006ea20eb631a8ea6b2dd7d85c5fdcfc042cebd073bb2ca0dfe2b","observation_id":"dbc19120-ca1a-4a08-a5a0-58e345d36f9d","resolution":{"observed_at":"2026-08-15T14:28:04.550145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T14:28:03.269959Z","title":"Mixtral of experts.arXiv preprint arXiv:2401.04088, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.269959Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:01e561ef9cc67e605e3209c0a678df5e27d36a599d06afc657cf3792c27e7c68","observation_id":"9ec78643-ae4e-4410-81f5-5962a19bccc8","resolution":{"observed_at":"2026-08-15T14:28:03.269959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07816","last_updated":"2024-03-12T16:54:58Z","snapshot_observed_at":"2026-08-16T14:10:29.723801Z","submitted_at":"2024-03-12T16:54:58Z","title":"Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07816","snapshot_observed_at":"2026-08-15T14:28:03.275507Z","title":"Branch-train-mix: Mixing expert llms into a mixture-of-experts llm.arXiv preprint arXiv:2403.07816, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.275507Z"},"links":{"cited_paper":"/paper/2403.07816","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:5fbfe49fc9d96a7e3e794e1adf9dd1d3db2608351967892d41ec74924688f215","observation_id":"3df57005-5817-4f7d-9d5b-44f82f23eed8","resolution":{"observed_at":"2026-08-15T14:28:03.275507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.520253Z","title":"Biomedical visual instruction tuning with clinician preference alignment.Advances in neural information processing systems, 37:96449–96467, 2024","venue":null,"work_id":"6e1121ca-8bde-4990-bd8b-1267e02ff05a","year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.281395Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:70556e93fb59634ba42bf6f887d0a982b53a1e0a81f386a57b09bc29cd6e9808","observation_id":"356b6255-c2ae-4714-a6ae-0b3dc5ecef43","resolution":{"observed_at":"2026-08-15T14:28:04.527786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07024","last_updated":"2025-08-23T00:44:49Z","snapshot_observed_at":"2026-08-17T11:14:51.272511Z","submitted_at":"2025-07-09T16:54:21Z","title":"FlexOlmo: Open Language Models for Flexible Data Use","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07024","snapshot_observed_at":"2026-08-15T14:28:03.286914Z","title":"Flexolmo: Open language models for flexible data use.arXiv preprint arXiv:2507.07024, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.286914Z"},"links":{"cited_paper":"/paper/2507.07024","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:824a06d4c007e8f6cb1e0f112473abc84403c44e7d36b8132a744cbbef944cc2","observation_id":"c6f6a0fb-f260-4526-8f71-63325011f901","resolution":{"observed_at":"2026-08-15T14:28:03.286914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18473","last_updated":"2026-04-20T16:24:41Z","snapshot_observed_at":"2026-08-14T20:51:20.111244Z","submitted_at":"2026-04-20T16:24:41Z","title":"Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":"2604.18473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18473","snapshot_observed_at":"2026-08-15T14:28:04.027116Z","title":"Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts","venue":"cs.LG","work_id":"73d67e5e-1816-4a1d-91f4-75cf87372a42","year":2026},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.292526Z"},"links":{"cited_paper":"/paper/2604.18473","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:68b13a4a3da599f3d87329d8221438b0c98e2bc03c2929178041781fe75cc283","observation_id":"0e738a17-8ef7-4eea-ad26-e93bfaf8648f","resolution":{"observed_at":"2026-08-15T14:28:04.033673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.498671Z","title":"Learning to instruct for visual instruction tuning.Advances in neural information processing systems, 2025","venue":null,"work_id":"ac018d3d-0b1c-48d6-ab7e-bd497e398c53","year":2025},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.298087Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:363132aab99f21b17da1d67276ee885bb87d0fca6527b507b97d0d7f79abd6e8","observation_id":"c9bb56c3-53cc-4f0c-8270-321f09f60b18","resolution":{"observed_at":"2026-08-15T14:28:04.504628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.08544","last_updated":"2025-11-14T08:38:32Z","snapshot_observed_at":"2026-08-18T08:21:10.395771Z","submitted_at":"2025-11-11T18:21:55Z","title":"LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.08544","snapshot_observed_at":"2026-08-15T14:28:03.303694Z","title":"Lejepa: Provable and scalable self-supervised learning without the heuristics.arXiv preprint arXiv:2511.08544, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.303694Z"},"links":{"cited_paper":"/paper/2511.08544","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:669e0b6c437fd87dc25a17361e22a72302ec3fd78acd03001b6b3b773886b783","observation_id":"9d474a29-4214-4402-918c-de2585c70acb","resolution":{"observed_at":"2026-08-15T14:28:03.303694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.309133Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.309133Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:eb7051d45de94bbd3eb581452de1dca98b10eb9752d34679d7a13c6261cbbeb1","observation_id":"85546d3d-60d1-4803-a9eb-6eefab72f498","resolution":{"observed_at":"2026-08-15T14:28:03.309133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.314679Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.314679Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:28d4de32d8ad96804fee75375a6ab456cf20031c36390bfa5dcdcc252c7cfcf2","observation_id":"6a53dd71-0415-4882-a2b8-6edab3578e9f","resolution":{"observed_at":"2026-08-15T14:28:03.314679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.320123Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.320123Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:f561bc28a74c3942d0fa1373f13425e61dfcb973bcb84a25c5080e738b47a977","observation_id":"1c7c0de9-f5c9-4d80-8440-22babf1250cd","resolution":{"observed_at":"2026-08-15T14:28:03.320123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.326562Z","title":"Coin: A benchmark of continual instruction tuning for multimodel large language models.Advances in neural information processing systems, 37:57817–57840, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.326562Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:fc51f00e889d8e04f2b7913a95b21d455ca498ef5666d1f211755e5fc908f381","observation_id":"f957e008-9515-4c7a-934f-39515723fb70","resolution":{"observed_at":"2026-08-15T14:28:03.326562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02486","last_updated":"2025-05-05T09:09:41Z","snapshot_observed_at":"2026-08-17T18:52:14.502183Z","submitted_at":"2025-05-05T09:09:41Z","title":"SEFE: Superficial and Essential Forgetting Eliminator for Multimodal Continual Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02486","snapshot_observed_at":"2026-08-15T14:28:03.331863Z","title":"Sefe: Superficial and essential forgetting eliminator for multimodal continual instruction tuning.arXiv preprint arXiv:2505.02486, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.331863Z"},"links":{"cited_paper":"/paper/2505.02486","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:489845630c2841b53c96216a735e51bb75ecc8935954f45b196127ae3b90ecc3","observation_id":"283204ce-6ce1-4d69-83f5-43c51c6837dc","resolution":{"observed_at":"2026-08-15T14:28:03.331863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.27481","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.957139Z","title":"On token’s dilemma: Dynamic moe with drift-aware token assignment for continual learning of large vision language models","venue":null,"work_id":"20c3b42d-8e53-4e11-bcf3-372575933717","year":2026},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.337403Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:3ca5d5c389fd7382a920f9b94d2030ac48c66affab871b8ef12cdcc82c2738fe","observation_id":"8e983215-5422-4db2-bcfc-4ed1f80d0641","resolution":{"observed_at":"2026-08-15T14:28:03.967685Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.422698Z","title":"Kss-moe: Knowledge space synergy framework in mixture of experts for continual visual instruction tuning","venue":null,"work_id":"08d3b1d4-7d15-45cf-97ac-999a52e51f9b","year":2026},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.342546Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:636e8e3f228000460a762f0b431754946acfcdfb9642651aee8a439feb115c11","observation_id":"ef6921de-9f86-4de4-8985-bcf17cc5b6d8","resolution":{"observed_at":"2026-08-15T14:28:04.428889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.347249Z","title":"Continual instruction tuning for large multimodal models.IEEE Transactions on Image Processing, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.347249Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:c19cbe19654484fd3cd1dbe17bc0042316848fe6ccbe2c9901aa38b4f18ccb15","observation_id":"2b312b7b-e6c0-4a33-938d-7795c2297616","resolution":{"observed_at":"2026-08-15T14:28:03.347249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.381854Z","title":"Model tailor: Mitigating catastrophic forgetting in multi-modal large language models","venue":null,"work_id":"4caf2edb-924b-4e3a-aef3-8ec93c75b261","year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.352307Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:698bf4584fb6107ca73f0fc9529d5f896c1f6efb42333f5d93cccce5a63268f8","observation_id":"c660ca03-e2c8-43e0-89f1-3ad909bc1319","resolution":{"observed_at":"2026-08-15T14:28:04.391623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-18T20:33:44.932427Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-15T14:28:03.357493Z","title":"Diloco: Distributed low- communication training of language models.arXiv preprint arXiv:2311.08105, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.357493Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:af9624ac2f6d688cdebe8183d0b8e1c94b33530ea20ef4e272091bbab19fb7e3","observation_id":"4244ccb7-abc3-4f0a-aa46-e3d037045424","resolution":{"observed_at":"2026-08-15T14:28:03.357493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00044","last_updated":"2024-01-20T19:15:21Z","snapshot_observed_at":"2026-08-16T16:27:44.954449Z","submitted_at":"2022-09-30T19:12:58Z","title":"Task Formulation Matters When Learning Continually: A Case Study in Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00044","snapshot_observed_at":"2026-08-15T14:28:03.362537Z","title":"Task formulation matters when learning continually: A case study in visual question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.362537Z"},"links":{"cited_paper":"/paper/2210.00044","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:746370b8598007fd00b78dca5ca45204e8db6c1b99d027ac5ea3a657740672f0","observation_id":"48561d4b-d0da-4536-9d78-f7d1c1ef979d","resolution":{"observed_at":"2026-08-15T14:28:03.362537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.367486Z","title":"Model merging in llms, mllms, and beyond: Methods, theories, applications, and opportu- nities.ACM Computing Surveys, 58(8):1–41, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.367486Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:157da9474c7706d5fd9d502262a576fa5624d937fea8b694e77d1fd8d9e17af7","observation_id":"b436b3ea-ad3e-45dc-b150-66d4d66c2e70","resolution":{"observed_at":"2026-08-15T14:28:03.367486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.346860Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"65e977a3-562d-47ec-95a2-4765d7313df8","year":2022},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.372420Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:d55c177c0d6c3735d04f3761803f922ba9b9d0b54791bb36c9a5f14f06345ec0","observation_id":"b3765395-7332-4053-b3be-6b8725727466","resolution":{"observed_at":"2026-08-15T14:28:04.352771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-08-18T13:05:31.068739Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-15T14:28:03.377249Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models.arXiv preprint arXiv:2208.03306, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.377249Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:c93ad05a1142406ccdd4d88a28eb5d0e86709625b83d67ff883b71e087cb5cd5","observation_id":"1802ec4e-ea08-40c8-95e5-34ed216ef2b9","resolution":{"observed_at":"2026-08-15T14:28:03.377249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.382633Z","title":"Ties-merging: Resolving interference when merging models.Advances in neural information processing systems, 36:7093–7115, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.382633Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:962768620f4896232cebd9ea7671198145f904d7fec0d9ffa82cfc94b2f0514f","observation_id":"927032dd-58ed-4915-bd4f-835bfc739b9b","resolution":{"observed_at":"2026-08-15T14:28:03.382633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-15T14:28:03.387697Z","title":"gpt-oss-120b & gpt-oss-20b model card.arXiv preprint arXiv:2508.10925, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.387697Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:e5cd270af3c1debb18d0ba0eeb14698507a50b357e0b0b13e2b58046469d1947","observation_id":"4dbafb39-c0b6-4cd7-bf74-14c8b2dc5fc6","resolution":{"observed_at":"2026-08-15T14:28:03.387697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.315568Z","title":"Scaling vision with sparse mixture of experts","venue":null,"work_id":"05448414-5107-4d7b-85da-ad139fa36fec","year":2021},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.392893Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:0d06d0dcecbbf273177943037bc1b7501b066bd864300eb778b46ca856610d6c","observation_id":"6c2103a6-a1b7-4e66-937d-4834e5eda2e1","resolution":{"observed_at":"2026-08-15T14:28:04.321415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.397929Z","title":"Multi- modal contrastive learning with limoe: the language-image mixture of experts.Advances in Neural Information Processing Systems, 35:9564–9576, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.397929Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:f5c6a24f26b03fc5ed22d487c562873b8f106a07cf7caf79c2a5f0bf5ae05b12","observation_id":"9e1ecebd-4e17-45b6-a978-512d5f7c5644","resolution":{"observed_at":"2026-08-15T14:28:03.397929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.402868Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.402868Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:bcdb50d2859021cefd5d641b437410a3e1cae41716bab562892cdc31d245376a","observation_id":"b2002d57-cd4b-4aac-85ef-33999ed888b4","resolution":{"observed_at":"2026-08-15T14:28:03.402868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.408361Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.408361Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:848bb96afc40e2a6e1eaf30b40cf75d59db9e8a83da7fe5a34ab4b8c308ae63d","observation_id":"5c10a25a-2d1c-47f3-9f57-37c96c5da5af","resolution":{"observed_at":"2026-08-15T14:28:03.408361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.260489Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"92d8cc69-63fa-4703-b716-ce387076c876","year":2019},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.413277Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:c54bd22f755846a3bf8eee15404d5decf7a9e59839bcb64e34ece6da972b232f","observation_id":"1502c9a6-9f85-42af-b24e-8700222cd88a","resolution":{"observed_at":"2026-08-15T14:28:04.266506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.418137Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.418137Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:f336d15abbb102967f16dedcadc8bef38c4a51ec1631f2c5dae89caa20463725","observation_id":"03a8c1c8-75aa-4965-9449-602721776b37","resolution":{"observed_at":"2026-08-15T14:28:03.418137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.422959Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123(1):32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.422959Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:d03d33f4c9f59e7bcd49ab8b9f314a7fb93be1d017f895caff5000aa9d826388","observation_id":"0e0bf72d-2b72-4ef5-9749-bafbe7994992","resolution":{"observed_at":"2026-08-15T14:28:03.422959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T14:28:03.428023Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.428023Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:7ab3da265a5c23d3d4421f489d6ef2fb0e8eef6109905f4e4364079b216d24d1","observation_id":"9123a8bf-8b55-4a70-974a-507c59e8fddc","resolution":{"observed_at":"2026-08-15T14:28:03.428023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.217936Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":"36acb9c4-84c4-468a-91b3-03c13191baa6","year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.433442Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:1e6d879dd8efdf642346dc4240cdb877d0ccd65aace36f150cf15665edb9567f","observation_id":"17a2eb29-623b-4d65-9604-27ee01e025df","resolution":{"observed_at":"2026-08-15T14:28:04.224648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17834","last_updated":"2024-02-27T19:00:07Z","snapshot_observed_at":"2026-08-19T14:32:57.678714Z","submitted_at":"2024-02-27T19:00:07Z","title":"Stable LM 2 1.6B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17834","snapshot_observed_at":"2026-08-15T14:28:03.438930Z","title":"Stable lm 2 1.6 b technical report.arXiv preprint arXiv:2402.17834, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.438930Z"},"links":{"cited_paper":"/paper/2402.17834","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:9c22b22c401661579f1736808f2eca21836ea806818cd9f65437be0b2d7d8d68","observation_id":"f58eccf1-afb2-4b72-b1f0-fa07de793470","resolution":{"observed_at":"2026-08-15T14:28:03.438930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.444345Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.444345Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:d3ac620db77b28003a1a0205214eca6dbfad28c8f1445cf414ff56fc8161b88b","observation_id":"d85702ac-6cc8-4a2c-b355-753fb2351244","resolution":{"observed_at":"2026-08-15T14:28:03.444345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.174072Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in neural information processing systems, 35:2507–2521, 2022","venue":null,"work_id":"9423876e-ce05-4143-af73-ffee72ccea45","year":2022},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.450070Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:59d420e6ae88a8d5cc8852f52ca55469e39330acb976ead36d43b54c8e6ef5e8","observation_id":"4d799211-7be4-4559-b49b-1c24a029d440","resolution":{"observed_at":"2026-08-15T14:28:04.179989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.456212Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.456212Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:7d77388bc7b2251ff309b92dc8e65961d221b8d9365a80ebfdf1ea0989a849ae","observation_id":"6c674b43-3624-4908-a16d-8ee5946e1ace","resolution":{"observed_at":"2026-08-15T14:28:03.456212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-15T14:28:03.461847Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.461847Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:25185f79192a8a6df2b500684d1712b6085a00f048f91babddb55e6c9f0fa3d9","observation_id":"ff8403b6-20bc-47d2-aace-131625843645","resolution":{"observed_at":"2026-08-15T14:28:03.461847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-15T14:28:03.467146Z","title":"Seed- bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.467146Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:696390389054132fca22fa50c9f9e16b66510eac353d5a4e4e5c02ff48826e00","observation_id":"e62497df-a008-4c92-8335-a53149475b65","resolution":{"observed_at":"2026-08-15T14:28:03.467146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-15T14:28:03.472506Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.472506Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:49b600f9b9eb644454255ba37c306aac658f759a097a6a65e358f058c2536fef","observation_id":"a0a5bfdd-ca85-4524-a12a-cdff0f782880","resolution":{"observed_at":"2026-08-15T14:28:03.472506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.139468Z","title":"Open technical problems in open-weight ai model risk management.Transactions on Machine Learning Research, 2025","venue":null,"work_id":"f4aebef9-c7ab-43a2-974c-5e678957cefb","year":2025},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.477372Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:fdc029d3afd0e0b5f32dd7aa8f4e5c97635218f8f97bf66ec81e07360fc9872a","observation_id":"7e61a100-a497-4616-9b73-f557a769f6a2","resolution":{"observed_at":"2026-08-15T14:28:04.145289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-15T14:28:03.481999Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.481999Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:6bcd4e3cc92f293893d6506701e4bbb4dfe30095fd4a65b354e1801108a1f89d","observation_id":"39244b89-6a3e-4823-8faa-1fa97e178d37","resolution":{"observed_at":"2026-08-15T14:28:03.481999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-15T14:28:03.487166Z","title":"Aligning large multi-modal model with robust instruction tuning.arXiv preprint arXiv:2306.14565, 2(3):6, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.487166Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:d00a01b09d6e77b5ba54eb5c8a14c2f49f074dcf236b7f34580267078207f620","observation_id":"c6cc7074-b024-47ca-876d-a851c4191c9a","resolution":{"observed_at":"2026-08-15T14:28:03.487166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-08-16T15:25:23.093007Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-15T14:28:03.492492Z","title":"Mimic-it: Multi-modal in-context instruction tuning.arXiv preprint arXiv:2306.05425, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.492492Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:e9e5832767cf5869e637226cbae5af2ed168312791136cd2cfe699ab28db495b","observation_id":"a5396789-b7bf-476a-87ae-b47731077739","resolution":{"observed_at":"2026-08-15T14:28:03.492492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7540.7986","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.647507Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"6fd9b442-0050-4b72-af32-008b88d9d98d","year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.497703Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:f812936b65a5e6719db61507c6ce6c8e82c12d317941676cbc70819486aee492","observation_id":"a254c35e-5805-4286-8ac8-7d48549f39c1","resolution":{"observed_at":"2026-08-15T14:28:03.659876Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T21:22:46.245965Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.09907."}