{"as_of":"2026-08-04T01:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:77f1f4fed530a292196336eb140b2e081d8636d06850fe71895a91a41ab9f2cb","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T22:47:09.500229Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:24:17.633259Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-01T18:16:15.623592Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"cited_work":{"arxiv_id":"2503.23733","doi":"10.48550/arxiv.2503.23733","metadata_source":"pith","pith_arxiv_id":"2503.23733","snapshot_observed_at":"2026-08-01T18:16:15.623592Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","venue":"cs.CL","work_id":"887e6dd8-2188-4bb1-a265-cea643bd784b","year":2025},"citing_paper":{"arxiv_id":"2607.18026","last_updated":"2026-07-20T14:58:53Z","snapshot_observed_at":"2026-08-01T16:24:13.385550Z","submitted_at":"2026-07-20T14:58:53Z","title":"Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T16:24:17.633259Z"},"links":{"cited_paper":"/paper/2503.23733","citing_paper":"/paper/2607.18026"},"observation_digest":"sha256:d73b0ab033d054b2f5b018843d3cf3b6c987cc26faaebdf0f25f38159c491a33","observation_id":"b953f338-90a0-467f-9b43-0ba5adb2c7c0","resolution":{"observed_at":"2026-08-01T16:28:38.980406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.23733/citation-record","integrity":"/paper/2503.23733/integrity","json":"/paper/2503.23733/citation-record.json","paper":"/paper/2503.23733"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model composition for multimodal large language models","venue":null,"work_id":"f6025123-f97a-4327-aa8e-35e5b28ae6d2","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:bec407e867417de430e6bab7a5aa6ca4b2a3d7c7280d0a7fac3d32775beda8a8","observation_id":"82e4d519-b3cd-4177-9bd5-294ff76d67a4","resolution":{"observed_at":"2026-05-22T22:47:13.715269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:380ed819cdf3b707d8587c674ea8f0c7ffa838f9c853019da2b6880d338d8c86","observation_id":"7329112e-3775-44ca-9fb1-2e88d6b4ebda","resolution":{"observed_at":"2026-05-22T22:47:12.992624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"314ec2f0-017f-41e7-89a5-6b4df6916c88","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:a9842a16828f166e56dc8185a3cd0c5704ec32ea02239cba784c2f67ce5b6af9","observation_id":"c7d65c77-bfd0-477b-832c-baf1a767b69e","resolution":{"observed_at":"2026-05-22T22:47:13.740388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open llm leaderboard v2","venue":null,"work_id":"b0b5aa7b-718d-47f8-aec9-93ff8f9b8c6e","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:343f4174aca442104e9e76c21a8fe6e767b772edd67527ccf3c223a3164fb3f5","observation_id":"a94917f3-a105-4b4a-8666-92e62bd52667","resolution":{"observed_at":"2026-05-22T22:47:13.731162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:79d6b244739f5b7e88fd92c9b5e2f348409e66f3c98a2a101912ab402c243514","observation_id":"dcc21b0b-6df2-42b4-9700-8a40762306f8","resolution":{"observed_at":"2026-05-22T22:47:13.051119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13257","last_updated":"2025-01-09T22:21:56Z","snapshot_observed_at":"2026-08-02T11:25:49.310871Z","submitted_at":"2024-03-20T02:38:01Z","title":"Arcee's MergeKit: A Toolkit for Merging Large Language Models","version":3},"cited_work":{"arxiv_id":"2403.13257","doi":"10.48550/arxiv.2403.13257","metadata_source":"pith","pith_arxiv_id":"2403.13257","snapshot_observed_at":"2026-07-10T08:06:57.506551Z","title":"Arcee’s mergekit: A toolkit for merging large language models","venue":"cs.CL","work_id":"be216e9a-b2e1-4485-ba14-f8bbed2b7aa7","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2403.13257","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:c44b7f91c6a13eecbfe484f3447a610ec284e72597b4b850754a37df771ea4ca","observation_id":"884112f5-272d-4b8c-b1bb-14c493c604eb","resolution":{"observed_at":"2026-05-22T22:47:13.022569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:06.882707+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:06.882707+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"9bcd89bb-8634-4b96-9608-07fe523cfd2a","year":2018},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:064ec6094df3a35212d2901caec0696592a7b38c290a2ce66fef5294c6feaa66","observation_id":"c5df0ac0-9014-4138-9d89-0905bc5c14d3","resolution":{"observed_at":"2026-05-22T22:47:13.785828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:2f61af785a2d2a6b9fd6adbdbc56729650510880cec8aa02e0dd152713b84a73","observation_id":"41cec851-faf3-49cf-b7bf-c6f8af1032d0","resolution":{"observed_at":"2026-05-22T22:47:13.016745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"a5810524-7f95-4b4a-9b7d-f8da482ebc20","year":2019},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:5d87c043661ba70d89fe63a93c698541d0ab032bd882bfc0341be354bd8d7721","observation_id":"d20748b5-2538-45d9-8b50-325555e13912","resolution":{"observed_at":"2026-05-22T22:47:13.726684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":"2212.04089","doi":"10.48550/arxiv.2212.04089","metadata_source":"pith","pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-07-10T16:57:24.575602Z","title":"Editing Models with Task Arithmetic","venue":"cs.LG","work_id":"28899541-90d9-4f1f-b938-8b0f6410c843","year":2022},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:47b12195bd95d52a47877d07c1ed9b1da6d20f1e64751ee10244a417ed98d3d1","observation_id":"82640ac1-ffbd-4479-a5da-c8bde8f070f8","resolution":{"observed_at":"2026-05-22T22:47:13.005216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":"57762d23-931b-457c-81a3-4d3beea44293","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:df16bba50ce2f1be1b1400fd08daefcb3a228285619436b61a2756bebcd2755a","observation_id":"13cfe3bf-7d2b-4ebb-89b1-f0d069fede3b","resolution":{"observed_at":"2026-05-22T22:47:13.793889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-10T13:27:05.574543Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:49024ce81f1771fbaad4c026513eef387c3741af8a61095b12ed44baa1741193","observation_id":"d137d4cd-56cc-4c3c-b96d-177e51004655","resolution":{"observed_at":"2026-05-22T22:47:13.034098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-07-06T19:01:27.827878Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2408.08632","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-07-04T08:49:41.635040Z","title":"A survey on benchmarks of multimodal large language models","venue":null,"work_id":"207e59ee-baf4-416d-9307-5b7d6daa3239","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:f68ce9be74cb4d941df403862dfbfb056aff5aea80e8cdf18e96ce476d2f7996","observation_id":"c4541fd2-edff-4e88-8ec7-b424820fe260","resolution":{"observed_at":"2026-05-22T22:47:13.058347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"0af389f8-fee9-49e0-8af6-99e8325eabfe","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:8265f17141e4c441040f7195de47588e8715ef2dabb702a2e07c606a6e295621","observation_id":"8a4357ea-8570-498d-b038-5800dfc20fd6","resolution":{"observed_at":"2026-05-22T22:47:13.797697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":"2305.07895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-07-01T22:26:17.944984Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","venue":"cs.CV","work_id":"521163e9-4c77-4c73-8b7f-9a6aa75b6d3b","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:7d9ac69c495e60636164fc04666e867b3c8ffb57bb3ef7b3dbb1e4edaf42fd39","observation_id":"cb342305-57b1-4715-8a9b-1a366456e06e","resolution":{"observed_at":"2026-05-22T22:47:13.010209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"6ae463d0-0e57-42cb-b23f-29a66e2a89bc","year":2019},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:63b06ea9a465e8e4c1bab18293f1a7cbadf80fd55d27f12257235e4508614c84","observation_id":"bdb624a3-e15c-4445-b2b1-42649ed6d01a","resolution":{"observed_at":"2026-05-22T22:47:13.722612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":"97ade7bc-39b5-4d0f-8ae7-8c64dad24d1a","year":2019},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:fdc7f1e6cb8d77eedb32c026ea88bd642dac4af18b8f2d8a6e25078339439387","observation_id":"4e5cef5e-c9ee-462d-b030-c441c77872b4","resolution":{"observed_at":"2026-05-22T22:47:13.750210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.844600Z","title":"Towards vqa models that can read","venue":null,"work_id":"33f55abe-fe38-483c-a026-05c983a173d2","year":2019},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:ee864e51337193f9d52b0cef26cd56c7a67c80068f5605e93d2908f2efbb7697","observation_id":"639b056f-abdf-4642-8c14-41dbee70ea8d","resolution":{"observed_at":"2026-05-22T22:47:13.745262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14933","last_updated":"2023-10-11T15:08:51Z","snapshot_observed_at":"2026-07-06T15:21:15.939061Z","submitted_at":"2023-04-28T15:43:21Z","title":"An Empirical Study of Multimodal Model Merging","version":2},"cited_work":{"arxiv_id":"2304.14933","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14933","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An empirical study of multimodal model merging","venue":null,"work_id":"2af519ab-625e-4537-bb2c-6bb1b2ea3925","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2304.14933","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:82096d2d464f667a4fe4f0aa40265124efc409ba98463ff09aca2c77f0190fde","observation_id":"23aea47c-a2ae-4363-9638-2a59da00ecab","resolution":{"observed_at":"2026-05-22T22:47:13.040070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama: Open and efficient foundation lan- guage models","venue":null,"work_id":"1b4b4094-387b-427d-adeb-f747d32e4766","year":null},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:b055701713c9fc52409ca5246a4383c13bc5ed64c039f1242ba37a2caee813ea","observation_id":"1d1d72b1-1777-45e9-bf90-cafc92cabbba","resolution":{"observed_at":"2026-05-22T22:47:13.763870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"499581b6-1893-40e3-bb3c-127705051e5d","year":2017},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:33a1bf2e16f3a3e6cd55348be95a02cd5c15ff448967e66054858c745b1c077b","observation_id":"1cfe4624-dc0c-4770-b73c-65252017603e","resolution":{"observed_at":"2026-05-22T22:47:13.772701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowledge fusion of large language models","venue":null,"work_id":"78b12601-ad13-46ab-ab94-f2e4385b5d1b","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:cbfde5dac99b1a0605e4300cf1149b67c178f77696be1739e4b7a070bddd84e8","observation_id":"feac4b98-aa29-417b-bdcc-ad9493c80b13","resolution":{"observed_at":"2026-05-22T22:47:13.776973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowledge fusion of chat llms: A preliminary technical report","venue":null,"work_id":"27795a6b-c36a-466b-8f98-dcb7c2469fe7","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:62953d3316a01f726da0e3ef7a978835ba3eb0fb3546d896532f1fd08c3cb5ab","observation_id":"87ebef6d-0948-4c8b-b146-0fcb5f3a8c6a","resolution":{"observed_at":"2026-05-22T22:47:13.759292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:d06186d1ec6cef628a9ed4acc435a18b9bacae810f10c5ad1bc3062ea674b781","observation_id":"1b9df78e-03da-496a-9040-1165a22a67c3","resolution":{"observed_at":"2026-05-22T22:47:12.999223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:54877fa61f4e24c7e06ff11d68d0513d390c2730ef4f34fda3977aaf30821f06","observation_id":"c078eb9a-f62e-4e13-9c20-2097f5044aab","resolution":{"observed_at":"2026-05-22T22:47:13.045306Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TIES-Merging: Resolving interfer- ence when merging models","venue":null,"work_id":"0e018c53-1de5-451f-b3cf-03873be58567","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:aa02b836da361c91b16ed958c9c867f503b0de84cf346a6713eb1200e22f5e76","observation_id":"b0c7f121-436d-4b55-a9f6-79add888a4af","resolution":{"observed_at":"2026-05-22T22:47:13.789663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2 technical report","venue":null,"work_id":"526da1b2-4884-4ada-b2f1-2c8635a803e3","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:0383b292e46140e8a5cc3e119b40872add78d118f60803c1d41a2e85fcdbdeab","observation_id":"fa4e1a20-fc46-42d9-a7d9-5ef92fd5ca88","resolution":{"observed_at":"2026-05-22T22:47:13.718835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"mplug- owi2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"3dfd22c4-90ca-4346-ad68-6f758e13572c","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:1aadff09a296ab5e4f833be1c0f570fef27b8e31fcc096f184ca675e4b76dac7","observation_id":"129400fc-d295-4990-ab27-19d67d031d2a","resolution":{"observed_at":"2026-05-22T22:47:13.736134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch","venue":null,"work_id":"b6aecd9c-e125-45e8-93ed-c1c5c52e9db3","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:3f0afc06c23d1a6cc1b563a444a6d600b6011fbabcbc0f7471540a4a48d77bc9","observation_id":"4397b508-5be1-4c81-969a-c27683e33dbf","resolution":{"observed_at":"2026-05-22T22:47:13.802378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"db65793b-689c-4839-afe3-909032b5ccd8","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:a1a171167aa62b0c9ee5fadec0e1e2b3022522ca84423890fcd5b799f9442241","observation_id":"51a6a79a-ee0e-4468-b69c-1d80b82e1068","resolution":{"observed_at":"2026-05-22T22:47:13.754647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmms- eval: Reality check on the evaluation of large multimodal models","venue":null,"work_id":"ca0ea78a-ab6a-4308-9525-3a1abf484ccc","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:d87a4e5db86b12ec04ac40e452303f712ccbf8cc35dd82e3d7650ba5403c02eb","observation_id":"88f81d22-ffae-48c0-8737-c81fe23a0e1e","resolution":{"observed_at":"2026-05-22T22:47:13.780982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11385","last_updated":"2024-06-27T16:01:28Z","snapshot_observed_at":"2026-07-06T18:32:06.826381Z","submitted_at":"2024-06-17T10:12:45Z","title":"MetaGPT: Merging Large Language Models Using Model Exclusive Task Arithmetic","version":2},"cited_work":{"arxiv_id":"2406.11385","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11385","snapshot_observed_at":"2026-07-03T17:58:46.791554Z","title":"MetaGPT: Merging large language models us- ing model exclusive task arithmetic","venue":null,"work_id":"4b2157d6-f681-4c6a-89cd-f92f26539337","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2406.11385","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:7ff35a99bd32f4d9477c25f4a09d91adb6eed3d13d2058c6e697f9464cb4c5b8","observation_id":"2bc6c25b-e314-44f7-816f-3abda1d72bd0","resolution":{"observed_at":"2026-05-22T22:47:13.028887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e44985fa-f330-4d6d-aeeb-c661ffbaf3e9","year":null},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:299112a10ef4c1d1f5b50d8e622ee925c357de38ce1abcff7555a656aacbb78e","observation_id":"c65b7fac-bd4c-44c1-9b52-c4655d24a360","resolution":{"observed_at":"2026-05-22T22:47:13.768589Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":12,"verified_fuzzy":20},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2503.23733."}