{"as_of":"2026-08-14T11:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2ff8c054a3c53bb4227a37b3fcd59ea78214f89cd8e10634ff83810e2f16d85","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:30:22.310402Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:35:43.369407Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:59:50.223756Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-08-06T01:00:28.861351Z","title":"P.; Huang, X.; Jiang, Y.-G.; Sebe, N.; Tao, D.; Gool, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04017","last_updated":"2025-08-06T02:13:46Z","snapshot_observed_at":"2026-08-12T18:10:06.402617Z","submitted_at":"2025-08-06T02:13:46Z","title":"Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T01:00:28.861351Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2508.04017"},"observation_digest":"sha256:8e91980230224fe9bffbb702e3cb54e34f958389787258be696c205dff213417","observation_id":"409490f8-ec1c-4261-8af4-a4482362a558","resolution":{"observed_at":"2026-08-06T01:00:28.861351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-08-05T11:56:37.791379Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02164","last_updated":"2025-09-02T10:14:55Z","snapshot_observed_at":"2026-08-07T04:11:09.551801Z","submitted_at":"2025-09-02T10:14:55Z","title":"Omnidirectional Spatial Modeling from Correlated Panoramas","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T11:56:37.791379Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2509.02164"},"observation_digest":"sha256:e816cb4356843fe1fbaaafa7eee67565849385341e7067fec0a1ef6b2c3a26e8","observation_id":"44f4ebe2-070c-4bb0-85d9-e8365943b253","resolution":{"observed_at":"2026-08-05T11:56:37.791379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-08-02T22:14:31.631473Z","title":"Mllms are deeply affected by modality bias.arXiv preprint arXiv:2505.18657, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17659","last_updated":"2026-07-15T16:20:07Z","snapshot_observed_at":"2026-08-11T12:44:14.562608Z","submitted_at":"2026-02-19T18:59:20Z","title":"When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T22:14:31.631473Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2602.17659"},"observation_digest":"sha256:3fa63162c6e983e59535ac52fd4f905233fdbd3e381269db02d80447e7e36cb3","observation_id":"163ddd2a-a86a-413e-84b0-168791481c7c","resolution":{"observed_at":"2026-08-02T22:14:31.631473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2604.02492","last_updated":"2026-04-02T19:50:59Z","snapshot_observed_at":"2026-07-06T22:51:53.458444Z","submitted_at":"2026-04-02T19:50:59Z","title":"Token-Efficient Multimodal Reasoning via Image Prompt Packaging","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T21:52:25.713970Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2604.02492"},"observation_digest":"sha256:b0321d7fc562b222a2ae5eaf6892dff95242fccafea8a3022afc50ce9a011468","observation_id":"fbd1d54a-dd4f-4ddb-b55d-2cb5b89c675f","resolution":{"observed_at":"2026-05-13T21:53:19.601782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2604.03995","last_updated":"2026-04-05T06:32:08Z","snapshot_observed_at":"2026-08-11T14:42:12.766450Z","submitted_at":"2026-04-05T06:32:08Z","title":"A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T17:34:10.089555Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2604.03995"},"observation_digest":"sha256:95dab5e8fad94b6fe435746a37131cf0a786777b431d5c0c2bdfda11c5b06996","observation_id":"f8d109ff-404d-49b4-b09b-18a6839cf17d","resolution":{"observed_at":"2026-05-13T17:38:02.902544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2604.16902","last_updated":"2026-04-29T05:22:54Z","snapshot_observed_at":"2026-08-10T23:36:15.762831Z","submitted_at":"2026-04-18T08:25:52Z","title":"Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-10T07:02:02.752466Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2604.16902"},"observation_digest":"sha256:0bcbdc905879fe0889a1f86f6bf229a57c575aaf9a05a20b3b372137172ead50","observation_id":"b07b222e-4d13-46a3-a610-d57a13e7a1b0","resolution":{"observed_at":"2026-05-10T07:11:53.732553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2604.21326","last_updated":"2026-04-23T06:29:42Z","snapshot_observed_at":"2026-08-12T21:53:55.130131Z","submitted_at":"2026-04-23T06:29:42Z","title":"MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-09T21:56:38.004300Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2604.21326"},"observation_digest":"sha256:bb33fe90a32d06bb6bfed88eb8da10ae9967a8279276ada4f8143695f065d3d5","observation_id":"4a808afb-0e03-4f25-96d0-9de968dac8e9","resolution":{"observed_at":"2026-05-11T14:21:07.562485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2605.14787","last_updated":"2026-05-15T21:26:27Z","snapshot_observed_at":"2026-08-01T03:30:45.927162Z","submitted_at":"2026-05-14T12:56:36Z","title":"Do Composed Image Retrieval Benchmarks Require Multimodal Composition?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T21:20:49.609788Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2605.14787"},"observation_digest":"sha256:37762063efcfa35d1b95378fd19cc075301f6e66d5491d0539347d1d42805ff4","observation_id":"977cd533-9d06-4171-ad7e-30545c81c955","resolution":{"observed_at":"2026-05-20T21:23:44.429486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-20T11:32:24.007847Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:e8785b959fea589dc8ba3bf08382f51def54cd532be78acef2f47c8c47348f0e","observation_id":"cc28aa76-c4c2-43ba-8e65-61703fccfcf6","resolution":{"observed_at":"2026-05-20T11:33:14.210167Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:a6c50761bd5a959d6c03f15bd38bc34027cd8d828fbaed6827701d0ab2273e04","observation_id":"69715a54-940a-4a56-bd7d-4de3a12c796a","resolution":{"observed_at":"2026-06-30T18:35:00.347720Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2605.22168","last_updated":"2026-05-21T08:39:46Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:39:46Z","title":"Measuring Cross-Modal Synergy: A Benchmark for VLM Explainability","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T06:05:34.039507Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2605.22168"},"observation_digest":"sha256:e5198a1a2991c3c61ffea2a5309fc4d216daf8beb9de18a901051fd8cf372a9f","observation_id":"762b4ad1-b48e-40dd-95e3-99e53e76a9a2","resolution":{"observed_at":"2026-05-22T06:06:08.750971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2606.08034","last_updated":"2026-06-06T07:51:52Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:51:52Z","title":"Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-27T20:11:02.445626Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2606.08034"},"observation_digest":"sha256:04a650876383499a1c5a98453c7de33aad7bf482047ff66cee5f96a72b9db8e7","observation_id":"7a9952f2-aa1f-416c-a298-703ef7fd3898","resolution":{"observed_at":"2026-07-02T20:47:22.882322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2606.17296","last_updated":"2026-06-15T21:05:57Z","snapshot_observed_at":"2026-08-05T04:59:01.083696Z","submitted_at":"2026-06-15T21:05:57Z","title":"Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T03:31:02.911020Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2606.17296"},"observation_digest":"sha256:3e36d97c33c7f64d98441590d594965dfcd5ea82c367388265c7ac7d9f41cd68","observation_id":"4c0022df-3301-495b-a119-c24451d8c3f6","resolution":{"observed_at":"2026-07-03T17:58:47.380374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2606.20905","last_updated":"2026-06-18T20:01:32Z","snapshot_observed_at":"2026-08-03T03:13:19.923134Z","submitted_at":"2026-06-18T20:01:32Z","title":"Vesta: A Generalist Embodied Reasoning Model","version":1},"reference_index":161,"source":"pdf_text","source_observed_at":"2026-06-26T16:55:12.518255Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2606.20905"},"observation_digest":"sha256:f2e6b6fade62459f9df964f0e7cf436418eaf92ed2a0ba7b500983c73adec631","observation_id":"d21d4326-f5ba-4049-a2d6-e75804a0f5a1","resolution":{"observed_at":"2026-07-04T04:29:35.710669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2606.23052","last_updated":"2026-06-22T09:03:45Z","snapshot_observed_at":"2026-08-08T02:27:12.014256Z","submitted_at":"2026-06-22T09:03:45Z","title":"CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T07:28:54.731659Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2606.23052"},"observation_digest":"sha256:887c2a0ee5d79550a2165be7cb1503b73ea0aeb2a2c5bfe4e342d24a3a145762","observation_id":"9f8ed3fd-eddc-4c01-be3d-3b7158916600","resolution":{"observed_at":"2026-07-04T11:59:50.226221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-08-04T23:23:39.041606Z","title":"Ziwei Zhou, Rui Wang, Zuxuan Wu, and Yu-Gang Jiang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01665","last_updated":"2026-08-03T03:56:33Z","snapshot_observed_at":"2026-08-09T21:05:15.058403Z","submitted_at":"2026-08-03T03:56:33Z","title":"Allocation Before Ranking: Decoupled Token Compression for OmniLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:39.041606Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2608.01665"},"observation_digest":"sha256:d1128affa409854d78bcde8265dd35cb48efbae98ca8fb56d8784f0dfc8f493b","observation_id":"2428e129-1e3e-41a7-a55b-7e035829ebef","resolution":{"observed_at":"2026-08-04T23:23:39.041606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-08-14T04:35:43.369407Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08583","last_updated":"2026-08-09T08:56:54Z","snapshot_observed_at":"2026-08-14T06:55:35.387278Z","submitted_at":"2026-08-09T08:56:54Z","title":"Structure-Preserving Projection for Mitigating Modality Bias in LLM-Based Sequential Recommendation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:43.369407Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2608.08583"},"observation_digest":"sha256:20d52acf7c04178ecc228d7dced7e9c6fd73177914336664d95c9f1a21c6af30","observation_id":"bd0c3c6f-90de-49e1-b67a-77a01b36c8f5","resolution":{"observed_at":"2026-08-14T04:35:43.369407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18657/citation-record","integrity":"/paper/2505.18657/integrity","json":"/paper/2505.18657/citation-record.json","paper":"/paper/2505.18657"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:30:21.429352Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.429352Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:c62b0d5a276dea8482f98a23e05419519dc1e79a1dfd2a95d0bc8d91f474d515","observation_id":"abadf357-7af2-4e8b-9948-53262f65cd1f","resolution":{"observed_at":"2026-08-07T14:30:21.429352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:30:21.459812Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.459812Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:6091f517755e1ee8a41c7dc77bf7cbe72abf192ce13bde7bb31c8d4aeffb83fd","observation_id":"de9914c2-3abb-45f0-ac95-d09d3c005fa0","resolution":{"observed_at":"2026-08-07T14:30:21.459812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:30:21.513272Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.513272Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:13c87207881c27447165d61d2dd98c9a1e2ed17c1aaf97473865eb6849173e22","observation_id":"1f977bd7-d0b0-4f54-af21-f70a07258c6f","resolution":{"observed_at":"2026-08-07T14:30:21.513272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:30:21.584728Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.584728Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:d3e4426646349fb3f4064486737ddac68f762f4c109cd7365a012045eab75252","observation_id":"84836bc0-651d-46b3-8fbf-c737d4b9694f","resolution":{"observed_at":"2026-08-07T14:30:21.584728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T14:30:21.589921Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.589921Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:f8c079cfdb19b9801edc484d96618bb0368820c4522e14d49488a154f9ba54a3","observation_id":"04bf98c0-6cca-40e7-8fd8-c244a6a200fe","resolution":{"observed_at":"2026-08-07T14:30:21.589921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:30:21.593162Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.593162Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:c0db7cf469383e37021bcf2abe4b5b8fa86451c8e7bcb0a5db791be4ada4f039","observation_id":"b188da2d-cf46-4df9-b104-023a1c6c1498","resolution":{"observed_at":"2026-08-07T14:30:21.593162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:21.607933Z","title":"Tactile sensing—from humans to humanoids,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.607933Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:6075f8bf3546bd557027cd28a241a08b13f5ae9a46556ff6c1b55cab3072e593","observation_id":"fae684da-628a-46ff-8b47-8eb63d68578f","resolution":{"observed_at":"2026-08-07T14:30:21.607933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:21.697018Z","title":"Novel tactile sensor technology and smart tactile sensing systems: A review,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.697018Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:eff153a3d30286bfac53da6fc21ca53dfa8c7e5d763ea36aad99aad6658eee1d","observation_id":"e8a1874e-b341-4cd8-bf36-191136222c82","resolution":{"observed_at":"2026-08-07T14:30:21.697018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:21.755734Z","title":"Recent progress in technologies for tactile sensors,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.755734Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:2f4921a674ac4c0e8bdef4dc836b9522b3811202bf9727fd4335a4d93bc86e49","observation_id":"3a8fc65a-4764-44a9-81ce-3d7e7ed403c0","resolution":{"observed_at":"2026-08-07T14:30:21.755734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:21.819291Z","title":"Event-based vision: A survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.819291Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:032f73d2bcc31bcc1e5b27c648279eb6bac08a271c81993164718b999246e456","observation_id":"c6b63d81-4111-4b67-8bc6-659793d4b861","resolution":{"observed_at":"2026-08-07T14:30:21.819291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08890","last_updated":"2024-04-11T15:34:46Z","snapshot_observed_at":"2026-08-13T12:42:44.235949Z","submitted_at":"2023-02-17T14:19:28Z","title":"Deep Learning for Event-based Vision: A Comprehensive Survey and Benchmarks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08890","snapshot_observed_at":"2026-08-07T14:30:21.878801Z","title":"Deep learn- ing for event-based vision: A comprehensive survey and benchmarks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.878801Z"},"links":{"cited_paper":"/paper/2302.08890","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:1db002b37a6f647174d3425a69a5869b4a6d4ada741e42d7791af32e4433d0b9","observation_id":"f1f0f181-d3aa-4f30-b2ed-01657d64df5f","resolution":{"observed_at":"2026-08-07T14:30:21.878801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:21.976724Z","title":"High speed and high dynamic range video with an event camera,","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.976724Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:8aa9dfd60995b7cb40069a02391daec92e4d490ddd03bed9b2d1ab9ccd129668","observation_id":"3d2aacf3-1a2b-4646-827a-f296279d0144","resolution":{"observed_at":"2026-08-07T14:30:21.976724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.058249Z","title":"360sfuda++: Towards source-free uda for panoramic segmentation by learning reliable category prototypes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.058249Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:9aa76c0c6e471e8311e6e80a82ca11ef0c2c5d0844c083c1530c0eefb5258aed","observation_id":"8803649e-f34f-46a7-9ee5-7b12445399f1","resolution":{"observed_at":"2026-08-07T14:30:22.058249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.075625Z","title":"Semantics distortion and style matter: Towards source-free uda for panoramic segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.075625Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:baa689feffb9fbb9dec2ae291c0643084042ab05bd3695fb2cb1b4550dadaaa0","observation_id":"af7dc34a-6b02-4acd-8edf-02aad04864be","resolution":{"observed_at":"2026-08-07T14:30:22.075625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.078642Z","title":"Omnisam: Omnidirectional segment anything model for uda in panoramic semantic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.078642Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:e871ac0a9eb4908d019422995ea84440ab1e5680d5fda30d986862e6bfc2cd6a","observation_id":"368ebb22-04b4-414d-8dbf-4589bb639cce","resolution":{"observed_at":"2026-08-07T14:30:22.078642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.081758Z","title":"Mmbench: Is your multi-modal model an all-around player?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.081758Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:151279fdff6eac0cc7dfba6e4a2ee2dd44b33acfc19ba16d517c92bcae97e836","observation_id":"ad6c8bab-f38a-40d1-b620-5993180b1833","resolution":{"observed_at":"2026-08-07T14:30:22.081758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.084531Z","title":"Mmbench-video: A long- form multi-shot benchmark for holistic video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.084531Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:5c543a08a53bfb5643020ed46427d4ce1c5749f6420103c205168a02ca86b45c","observation_id":"10368d55-3909-45c7-a04e-6ec4ff1c7b8f","resolution":{"observed_at":"2026-08-07T14:30:22.084531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.227767Z","title":"Docvqa: A dataset for vqa on document images,","venue":null,"work_id":"fe4804bd-2bdb-4961-92bf-17f967b1a464","year":2021},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.087528Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:483556c57abc2af25ba25300971df63cffdb99ed333126672cbdd10eb4d552c9","observation_id":"6d86b2eb-c66e-42bc-a795-70e1a17855fe","resolution":{"observed_at":"2026-08-07T14:30:23.231183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18142","last_updated":"2024-09-21T15:22:26Z","snapshot_observed_at":"2026-08-12T22:40:26.251022Z","submitted_at":"2024-09-21T15:22:26Z","title":"A Survey on Multimodal Benchmarks: In the Era of Large AI Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18142","snapshot_observed_at":"2026-08-07T14:30:22.090211Z","title":"A survey on multimodal benchmarks: In the era of large ai models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.090211Z"},"links":{"cited_paper":"/paper/2409.18142","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:2f9108a8fc15094555292922e58c0cd250e0a620a90af6e1cd4de0d595bfe08d","observation_id":"0f72bb53-9575-40fc-8521-b66c9bf026c8","resolution":{"observed_at":"2026-08-07T14:30:22.090211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-08-14T10:12:58.959257Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-07T14:30:22.093509Z","title":"A survey on benchmarks of multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.093509Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:a936ed58ebe226d2a7e00772dc02dfcb3dc93a5459e3729b8719196ea6954747","observation_id":"7e2f3ed1-726d-445c-be3e-c0fba0554758","resolution":{"observed_at":"2026-08-07T14:30:22.093509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-12T22:50:55.724769Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-07T14:30:22.096111Z","title":"Visual prompting in multimodal large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.096111Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:9e53f19b0319af3138d5586d394f434f87dd28efcc378a7fc6f755bae76173a3","observation_id":"22a4348b-32aa-45d7-840f-981ad9e234c0","resolution":{"observed_at":"2026-08-07T14:30:22.096111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13962","last_updated":"2025-03-18T06:54:59Z","snapshot_observed_at":"2026-08-13T14:08:42.081325Z","submitted_at":"2025-03-18T06:54:59Z","title":"Survey of Adversarial Robustness in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13962","snapshot_observed_at":"2026-08-07T14:30:22.098809Z","title":"Survey of adversarial robustness in multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.098809Z"},"links":{"cited_paper":"/paper/2503.13962","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:c05e8e274d35c597588ae5d5deb76abaaaf280f5bbe28510bfcddcc2ac770f7b","observation_id":"240c9f7b-1905-4a45-85fa-6f8e67264a99","resolution":{"observed_at":"2026-08-07T14:30:22.098809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01887","last_updated":"2025-02-27T03:39:10Z","snapshot_observed_at":"2026-08-07T17:44:15.581009Z","submitted_at":"2025-02-27T03:39:10Z","title":"When Continue Learning Meets Multimodal Large Language Model: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01887","snapshot_observed_at":"2026-08-07T14:30:22.101577Z","title":"When continue learning meets multimodal large language model: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.101577Z"},"links":{"cited_paper":"/paper/2503.01887","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:b579c54c9f49410012749abce76511f35fcc79cfd3fc1a11c9713fc75d357406","observation_id":"5dd9b372-1165-4af8-9407-018a5b441505","resolution":{"observed_at":"2026-08-07T14:30:22.101577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05262","last_updated":"2025-08-14T12:30:25Z","snapshot_observed_at":"2026-08-13T00:59:21.077559Z","submitted_at":"2024-03-08T12:35:07Z","title":"Debiasing Multimodal Large Language Models via Penalization of Language Priors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05262","snapshot_observed_at":"2026-08-07T14:30:22.104648Z","title":"Debiasing multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.104648Z"},"links":{"cited_paper":"/paper/2403.05262","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:905fe9555aee76276d2753d2118a14aab74daa51f6882df5cf33523ed94eea78","observation_id":"48a07fd0-6595-4230-a234-f4278ffaa336","resolution":{"observed_at":"2026-08-07T14:30:22.104648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.217723Z","title":"Assessing modality bias in video question answering benchmarks with multimodal large language models,","venue":null,"work_id":"db3a355c-eebf-422f-bb80-7fa08f4c185c","year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.107563Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:dcc835a0d8dd2c95a474ec7204fa86743a041973a3baae504b7dadcaf3883b69","observation_id":"930a19f3-df9e-4833-8bc6-83e4ba5c06bf","resolution":{"observed_at":"2026-08-07T14:30:23.221346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.110240Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.110240Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:79283484034c28045cca2226e5d939b7c0983aa3b523a571c4380fb3995c78d6","observation_id":"75e16f0a-368a-4d2e-ade3-b2407f7b5c43","resolution":{"observed_at":"2026-08-07T14:30:22.110240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T14:30:22.113116Z","title":"Are we on the right way for evaluating large vision-language models?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.113116Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:7a047267520097801f6b1c548476561ffc97b0b3652f1d68ab0ee47f643fba63","observation_id":"bd31e67a-1889-4193-a03b-1846439542d8","resolution":{"observed_at":"2026-08-07T14:30:22.113116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18346","last_updated":"2024-11-13T17:17:43Z","snapshot_observed_at":"2026-08-13T00:44:04.391868Z","submitted_at":"2024-03-27T08:38:49Z","title":"Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18346","snapshot_observed_at":"2026-08-07T14:30:22.115900Z","title":"Quantifying and mitigating unimodal biases in multimodal large language models: A causal perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.115900Z"},"links":{"cited_paper":"/paper/2403.18346","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:47395fdd2954c976a6df763f8b9bda8caaaa954dd5a8b2df8451c16ef4914ac1","observation_id":"fdd05ac9-8660-40a5-8796-0e0a62eae093","resolution":{"observed_at":"2026-08-07T14:30:22.115900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T14:30:22.118528Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.118528Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:8a7a40b8c146337e71939e23403701dffbf30c60a437e0d322e0d64300b9d7fc","observation_id":"32ab4fa7-1ee6-4b7f-b712-ece5487f0cad","resolution":{"observed_at":"2026-08-07T14:30:22.118528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.201361Z","title":"Multimodal learning with transformers: A survey,","venue":null,"work_id":"27fd7673-02e5-4001-be2d-faf35cc2af26","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.121281Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:936ffa5af090be0402ae68b45c770d3dd996a74ff42d10108291e269f2a56675","observation_id":"e9eeb4cc-c199-42b3-a5d3-e11791352b31","resolution":{"observed_at":"2026-08-07T14:30:23.205609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.191162Z","title":"A survey on deep multimodal learning for computer vision: advances, trends, applications, and datasets,","venue":null,"work_id":"87cfce6c-6562-499f-acdc-b2b50bdd7363","year":2022},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.123962Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:dd3cb16cc17d2fa511fa94ea15117d917fb8b675699b0e375ebef2f2837a35f5","observation_id":"785f5e72-992b-497b-9e28-1af5ce9120e7","resolution":{"observed_at":"2026-08-07T14:30:23.195082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.179610Z","title":"A review on methods and applications in multimodal deep learning,","venue":null,"work_id":"d4d8d5f0-305f-4f70-aaf3-013add43c639","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.127154Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:5ebacdef6e1bd50932c8e715885afabbbf3d2aa81425f4b40bcadf37d17589be","observation_id":"1efb1648-6f3f-4ad4-9f34-c66904626dfd","resolution":{"observed_at":"2026-08-07T14:30:23.183537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.169264Z","title":"Learning modality-agnostic representation for semantic segmentation from any modalities,","venue":null,"work_id":"e1ab5478-94da-4cf7-a569-ffd9fcca0813","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.129748Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:d299135e277dd74cfc2ec78d1959e759306544fe7ab998f8dbcd395dadbb5e21","observation_id":"d748db31-5f83-40eb-996d-6fc45ace69dd","resolution":{"observed_at":"2026-08-07T14:30:23.173138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06700","last_updated":"2025-03-20T18:36:20Z","snapshot_observed_at":"2026-08-10T01:18:46.190414Z","submitted_at":"2025-03-09T17:33:15Z","title":"MemorySAM: Memorize Modalities and Semantics with Segment Anything Model 2 for Multi-modal Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06700","snapshot_observed_at":"2026-08-07T14:30:22.133352Z","title":"Memorysam: Memorize modalities and semantics with segment anything model 2 for multi-modal semantic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.133352Z"},"links":{"cited_paper":"/paper/2503.06700","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:ad5f9de04073bb6a6a85e437a02e3ccd3cd5e101a9b5cd93f230773c39982d91","observation_id":"920b8fe1-f8ca-4dd9-bc5d-82c150b38cb0","resolution":{"observed_at":"2026-08-07T14:30:22.133352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.158318Z","title":"Cafuser: Condition-aware multimodal fusion for robust semantic perception of driving scenes,","venue":null,"work_id":"3dd0bb4d-59b3-40c5-b5e3-446f8d4c793d","year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.136221Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:91e60c0f760c810f9ed8c59d85f971e5a3d0bef64c66169d2d5a5461e6d296b4","observation_id":"d3cd5a6f-8cde-4b9e-9714-82afa793bde4","resolution":{"observed_at":"2026-08-07T14:30:23.162814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.145751Z","title":"Multimodality represen- tation learning: A survey on evolution, pretraining and its applications,","venue":null,"work_id":"fb4f10df-b0eb-499b-8bc0-d82d5c461bb3","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.139263Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:6126dd9f2b6be0d221f8caeb3281e285e6fc924101cf573e21ec949406bbd16b","observation_id":"e6e58c7d-e301-4082-9d52-5b2b22c37770","resolution":{"observed_at":"2026-08-07T14:30:23.150498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.134702Z","title":"Enhancing multimodal cooperation via sample-level modality valuation,","venue":null,"work_id":"308f1bf3-cf3b-49b3-aada-2adb2138d271","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.142122Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:cfb6064bcbf1a1dee68157f9ae2468ba28441bca6b9d3ed04e3bf4ddb7b0823e","observation_id":"c4427475-67fb-4abf-a814-295a0c98e5d5","resolution":{"observed_at":"2026-08-07T14:30:23.138981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.123233Z","title":"Centering the value of every modality: Towards efficient and resilient modality-agnostic semantic segmentation,","venue":null,"work_id":"f0e9496c-9d5d-497b-8119-b9cdb1741b13","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.144730Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:ed1af2b0b270a96a40fc25f3967283cd38f8f2cff66afdfcddbf5cb82153a08e","observation_id":"b25be5e1-2a98-4a37-8d5e-64e3a28b5c96","resolution":{"observed_at":"2026-08-07T14:30:23.127895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06635","last_updated":"2025-05-10T12:58:15Z","snapshot_observed_at":"2026-08-07T15:48:14.074741Z","submitted_at":"2025-05-10T12:58:15Z","title":"Reducing Unimodal Bias in Multi-Modal Semantic Segmentation with Multi-Scale Functional Entropy Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06635","snapshot_observed_at":"2026-08-07T14:30:22.147211Z","title":"Reducing unimodal bias in multi-modal semantic segmentation with multi-scale functional entropy regularization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.147211Z"},"links":{"cited_paper":"/paper/2505.06635","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:369f6f1ec93023ef8c2d18f2e35353b037042c640842eb563e2dfbcfa73218ad","observation_id":"9eaf1cb3-d80c-4765-8697-b2d87d7cbae4","resolution":{"observed_at":"2026-08-07T14:30:22.147211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17141","last_updated":"2025-05-15T18:54:21Z","snapshot_observed_at":"2026-08-12T12:25:58.124112Z","submitted_at":"2024-11-26T06:15:27Z","title":"Learning Robust Anymodal Segmentor with Unimodal and Cross-modal Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17141","snapshot_observed_at":"2026-08-07T14:30:22.150289Z","title":"Learn- ing robust anymodal segmentor with unimodal and cross-modal distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.150289Z"},"links":{"cited_paper":"/paper/2411.17141","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:b9ccd078cb762cbc550a0130099c38f63cadcf6218e20b9a7c473854652fb3cf","observation_id":"32bd4f51-859d-493b-a30d-7056d89fb687","resolution":{"observed_at":"2026-08-07T14:30:22.150289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.110610Z","title":"Balanced multimodal learning via on-the-fly gradient modulation,","venue":null,"work_id":"92ee975e-273b-499e-961f-fd5f588ac55f","year":2022},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.153165Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:a31a64e614412a07c505d29386cea814c73e49c36f526df17d6ab4ac4bc8bd6b","observation_id":"4240287c-4dd6-43b6-9b7e-95bc67605209","resolution":{"observed_at":"2026-08-07T14:30:23.114742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.100214Z","title":"Clip the bias: How useful is balancing data in multimodal learning?,","venue":null,"work_id":"47a8e1f4-a382-4825-9a33-7b4d0b3a10f1","year":null},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.155716Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:26d175b7d808a6d22b43bfd8fee926c587e2008b9e2c70f110dc65d4114afb99","observation_id":"7f854eed-ce46-418b-a9f9-82957d64b9ec","resolution":{"observed_at":"2026-08-07T14:30:23.103890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.158369Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.158369Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:e626eeee2e459c4ad24bc516b924cd453f4676e52dfcd9bdbd2f9e71ba372bb4","observation_id":"d983c414-9160-48e0-bcd9-99226fe98920","resolution":{"observed_at":"2026-08-07T14:30:22.158369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.082015Z","title":"Clippo: Image-and-language understanding from pixels only,","venue":null,"work_id":"dbfc374a-c71a-44f7-9966-45f5d6d8b117","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.161631Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:7f155031c755ead7b837478d1265b448c4da07671368daacc292f27e68070637","observation_id":"5281160e-64e4-46c1-8726-11206bfeb0c3","resolution":{"observed_at":"2026-08-07T14:30:23.086597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.072068Z","title":"Clip-kd: An empirical study of clip model distillation,","venue":null,"work_id":"166ebec5-3207-4fa2-a204-90cf063bf978","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.164266Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:90a2cf0e0689a976234b6351e29e791eaf6722ab4ed373c1d763fb8397fe674d","observation_id":"3863a0eb-aab7-41a9-b071-513a6915dc96","resolution":{"observed_at":"2026-08-07T14:30:23.075659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.062155Z","title":"Tinyclip: Clip distillation via affinity mimicking and weight inheritance,","venue":null,"work_id":"9ee3c708-b4cf-45a8-9cf1-c1cef8f77ebe","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.167042Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:74d85d4574c606ee9d80fe3b03aae96cbfacd5615fa52616e8b549fbb2a20dcb","observation_id":"17f011f8-4d95-4edc-9b26-86e7847d4924","resolution":{"observed_at":"2026-08-07T14:30:23.065651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.052449Z","title":"An inverse scaling law for clip training,","venue":null,"work_id":"ee5ff19f-6ef7-43f7-90b3-4a45963a8540","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.169708Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:b8f15332ceaef9990239adaa9263fa1bea83e512215f4ebb71beaf507b9b5ea0","observation_id":"0565e097-cf6d-45be-9d94-5b72c4772f89","resolution":{"observed_at":"2026-08-07T14:30:23.055966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10816","last_updated":"2025-06-13T08:32:24Z","snapshot_observed_at":"2026-08-07T18:15:48.978866Z","submitted_at":"2025-02-15T14:42:42Z","title":"BalanceBenchmark: A Survey for Multimodal Imbalance Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10816","snapshot_observed_at":"2026-08-07T14:30:22.172299Z","title":"Balancebenchmark: A survey for multimodal imbalance learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.172299Z"},"links":{"cited_paper":"/paper/2502.10816","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:1cc7b7c5cc134a05a89a7263b307ad4a85a860ad01e64aadbe81fbc0aa55d73c","observation_id":"eed1ba1d-0733-439f-838c-a82bbfebd2ce","resolution":{"observed_at":"2026-08-07T14:30:22.172299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.042019Z","title":"Facilitating multimodal classification via dynamically learning modality gap,","venue":null,"work_id":"5eeed1cc-cde8-4846-b22d-c73f32d3be2e","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.175121Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:1f749ae492ee0adb180c34d2388f5434d11f58b11f8e9399de6addf615ae420a","observation_id":"54f1252b-063a-4c80-abec-02d1ee4a54bc","resolution":{"observed_at":"2026-08-07T14:30:23.045629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18445","last_updated":"2025-04-10T08:56:52Z","snapshot_observed_at":"2026-08-07T16:41:59.861327Z","submitted_at":"2025-03-24T08:46:52Z","title":"Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18445","snapshot_observed_at":"2026-08-07T14:30:22.178436Z","title":"Benchmarking multi-modal semantic segmentation under sensor failures: Missing and noisy modality robustness,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.178436Z"},"links":{"cited_paper":"/paper/2503.18445","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:678b9248dcf1a139e91a2eb09199162d29e89d398a1543a1b1841f837d6e507b","observation_id":"226d7d21-0215-4242-98e2-d50a08ebf7c9","resolution":{"observed_at":"2026-08-07T14:30:22.178436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12787","last_updated":"2024-10-16T17:59:02Z","snapshot_observed_at":"2026-08-12T22:21:38.215274Z","submitted_at":"2024-10-16T17:59:02Z","title":"The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12787","snapshot_observed_at":"2026-08-07T14:30:22.181322Z","title":"The curse of multi-modalities: Evaluating hallucinations of large multimodal models across language, visual, and audio,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.181322Z"},"links":{"cited_paper":"/paper/2410.12787","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:f66ae880d1b0277d6da54476b5ebb62a3440b022e20a59ec152bc00e6f762708","observation_id":"a9af95a0-7df2-4c73-8114-69135c20ee99","resolution":{"observed_at":"2026-08-07T14:30:22.181322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.031162Z","title":"On modality bias recognition and reduction,","venue":null,"work_id":"eb579995-4566-4835-808c-8fdd38283d71","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.184498Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:116f8c6df2902355a3c18ac1cabbf0d44ebf2697da83aa11a36969f97ad6c570","observation_id":"eba14ae4-04a6-4dd1-8bd0-27b3e1fc5453","resolution":{"observed_at":"2026-08-07T14:30:23.035177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.019839Z","title":"Cross modality bias in visual question answering: A causal view with possible worlds vqa,","venue":null,"work_id":"ac5bc647-d0da-4e96-a92b-6714760ed91f","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.187223Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:65e94d9ced6db2099ba1b1579ca324942bef1b90885e568ae8dc0cf0065cf001","observation_id":"6c3f4aba-7103-404e-ad0e-401272a7a362","resolution":{"observed_at":"2026-08-07T14:30:23.024112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.009569Z","title":"Counterfactual vqa: A cause-effect look at language bias,","venue":null,"work_id":"917abd9f-fcea-4427-9760-37194adcf382","year":2021},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.189752Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:8e67872f3668b3b29fe72b8c7ec51938ee15a3537eb46a4d08087f1b586151f3","observation_id":"b1fb5883-1613-44da-b211-b78203584a3a","resolution":{"observed_at":"2026-08-07T14:30:23.013324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.999717Z","title":"Removing bias in multi-modal classifiers: Regularization by maximizing functional entropies,","venue":null,"work_id":"84261267-78af-4bd5-90ad-687369feafd9","year":2020},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.192626Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:5f64c81c9b3d2b016f798923535848be0a7bd6f13193cbe0c458d3c3a1d967f0","observation_id":"5fd3e92d-26e7-48b8-8e13-a7016f6e868c","resolution":{"observed_at":"2026-08-07T14:30:23.003308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.988855Z","title":"Overcoming language priors in visual question answering with adversarial regularization,","venue":null,"work_id":"5626fe92-6838-4eef-b17c-191f3973263e","year":2018},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.195085Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:08296ee2dd317d004dc1c01338ffa0e58429b601d8eb62fd2f54cb1b7d6609f4","observation_id":"6c265d65-7454-45ba-939e-f633f23abb2d","resolution":{"observed_at":"2026-08-07T14:30:22.992584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08702","last_updated":"2025-02-08T23:14:12Z","snapshot_observed_at":"2026-08-13T00:37:15.165039Z","submitted_at":"2024-06-13T00:00:20Z","title":"VLind-Bench: Measuring Language Priors in Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08702","snapshot_observed_at":"2026-08-07T14:30:22.197925Z","title":"Vlind-bench: Measuring language priors in large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.197925Z"},"links":{"cited_paper":"/paper/2406.08702","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:4676603a541151e6be166ca4e03c5f8f259590a1eb66222db0e2abef34e333db","observation_id":"95f1802f-089e-4d52-a589-a641b2e3f5bc","resolution":{"observed_at":"2026-08-07T14:30:22.197925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08145","last_updated":"2025-05-31T02:59:15Z","snapshot_observed_at":"2026-08-12T22:26:05.762543Z","submitted_at":"2024-10-10T17:31:17Z","title":"Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08145","snapshot_observed_at":"2026-08-07T14:30:22.201170Z","title":"Insight over sight? exploring the vision-knowledge conflicts in multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.201170Z"},"links":{"cited_paper":"/paper/2410.08145","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:81ea84828d0d1993da6ca3259950493bb6f6786ef173c9fc04de8cd4a8d803c9","observation_id":"d09c89d4-3718-46f9-a9c6-a21ae99ffe63","resolution":{"observed_at":"2026-08-07T14:30:22.201170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.977900Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":"1ad5bf10-7a9e-4484-a301-ad6cccf9cf33","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.204220Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:7f21403d7b4f49ea11c990050122dadb4246f7e28e2614349eee1c12093a01c7","observation_id":"ed7e82ee-c4df-406b-bb6d-e744c18b684d","resolution":{"observed_at":"2026-08-07T14:30:22.982040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.966044Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning,","venue":null,"work_id":"4c1592f3-7b2e-44ed-bb6a-c9914f32122c","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.206978Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:6a0d9b3a9874602b7ac5360d2ad430bf6e8734d533c9b38cfef0f8e2f4f62d30","observation_id":"bf7b0c12-2d21-4c55-8a2c-fd6b55594d57","resolution":{"observed_at":"2026-08-07T14:30:22.970869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.953202Z","title":"Strengthening multimodal large language model with bootstrapped preference optimization,","venue":null,"work_id":"34c6fcbb-59d2-4b49-88a7-3d62492e91d1","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.209706Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:358c3c6d2cc65e11ae0ed5f471579edc24306e4096478287798d6c7f16ef7352","observation_id":"b2929ed7-5c6a-43f6-9111-44acd1117ea8","resolution":{"observed_at":"2026-08-07T14:30:22.958519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.942920Z","title":"Paying more attention to image: A training-free method for alleviating hallucination in lvlms,","venue":null,"work_id":"f2e809b0-f0fd-44b9-9981-cf6f6f167a6b","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.212686Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:3e64581fcdf9b53baddc0af90146eebefb475287b13930b264271883e4faa709","observation_id":"145abb58-7810-4d10-9917-8b14b04e042c","resolution":{"observed_at":"2026-08-07T14:30:22.946545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14279","last_updated":"2026-05-28T06:50:29Z","snapshot_observed_at":"2026-08-12T15:18:35.540443Z","submitted_at":"2024-11-21T16:33:30Z","title":"Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14279","snapshot_observed_at":"2026-08-07T14:30:22.216120Z","title":"Looking beyond text: Reducing language bias in large vision-language models via multimodal dual-attention and soft-image guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.216120Z"},"links":{"cited_paper":"/paper/2411.14279","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:a4a5d66ab9a091afb91d0175bd1f580990350890cca82f097b28b1ac5d27c627","observation_id":"2793178a-cee2-4fa3-bc9a-0a090975cfb8","resolution":{"observed_at":"2026-08-07T14:30:22.216120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17928","last_updated":"2025-03-23T04:00:11Z","snapshot_observed_at":"2026-08-11T19:09:47.568394Z","submitted_at":"2025-03-23T04:00:11Z","title":"Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17928","snapshot_observed_at":"2026-08-07T14:30:22.219763Z","title":"Debiasing multimodal large language models via noise-aware preference optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.219763Z"},"links":{"cited_paper":"/paper/2503.17928","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:0078bd12f6b2180485c6d9b221fa110eea8c282576e2518332d413852cc11596","observation_id":"aa27677a-e313-40c2-a46b-f9467ef70160","resolution":{"observed_at":"2026-08-07T14:30:22.219763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03122","last_updated":"2025-05-21T14:00:20Z","snapshot_observed_at":"2026-08-07T17:28:50.957435Z","submitted_at":"2025-03-05T02:37:41Z","title":"The Devil Is in the Details: Tackling Unimodal Spurious Correlations for Generalizable Multimodal Reward Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03122","snapshot_observed_at":"2026-08-07T14:30:22.222904Z","title":"The devil is in the details: Tackling unimodal spurious correlations for generalizable multimodal reward models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.222904Z"},"links":{"cited_paper":"/paper/2503.03122","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:3f6db73d243c8ea8c0011322d3c2357197addcbdf40fab5722a7e6a18904ca4b","observation_id":"4b25bda4-5890-417e-abb3-c5147a9a2c1a","resolution":{"observed_at":"2026-08-07T14:30:22.222904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:30:22.226582Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.226582Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:a742f916be3e76ff55cc58b51c841eec90eea032adbf22049cd74cf66c13137d","observation_id":"a66f15ad-6718-4f94-91b5-1bae655a8ab8","resolution":{"observed_at":"2026-08-07T14:30:22.226582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T14:30:22.229737Z","title":"Deepseek llm: Scaling open-source language models with longtermism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.229737Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:6da808ef8a7ac0f5185b8771e75e6d8c06b76e6dad8fe665caa59e86542fee4d","observation_id":"24dbfffb-92e8-4f8b-96f4-5184825983ce","resolution":{"observed_at":"2026-08-07T14:30:22.229737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06435","snapshot_observed_at":"2026-08-07T14:30:22.233235Z","title":"A comprehensive overview of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.233235Z"},"links":{"cited_paper":"/paper/2307.06435","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:ced9ce4604a4dcc6485fd7236d4e3b57ae8833471dfe221b0483f47a7d8c6d67","observation_id":"dcbe360a-bf55-4d60-bf25-1a2c58305fd8","resolution":{"observed_at":"2026-08-07T14:30:22.233235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.932842Z","title":"Masked jigsaw puzzle: A versatile position embedding for vision transformers,","venue":null,"work_id":"773a710d-ad06-4108-9d0c-40a2c97781bd","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.237361Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:917aa63e16f126efd466292008b7fa34d3c16eb076b93bc288683662e27a288a","observation_id":"f0b93cc6-1b3c-47e6-ae68-aaa8e7e9b50d","resolution":{"observed_at":"2026-08-07T14:30:22.936660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.922767Z","title":"A survey on vision transformer,","venue":null,"work_id":"d805ddde-c3de-4762-b50f-3461c5ab2046","year":2022},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.240687Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:705ed11dc77791d18c8ff0f3987b0a2536f11e8b1fc583f77b6838cbfefab911","observation_id":"05080f11-c309-4a05-9822-8a3690c70c96","resolution":{"observed_at":"2026-08-07T14:30:22.926169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.912739Z","title":"Bringing masked autoencoders explicit contrastive properties for point cloud self-supervised learning,","venue":null,"work_id":"ee91d643-9da3-4238-9310-e08a1e567427","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.243960Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:1ea48fb772d5e585010dd644f7d632c6601319ec707aa75293b5b7dba648d2e6","observation_id":"ac964b04-73d0-4318-bc75-bf67cf661dbf","resolution":{"observed_at":"2026-08-07T14:30:22.916354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.247725Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.247725Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:f63d796bce236a6e702d2e8980cca58d2b0684ee0a9ce6d5389c487fa9a2bd79","observation_id":"c05644ac-d74b-40e8-849c-e84eeae62b23","resolution":{"observed_at":"2026-08-07T14:30:22.247725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.896402Z","title":"Sharing key semantics in transformer makes efficient image restoration,","venue":null,"work_id":"81aa0bf7-328c-42a6-b8cb-66a30863cb7e","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.250976Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:89a0555956f9565454d717ba4f3dbf3cc045793c482ab58c468a9d66e511d2df","observation_id":"b6b99f08-5030-4543-9808-8fbf73ca4cab","resolution":{"observed_at":"2026-08-07T14:30:22.900881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.885236Z","title":"Learning disentangled identifiers for action-customized text-to-image generation,","venue":null,"work_id":"4b95bcaa-9790-4b61-8efd-7dcbc555b4a8","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.255003Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:119a75aa384ba48749742e7b94f2f722aa2e822520714da20ebb8258bab541ff","observation_id":"f595a5dd-322b-441f-8fe8-2f54e1c5e178","resolution":{"observed_at":"2026-08-07T14:30:22.889983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.873081Z","title":"Languagebind: Extending video-language pretraining to n-modality by language-based semantic alignment,","venue":null,"work_id":"74346d9e-ed54-4078-aa26-13bb3b907bbf","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.259050Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:9fb9dcc04ce1df7e08bf4aa622ee2b2d8c1cca823a1d73e9f499a40e4f584dad","observation_id":"94e2c6fc-7000-47c3-ac38-11650580962c","resolution":{"observed_at":"2026-08-07T14:30:22.877388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.861259Z","title":"Unibind: Llm-augmented unified and balanced representation space to bind them all,","venue":null,"work_id":"957a33fb-9222-413d-8385-dba13ecf7c8c","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.262913Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:5414cc45aa3a4dcf7d1950d38b0b40d2ef269b90f3074e568d8a4cc250161ce4","observation_id":"b179d7a7-2263-4f13-963a-9ca3b55cd60e","resolution":{"observed_at":"2026-08-07T14:30:22.865706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.848446Z","title":"Optimizing intersection-over-union in deep neural networks for image segmentation,","venue":null,"work_id":"309cec5b-f2c5-4c1a-8114-ff9de06dfa96","year":2016},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.266455Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:5d3d58e87e2a925236896ad77306bc291667f87a818805883964c681802b6eb2","observation_id":"8f91d17d-86f8-4764-b193-44e7b3378a20","resolution":{"observed_at":"2026-08-07T14:30:22.853693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.835795Z","title":"Generalized inter- section over union: A metric and a loss for bounding box regression,","venue":null,"work_id":"3954862f-8ea3-492c-91b6-905ce0447e6f","year":2019},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.270817Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:200c4d114ffa314085461db03cb647a3f98800679f01b96532c6a6358eae4f0f","observation_id":"73692348-413f-4060-a6f0-372b6fd8976e","resolution":{"observed_at":"2026-08-07T14:30:22.839603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.822336Z","title":"Subjective and objective quality assessment for image restoration: A critical survey,","venue":null,"work_id":"5fd5f2c9-67f2-4dcb-8889-f0b5febc56a5","year":2020},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.274373Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:31f05d924f3582c453c7d6200fcaffeb6d1ee4e0ba1b8f52ee95b0eb8eb060eb","observation_id":"e0ca48bf-d094-477e-96f4-6d9151494b36","resolution":{"observed_at":"2026-08-07T14:30:22.826616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.810180Z","title":"Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models,","venue":null,"work_id":"02d6ccf8-289c-4b6d-8252-4be420d4fc0b","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.278422Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:c9046fe8b923e3880eeb467c2b7bc1f6262b88ec5b9b084e325cffbe90ea6935","observation_id":"5d79f5b9-2bf3-49e1-8b1f-412a534e7363","resolution":{"observed_at":"2026-08-07T14:30:22.815042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.797471Z","title":"Valor: Vision-audio-language omni-perception pretraining model and dataset,","venue":null,"work_id":"d0c3852e-3bd7-4fef-b8d8-6dc351c4d5ef","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.281980Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:c6707f06b1e60597c286e2c8dc8c670df2bfcd0db1f2df4d2f70b51ab4c7e445","observation_id":"99d06a1f-5917-49aa-a3b3-de98a6edb5aa","resolution":{"observed_at":"2026-08-07T14:30:22.801518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.784685Z","title":"Multimodal visual-tactile representation learning through self-supervised contrastive pre-training,","venue":null,"work_id":"19fdfac8-8931-4cf2-9964-07e472b56dec","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.285837Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:76e12884984299c8b5347ab49ee5c7ccd1fc2afa22086997b5938ac3afcca573","observation_id":"e1842fcb-53cd-434f-a681-75f6eb0718f1","resolution":{"observed_at":"2026-08-07T14:30:22.789295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16108","last_updated":"2024-05-25T07:45:41Z","snapshot_observed_at":"2026-08-12T23:58:15.184834Z","submitted_at":"2024-05-25T07:45:41Z","title":"OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16108","snapshot_observed_at":"2026-08-07T14:30:22.289194Z","title":"Omnibind: Teach to build unequal-scale modality interaction for omni-bind of all,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.289194Z"},"links":{"cited_paper":"/paper/2405.16108","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:e61a3482d7f6a05cb127ce16e7cf55c507618b1007ff0ccbc0dd538e587ab4ba","observation_id":"cac625a7-724d-458f-9e85-53d7e383c7e6","resolution":{"observed_at":"2026-08-07T14:30:22.289194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.771285Z","title":"Soft robotic hand with tactile palm-finger coordination,","venue":null,"work_id":"ccf33b2b-1a38-43fb-98e4-83376a1646a1","year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.292730Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:f44f3b4dc36fab633dfc86e34cc11f56d27449ab20b55ac079ccd85489fddb47","observation_id":"47d56575-b2a1-4521-855c-d042382911fd","resolution":{"observed_at":"2026-08-07T14:30:22.775871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.758797Z","title":"Categorizing robots by performance fitness into the tree of robots,","venue":null,"work_id":"5172e9b3-df79-4527-a3d9-46d7a393bd4e","year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.296123Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:ffa04e9ace58b541b13e29f96544ce075e3f977b5ff5642b765d643da2fb7e86","observation_id":"03946064-751d-4780-bb07-0fedf7bfaaa5","resolution":{"observed_at":"2026-08-07T14:30:22.762667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.747075Z","title":"Vision-based tactile sensor design using physically based rendering,","venue":null,"work_id":"e60e9835-7af8-434f-9e2e-b885ff48e03a","year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.299865Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:2403022cca39d0ee55827e3c5f7da8d5f2fad8476e23ccb3445f839235a28c97","observation_id":"b8d77fdc-ab92-4c86-90f1-9c9553170a94","resolution":{"observed_at":"2026-08-07T14:30:22.751464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.735530Z","title":"Bi-vla: Vision-language-action model-based system for bimanual robotic dexterous manipulations,","venue":null,"work_id":"08a34ea2-75ed-49c9-b493-7e5d2f50a758","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.303293Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:82a0cbc022d5317d9d23a6027397ff05115149a0154eb3a836d4fd28a957041c","observation_id":"6f6640db-e917-4cd2-8627-48c3af45b849","resolution":{"observed_at":"2026-08-07T14:30:22.739766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.724288Z","title":"A practical tutorial on explainable ai techniques,","venue":null,"work_id":"7b24a569-8bde-4a9e-9a72-d86f5d656bd5","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.307032Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:fbdd9fff9f0026598eb1d250636a526bda51c6803f0bc8c061526ad28272e1c2","observation_id":"6cc13352-ba83-4d59-9730-629bee828a3b","resolution":{"observed_at":"2026-08-07T14:30:22.728345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.711015Z","title":"Explainable ai (xai): Core ideas, techniques, and solutions,","venue":null,"work_id":"da10f8b5-f2f9-41e4-be7a-762c5033c895","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.310402Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:aa9681430f42a86987cf5cd568e9ef0bc9101743d0b95d9d3cf31d93203d2ca9","observation_id":"27247ff8-dfd5-4b37-9541-3ca6845d5170","resolution":{"observed_at":"2026-08-07T14:30:22.716378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T23:09:29.479004Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 17 inbound Pith citation observations for arXiv:2505.18657."}