{"as_of":"2026-08-18T08:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cccbe4214e1dbac7c3506d2b710e193cb186f1dcc57b36822dbb496031a2ca43","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:43:44.008852Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T08:36:21.863358Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:43:15.762081Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"cited_work":{"arxiv_id":"2506.07202","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07202","snapshot_observed_at":"2026-06-29T08:43:15.762081Z","title":"InProceedings of the IEEE/CVF international conference on computer vision, pages 11963–11974","venue":null,"work_id":"9189ef28-3be4-41c9-bfa5-924456b50cf7","year":2025},"citing_paper":{"arxiv_id":"2605.29339","last_updated":"2026-05-28T04:20:41Z","snapshot_observed_at":"2026-08-02T12:43:45.453036Z","submitted_at":"2026-05-28T04:20:41Z","title":"DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T08:36:21.863358Z"},"links":{"cited_paper":"/paper/2506.07202","citing_paper":"/paper/2605.29339"},"observation_digest":"sha256:a400be6c2e75f40281191f5beaea2bc9f496775f91cde359096c6b1e984c9d2b","observation_id":"87a9aca1-b6d3-44d1-a386-294b3273e171","resolution":{"observed_at":"2026-06-29T08:43:15.763580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07202/citation-record","integrity":"/paper/2506.07202/integrity","json":"/paper/2506.07202/citation-record.json","paper":"/paper/2506.07202"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:49.103129Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":null,"work_id":"5355f61a-ea1c-4d95-9eeb-47170f16e7f4","year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.190734Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:7a442293610f3b5edb53911506567bc5377f07d4fe29b7a945d7ff6ddd509503","observation_id":"ca4abf32-e965-4329-8ddb-2d501f7288dd","resolution":{"observed_at":"2026-08-07T05:43:49.228008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T05:43:38.257889Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.257889Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:c9f990d4b9c5c9b44b9bb60e0bed86002813ba2a2cda1ba1f05c9a41c6f58094","observation_id":"461a6f64-d357-4671-838d-54ffc7894c6f","resolution":{"observed_at":"2026-08-07T05:43:38.257889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T05:43:38.419260Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.419260Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:27c27802e542d5f91f564e935eaedfa54e1fdc5f6ee8d9fc8e16d73e4d56b8ad","observation_id":"ff8bb995-86a5-47ab-a9af-6e3f4a808755","resolution":{"observed_at":"2026-08-07T05:43:38.419260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T05:43:38.541820Z","title":"Closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.541820Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:a5fc2bb2193669d76f4d5961d1576d6f44e3296fee7939a44273a05a918e8aa9","observation_id":"c7bd01bc-355d-4378-8430-4d52309701ae","resolution":{"observed_at":"2026-08-07T05:43:38.541820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:38.711427Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.711427Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:a702c1faa2ada0cfe17f511c1e78eab774337df6b03d2edd22214a8890632ea2","observation_id":"6e3b7325-fb3c-403b-9538-584a770ebc6b","resolution":{"observed_at":"2026-08-07T05:43:38.711427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08758","last_updated":"2021-09-30T17:20:01Z","snapshot_observed_at":"2026-08-16T18:30:48.108993Z","submitted_at":"2021-04-18T07:42:52Z","title":"Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08758","snapshot_observed_at":"2026-08-07T05:43:38.885301Z","title":"Documenting large webtext corpora: A case study on the colossal clean crawled corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.885301Z"},"links":{"cited_paper":"/paper/2104.08758","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:8e00789656ad0e7aefdaf633f28a358acc9ab63ec8033fcef7556a8623099915","observation_id":"a5dce37d-d9c2-4d0b-888a-cbfc4ac61195","resolution":{"observed_at":"2026-08-07T05:43:38.885301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:48.754363Z","title":"Complex Video Reasoning and Robustness Evaluation Suite (CVRR-ES)","venue":null,"work_id":"a6b1469a-b931-479e-ac7a-4b7744f49674","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.042400Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:d8566d56cf8f48c050e4971192285198f1fecf3af99a194f2d05879ac9cab909","observation_id":"b6d79c24-7fe5-41ca-af19-30b895ee88de","resolution":{"observed_at":"2026-08-07T05:43:48.912141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14890","last_updated":"2024-02-12T17:30:25Z","snapshot_observed_at":"2026-08-16T14:32:07.817753Z","submitted_at":"2023-12-22T18:07:44Z","title":"NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14890","snapshot_observed_at":"2026-08-07T05:43:39.255176Z","title":"Nphardeval: Dynamic benchmark on reasoning ability of large language models via complexity classes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.255176Z"},"links":{"cited_paper":"/paper/2312.14890","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:f844039097393b455640597cf5b1c9ced2c620360ab675278473c5ccec3d7c02","observation_id":"145fe6b8-60a8-4bd3-a933-6aa0a5eaad46","resolution":{"observed_at":"2026-08-07T05:43:39.255176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T05:43:39.375817Z","title":"Video-R1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.375817Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:123f881b49d77cdd571583f230f927bafe363198bd2ee90cd846d9659997eedf","observation_id":"18484495-cf17-4f71-b15a-4214b86012b5","resolution":{"observed_at":"2026-08-07T05:43:39.375817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T05:43:39.449895Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.449895Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:747bc5daf6f4af18cfbca48bfff44a58921993d7c20413e5567c5f66d3985be8","observation_id":"7f864f67-399d-4d94-8d52-7712ddc73784","resolution":{"observed_at":"2026-08-07T05:43:39.449895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05935","last_updated":"2025-03-21T10:19:01Z","snapshot_observed_at":"2026-08-18T00:33:51.822601Z","submitted_at":"2024-02-08T18:59:48Z","title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05935","snapshot_observed_at":"2026-08-07T05:43:39.543588Z","title":"Sphinx-x: Scaling data and parameters for a family of multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.543588Z"},"links":{"cited_paper":"/paper/2402.05935","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:50475d61e0dd5b930b9cb572cd50c66ab37903b60a7296fe35d64f7fd50bebeb","observation_id":"dc258f49-a426-4b23-bc29-558dde71b26f","resolution":{"observed_at":"2026-08-07T05:43:39.543588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:48.476976Z","title":"Time travel in LLMs: Tracing data contamination in large language models","venue":null,"work_id":"bb56dafa-fba6-4eb0-8b93-378889b9af3a","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.598573Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:7acb0ab4012a9b34bceee6557f3831378004a3cf5f2bbb0b8ccc10d5e05e3c3f","observation_id":"373f9932-70b9-42e9-8684-9ed355346882","resolution":{"observed_at":"2026-08-07T05:43:48.603675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:48.217588Z","title":"Goodfellow, Jonathon Shlens, and Christian Szegedy","venue":null,"work_id":"6e03a7d9-6622-43ce-bca5-19a2997a5de6","year":2015},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.737219Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:610cb7a55660c3485cc0a6ee8e18f87251d8eacee1185ce017b35d54a85e6f2f","observation_id":"6dad6892-dcbe-4f3c-8327-94cc60b97c7b","resolution":{"observed_at":"2026-08-07T05:43:48.325245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:47.954242Z","title":"Flat minima","venue":null,"work_id":"75ba55d3-862f-4a8d-8099-7fd071e199ec","year":1997},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.855755Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:648d4c7fb4608971ff929a6edf79a5d84cb4fd5905fe5d5a58032c087f1a7858","observation_id":"03daa9c5-f96a-43e8-944a-775293501894","resolution":{"observed_at":"2026-08-07T05:43:48.054042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:40.028594Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.028594Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:a34d8fe6b3b7d5247deb84f6da72615f1ca268b464c748c51b354f7639ce81ed","observation_id":"296a0b41-3fd2-40f9-ba56-9bbb5d0eb0b1","resolution":{"observed_at":"2026-08-07T05:43:40.028594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-08-15T20:45:29.277746Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-07T05:43:40.205852Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.205852Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:efc9ac2719b5492ecab0911baec8ae44cdbb2dd924d8ffac9309735112a7cadf","observation_id":"16b0f9da-ef7e-455e-a53e-c4a85c7e0b23","resolution":{"observed_at":"2026-08-07T05:43:40.205852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:47.624024Z","title":"LLaV A-OneVision: Easy visual task transfer","venue":null,"work_id":"ad6fe1c9-3e09-41fc-9f50-50783542beb0","year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.352290Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:abdfa7567d5f0d3f62b39bba8f97edf5a84b7fa958685e11c91f7d40c76ec110","observation_id":"d940628d-e01b-4cad-acd2-5bf23370c18f","resolution":{"observed_at":"2026-08-07T05:43:47.780360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T05:43:40.501360Z","title":"Seed- bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.501360Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:0e6c4e74312a32ae6b974f2ce9c62c40bba0a5f5e5b2d8031ceb55f975943485","observation_id":"c7cc41dc-b9de-4638-aa37-b8f895cd19a0","resolution":{"observed_at":"2026-08-07T05:43:40.501360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T05:43:40.648654Z","title":"VideoChat-R1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.648654Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:2b8429e2ed02422b76ba9d6584ca31a1728e27168d5d01c9adc123c42a3e891d","observation_id":"56be8d9d-0980-44d9-8a08-da5276953aa3","resolution":{"observed_at":"2026-08-07T05:43:40.648654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T05:43:40.744698Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.744698Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:5511f136f44543e6c979922eec95b82795ac8c927d129b21054ea7e10f0e5c07","observation_id":"954ca561-503e-4eec-9ed3-dd3d1fe530e5","resolution":{"observed_at":"2026-08-07T05:43:40.744698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:40.944687Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.944687Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:2dbe2c7dec122f18a9e4d8d18a9b648ed7af2200280156dedbd51ed6f9bef93c","observation_id":"a1214211-d31e-42b3-811c-b63afed3d312","resolution":{"observed_at":"2026-08-07T05:43:40.944687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:47.372096Z","title":"On the robustness of multimodal language model towards distractions, 2025","venue":null,"work_id":"54f41a16-7f8c-413f-a001-d14e0536d8d2","year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.115259Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:6a89df43654780324ac604ed03ac1be095eb6576732807c4ef56d3f6761110cc","observation_id":"655f1235-d44d-4cb3-89c3-0231e9e6d2cd","resolution":{"observed_at":"2026-08-07T05:43:47.469322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:47.053176Z","title":"Is your video language model a reliable judge? In The Thirteenth International Conference on Learning Representations, 2025","venue":null,"work_id":"bcaaafea-0d5a-4119-9cfc-03fb987b9ed3","year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.231453Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:af0d87bff75923b18d157dd842129cf09eba9a6fd56fe5a47abf99683217dbf4","observation_id":"9bc5acdd-12dc-415d-97c4-5eeadbcac686","resolution":{"observed_at":"2026-08-07T05:43:47.201742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T05:43:41.387231Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.387231Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:eb6fda15cc2f40739015060bae451bb23ecf4064f71793d5b1357aca04507484","observation_id":"786f99bd-9ae8-4afc-a830-939e58122de1","resolution":{"observed_at":"2026-08-07T05:43:41.387231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:46.765671Z","title":"The Llama 3 herd of models","venue":null,"work_id":"0b3ac397-7aa0-49a8-9f91-1089826e9947","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.529067Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:82dffecb5a53a669ff762db35621ca68bf8517f3bfa1c0bb1f18b84586a06b04","observation_id":"3002a829-5539-413f-8145-f53522016021","resolution":{"observed_at":"2026-08-07T05:43:46.871877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:41.682613Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.682613Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:3402512beadcc09e465d59fa23eec4a0c567716e622ed16202dfc75c76de4f7b","observation_id":"719807d8-f564-4bf8-84ec-85ffd002dfec","resolution":{"observed_at":"2026-08-07T05:43:41.682613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T05:43:41.824761Z","title":"MM-EUREKA: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.824761Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:4993120c24b6ee129c2471c2ca7dc953f750b3260103fafcfc4b4be877cd9208","observation_id":"7c71a775-0782-4af8-98a8-9bb109f52d3c","resolution":{"observed_at":"2026-08-07T05:43:41.824761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:46.501102Z","title":"Introducing GPT-4.1","venue":null,"work_id":"742ea241-1b18-4915-baca-1945f7f855b0","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.007117Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:eea24a2cc2c1ab41705c6d9977e1f32961393dd00d35cda12599ca1400c80ae2","observation_id":"5588a6fb-1bff-444c-affa-7cb2e6634c9a","resolution":{"observed_at":"2026-08-07T05:43:46.605726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:46.173756Z","title":"Introducing o3 and o4-mini: Our smartest models yet","venue":null,"work_id":"62c8b5f5-33dc-4f23-bd2f-20cde3c26b22","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.126854Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:9860ba0ab542a238a5e5c6b2004fac9475b8243852dac2f70dfe8f6239cc7384","observation_id":"e6db3cb7-00f5-467c-a8e7-ea121436aac4","resolution":{"observed_at":"2026-08-07T05:43:46.340798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:45.811532Z","title":"Chatterji, Faisal Ladhak, and Tatsunori Hashimoto","venue":null,"work_id":"554471ca-704f-4b2b-99a8-a9733430aeb6","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.312172Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:9a7e91e3144548cdaf5ccf52abbc3f7d76712936ca066fd3f4924582e6821dd3","observation_id":"b7293655-e8c3-47b1-beba-d9e66f85cc81","resolution":{"observed_at":"2026-08-07T05:43:45.997943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:45.555938Z","title":"Qwen2.5-VL Technical Report","venue":null,"work_id":"71c642b3-6952-4151-9d33-e379c4fccb0a","year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.449448Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:48b5a86dbbd13ca18dec75ac4f3b05f9d68aee715656747d3154d5f69f56e5ec","observation_id":"e33612d5-bdef-4b89-8fd5-1966ba17a24f","resolution":{"observed_at":"2026-08-07T05:43:45.644329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T05:43:42.595992Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.595992Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:7606e479afd0a19fbc97d3ec5465b0df37dc9d7579d4dc6363e5380f2342b255","observation_id":"7fdd844e-eb3c-416b-9c9b-7bf7065b460d","resolution":{"observed_at":"2026-08-07T05:43:42.595992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-08-17T11:15:45.055944Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-07T05:43:42.737932Z","title":"VL- Rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.737932Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:78ba0d46446d9c1f23dfae34d3b4595a9a3dc15a8371546ec0ffebb681c96e8f","observation_id":"5d741959-b5bc-45b1-a7a8-54dbea542666","resolution":{"observed_at":"2026-08-07T05:43:42.737932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:43:42.884189Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.884189Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:3f4a2db53d6137796ce18d0dd2f6a3dcf6f972a18365da9836a0964691753bf3","observation_id":"83b791cf-4563-4bac-b69b-e823938961cd","resolution":{"observed_at":"2026-08-07T05:43:42.884189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T05:43:43.067246Z","title":"InternVideo2.5: Empowering video mllms with long and rich context modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.067246Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:b74c918bc4440df8771a01b3abc0bfdd79133eb4a5ceab33a7e5ea99e4229ca3","observation_id":"fc628e12-ea92-4ca2-8b7b-a2916806fa5f","resolution":{"observed_at":"2026-08-07T05:43:43.067246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:45.294113Z","title":"Realworldqa","venue":null,"work_id":"ce6f73ef-0928-45ac-8ff7-13d54bd00912","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.206948Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:eb127fa3e16882db291472ba56a08a012c69eabfd1fe7f5ac8dd97b3d306584f","observation_id":"49db2cd3-1be6-43e4-9ca3-4059d3f4df2b","resolution":{"observed_at":"2026-08-07T05:43:45.404107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:44.975973Z","title":"Dynamic multimodal evaluation with flexible complexity by vision-language bootstrapping","venue":null,"work_id":"ed76f0df-c3ff-4dc8-9627-6c0b03faef5c","year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.306522Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:426959e1516f492e133429ebdceddb6e8c4099b3b4ddc7845b937c5530564c2a","observation_id":"f5299504-2ffd-4225-86e8-3561e2128509","resolution":{"observed_at":"2026-08-07T05:43:45.090141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-07T05:43:43.489140Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.489140Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:a821f7fe177f6c230703c27e1a7db44254f3af4c35391ee3a6d83a6b3dd40bf3","observation_id":"170e434f-ad70-4ad2-8b5b-37a9c533797f","resolution":{"observed_at":"2026-08-07T05:43:43.489140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T05:43:43.659170Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.659170Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:b90e5d52e3faa9318f6e2853db8e71b545dfb8ee2df5dccecafeb6bf8eb8f1ee","observation_id":"e027e542-f702-40f6-9e38-0c9c8015b887","resolution":{"observed_at":"2026-08-07T05:43:43.659170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:43.761515Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.761515Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:e088e715d3ed136f812937f6c86ee7e2d0254218186ba67c6d88aca2f4183b6e","observation_id":"5879e056-8321-4c4d-9c80-1ed495a4e8ba","resolution":{"observed_at":"2026-08-07T05:43:43.761515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17167","last_updated":"2024-03-14T09:52:16Z","snapshot_observed_at":"2026-08-16T14:56:32.958443Z","submitted_at":"2023-09-29T12:04:14Z","title":"DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17167","snapshot_observed_at":"2026-08-07T05:43:43.859281Z","title":"Dyval: Graph-informed dynamic evaluation of large language models.arXiv preprint arXiv:2309.17167, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.859281Z"},"links":{"cited_paper":"/paper/2309.17167","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:c0ea98422fce2969fab5544a85fadd0fe03870dc6d466eccadd401bfa3e9ed9c","observation_id":"bcc4f788-8ab4-443c-b4bf-217c5acd20de","resolution":{"observed_at":"2026-08-07T05:43:43.859281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:44.593087Z","title":"reasoning MLLMs,","venue":null,"work_id":"7599b829-ebc0-4639-8b43-b19b5a830f57","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:44.008852Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:391b22daff1ed5190d5efa34da35d761dcca21474884cf35a65b38cbeac02b38","observation_id":"678d5dee-677b-490a-9f62-21926e94ddac","resolution":{"observed_at":"2026-08-07T05:43:44.803931Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T02:49:41.412697Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2506.07202."}