{"as_of":"2026-08-14T23:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc18aa8f77abe48f310330c97e014464e1587787229d640fc8254fd3c64de669","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:10:23.293868Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T02:47:38.676727Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:54.937856Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-08-02T19:58:15.166907Z","title":"Mico: Multi-image contrast for reinforcement visual rea- soning.arXiv preprint arXiv:2506.22434, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00461","last_updated":"2026-06-10T06:57:00Z","snapshot_observed_at":"2026-08-12T20:25:39.865322Z","submitted_at":"2026-02-28T04:42:34Z","title":"ReMoT: Reinforcement Learning with Motion Contrast Triplets","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T19:58:15.166907Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2603.00461"},"observation_digest":"sha256:417916eb9b600b98c46c0c1e3ea731094b9f7da362063b540e1d98dbd0a1a608","observation_id":"56bbfb6a-5856-4629-9ef6-5dd15c4e0698","resolution":{"observed_at":"2026-08-02T19:58:15.166907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2506.22434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-07-04T15:09:54.937856Z","title":"Mico: Multi-image contrast for reinforcement visual reasoning.arXiv preprint arXiv:2506.22434, 2025","venue":null,"work_id":"67ac2a49-64e8-4ed2-85b3-2c0a3a512a6d","year":2025},"citing_paper":{"arxiv_id":"2604.22498","last_updated":"2026-04-24T12:26:49Z","snapshot_observed_at":"2026-08-11T13:39:31.014053Z","submitted_at":"2026-04-24T12:26:49Z","title":"CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T12:26:01.568507Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2604.22498"},"observation_digest":"sha256:74e3cf47e91f77c607ef0cf63bc3e8bbd02eba7c2492956f56081f3cfb6d2747","observation_id":"eac79354-ed08-4554-9934-83e1f5b37637","resolution":{"observed_at":"2026-05-11T19:16:08.367742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2506.22434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-07-04T15:09:54.937856Z","title":"Mico: Multi-image contrast for reinforcement visual reasoning.arXiv preprint arXiv:2506.22434, 2025","venue":null,"work_id":"67ac2a49-64e8-4ed2-85b3-2c0a3a512a6d","year":2025},"citing_paper":{"arxiv_id":"2606.21337","last_updated":"2026-07-31T19:36:30Z","snapshot_observed_at":"2026-08-14T05:51:38.916526Z","submitted_at":"2026-06-19T11:31:43Z","title":"DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T14:24:19.702588Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2606.21337"},"observation_digest":"sha256:e3e8bc92382f814987a97b160f8bb617b81b47daed28bf1e71242a5270555117","observation_id":"4ec5dc58-95fe-426b-8a51-454a61ac8dc6","resolution":{"observed_at":"2026-07-04T06:29:37.943816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-08-04T02:47:38.676727Z","title":"Mico: Multi-image contrast for reinforcement visual reasoning.arXiv preprint arXiv:2506.22434, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21337","last_updated":"2026-07-31T19:36:30Z","snapshot_observed_at":"2026-08-14T05:51:38.916526Z","submitted_at":"2026-06-19T11:31:43Z","title":"DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:38.676727Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2606.21337"},"observation_digest":"sha256:df2f19e1a130441ccecdb99109211cf7588064006ed163024ea76efb9635ea18","observation_id":"ef3e5ca9-6892-4534-8b80-e6d8b0a38be8","resolution":{"observed_at":"2026-08-04T02:47:38.676727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2506.22434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-07-04T15:09:54.937856Z","title":"Mico: Multi-image contrast for reinforcement visual reasoning.arXiv preprint arXiv:2506.22434, 2025","venue":null,"work_id":"67ac2a49-64e8-4ed2-85b3-2c0a3a512a6d","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-08-13T03:40:06.714401Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":193,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:7b393729dad7ca6fb89f4ca2750d5a84979c2b0f2fb3e0ba3b075c5ccbaf52c6","observation_id":"d0a7c20a-8dbe-416a-9703-83022d97f974","resolution":{"observed_at":"2026-07-04T15:09:54.939662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2506.22434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-07-04T15:09:54.937856Z","title":"Mico: Multi-image contrast for reinforcement visual reasoning.arXiv preprint arXiv:2506.22434, 2025","venue":null,"work_id":"67ac2a49-64e8-4ed2-85b3-2c0a3a512a6d","year":2025},"citing_paper":{"arxiv_id":"2606.28266","last_updated":"2026-06-26T16:57:40Z","snapshot_observed_at":"2026-08-12T16:54:45.166709Z","submitted_at":"2026-06-26T16:57:40Z","title":"RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T04:09:32.397341Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2606.28266"},"observation_digest":"sha256:0d8c95f8afc90b06e881f3ea912ecd64d151414c71f85483f845008717d56e69","observation_id":"5d3575bf-4f7f-445a-a8df-ca754d0c73fa","resolution":{"observed_at":"2026-07-01T17:05:51.451562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-07-31T21:55:17.360790Z","title":"arXiv preprint arXiv:2506.22434 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27967","last_updated":"2026-07-30T10:14:24Z","snapshot_observed_at":"2026-08-05T12:14:09.489312Z","submitted_at":"2026-07-30T10:14:24Z","title":"MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-31T21:55:17.360790Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2607.27967"},"observation_digest":"sha256:25c5f582c2f613bc0557712b2804110caf46cfe6c3487d6301a65c3f36b114e8","observation_id":"7c81efc5-ace3-4125-b140-de5c81811780","resolution":{"observed_at":"2026-07-31T21:55:17.360790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22434/citation-record","integrity":"/paper/2506.22434/integrity","json":"/paper/2506.22434/citation-record.json","paper":"/paper/2506.22434"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:10:19.661051Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:19.661051Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:41f8b1c936cb4719c8b53f99865440debddb57169e6787796c7fa0c9441f1c5e","observation_id":"a8b68a97-0e72-4a9c-9ad8-c454e6497c4d","resolution":{"observed_at":"2026-08-06T22:10:19.661051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T22:10:19.714681Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:19.714681Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:49356b1a9bf47712e8c05cf249cad26ac36e043f72c2daf0bbc7db25dafee6fd","observation_id":"b4c6f8d8-18de-4fd4-b427-3fca9ac4deae","resolution":{"observed_at":"2026-08-06T22:10:19.714681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:28.631164Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"df73c545-a318-482a-be9a-519398e3a245","year":2021},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:19.841634Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:f17343e8fd6b82087766d65137819f9fb5faac5d2a0ca4b68ca1d63c64ccfca8","observation_id":"6e0fbd76-dce3-4de0-8570-97c3b8910b53","resolution":{"observed_at":"2026-08-06T22:10:28.722552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T22:10:19.944658Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.arXiv:2504.11468,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:19.944658Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:6ae04d33905e556667b393ab02f508afd3271e4fe60d5b98fce8b444e0c66e88","observation_id":"24113702-aa5e-43d8-9559-237ebc7b9ba6","resolution":{"observed_at":"2026-08-06T22:10:19.944658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:28.290080Z","title":null,"venue":null,"work_id":"e4932ee7-9a97-4051-9fe7-62e5a0f11591","year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.024347Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:da502f3989d7ba7706b965d8798de59aab42384f2820094d81349750a6d5632b","observation_id":"295ed156-2397-45a4-8b99-322dc2aef68e","resolution":{"observed_at":"2026-08-06T22:10:28.465181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:27.963573Z","title":"Are we on the right way for evaluating large vision-language models?NeurIPS,","venue":null,"work_id":"36fecf94-e426-4cd5-ba31-018b7317ad1c","year":null},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.104973Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:10038056d52b6e7b0febe96d2c307dfbe8f7b65cca4f509660ce7b4c98094711","observation_id":"febea6a5-eb8a-4871-b738-a26a0ff716d5","resolution":{"observed_at":"2026-08-06T22:10:28.130827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:27.628856Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"944e588a-4036-49d7-9533-0912782b0715","year":2020},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.165768Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:382ad56f9a5477c50361636ae6485be2fec5c153afc93bcf7a348a32ed15e167","observation_id":"1ee3d4c4-9c61-42d0-b067-2fad28420e2d","resolution":{"observed_at":"2026-08-06T22:10:27.798641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:27.390021Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"019d6764-dcc3-4c80-bae2-f42d8e3b6c77","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.214041Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:c5eb22f822ef9acb529ef3002b2f0c74ccb865c9c69736eb7cc1628811ccee33","observation_id":"efe40d4f-71f4-48da-bbb3-9fe78dd576c5","resolution":{"observed_at":"2026-08-06T22:10:27.481876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:27.115564Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"f78e4903-af28-4a06-9f81-d3a57c01f2c9","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.240390Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:637a6da63708fadc1c9e8dd454fc9fd8009fb5a07294567442bb0d0ba54e89a5","observation_id":"35e6b1cf-aba6-497f-a8ab-26cd02e18cad","resolution":{"observed_at":"2026-08-06T22:10:27.260370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:26.826825Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":"b29063da-38cf-4763-9002-73a0a7dd6a9e","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.266790Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:342ae3b99f18669bfa7b41eb7bd668ce3e06509816f63f28944abc754fa34c7c","observation_id":"f806f609-79e3-4de7-9241-2314288d1859","resolution":{"observed_at":"2026-08-06T22:10:26.991239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:26.488317Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":"b3ee0f2e-c32f-4035-bb02-f0b66968878c","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.284666Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:ef7b760ee7219297489ba8c5b1619de48e11a428081559ae3cd07f02f1acde18","observation_id":"df7af8c2-2dd1-4a87-9d21-0f599b0a5c6a","resolution":{"observed_at":"2026-08-06T22:10:26.661498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:10:20.303571Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.303571Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:eaa16ca718b53d3bc887c8671754bd9f40712c15cdfda40f93431c4fcd86aa4c","observation_id":"6ab5d93a-f684-4a9e-b584-7c5e5b073eec","resolution":{"observed_at":"2026-08-06T22:10:20.303571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:26.161237Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"12f6af9d-a268-4fe4-9078-f56a2d24f918","year":2022},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.347365Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:6a5ddf394ba05f64808e0cc6ac315b2d7080b467f0ab51e492f5acc7e7a8ee99","observation_id":"3ad90e29-c3eb-4a72-b5e7-8228ec987354","resolution":{"observed_at":"2026-08-06T22:10:26.308149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.826785Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":"e8e27e3e-b5a7-4627-9eb6-d94f8a7c0613","year":2020},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.380458Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:de2732c418934d1822e3f09ffb7a4c0cfd0de8f86b557b8207a94e5c31c987e7","observation_id":"a1702eba-3960-450d-8ef9-9564231be04d","resolution":{"observed_at":"2026-08-06T22:10:26.002413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T22:10:20.418100Z","title":"Gpt-4o system card.arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.418100Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:40d9025b97beb66a1b1c0c71c78c279bb0574a62e98691c6794eda9c90269bdf","observation_id":"30c8b7a1-2087-4abf-9a58-30f83bf48927","resolution":{"observed_at":"2026-08-06T22:10:20.418100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T22:10:20.487532Z","title":"Openai o1 system card.arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.487532Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:85d360b8b810681c05590dd36fa6d91405fe9a4c8e4cc2d4964bec8912eb07c8","observation_id":"3e64c7b2-2243-4638-a3ce-b61883e05687","resolution":{"observed_at":"2026-08-06T22:10:20.487532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.645412Z","title":"Llava-onevision: Easy visual task transfer.TMLR, 2025","venue":null,"work_id":"176d08e7-045b-4ccd-b244-5fdc87fbbed4","year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.636213Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:57099e5cab6e703cdfec97efc6f99cff59987777652c844b317c8b984876945f","observation_id":"cff9c650-f687-4f86-9f3d-cdb099491a55","resolution":{"observed_at":"2026-08-06T22:10:25.699586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T22:10:20.772845Z","title":"Llava- next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.772845Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:fff745463b79f44da856b562e1b87915fef460f5be30d5ff9386a7ea031e7683","observation_id":"491e6990-29ec-4934-a82d-bdedd27f0979","resolution":{"observed_at":"2026-08-06T22:10:20.772845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.490205Z","title":"Visual instruction tuning","venue":null,"work_id":"5a7baed1-5ab6-4c89-8865-46769f8c9ca3","year":2023},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.889944Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:338eb0ad892ee0af24c62bc9c7791f11e59f89e2b60cf4e87d219c17c47a6e37","observation_id":"694b5750-16b2-49ab-b776-38b59ea66a5d","resolution":{"observed_at":"2026-08-06T22:10:25.567251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:20.936461Z","title":"Noisyrollout: Reinforcing visual reasoning with data augmentation.arXiv:2504.13055, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.936461Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:cc60c97016ae33802c1f8cb9e24fe78adf59d0641b630f0f172ac2c8defb8137","observation_id":"dd08eda1-bfeb-49df-bcf4-1b3c9cfd4720","resolution":{"observed_at":"2026-08-06T22:10:20.936461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.386618Z","title":"Mmdu: A multi-turn multi-image dialog understanding benchmark and instruction-tuning dataset for lvlms","venue":null,"work_id":"e9170952-bc7f-4e7b-824b-f936c64adf26","year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.990374Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:e11e6e7336e198e29c354a42b5c8faf133418e8645ebe7aa655d6d611cc052e4","observation_id":"0d8b729d-bc4d-4c58-800b-669a16e0a869","resolution":{"observed_at":"2026-08-06T22:10:25.436256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.237918Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"ac2aa6a0-6992-4a0c-b876-eb0f3310d3e0","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.089298Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:cfcc162bf1dfc2e9fab7e5c3a295c1bf3ad9f6df391370221b6b04b561cef884","observation_id":"6def041d-365c-42d8-a439-367f88f6ffc7","resolution":{"observed_at":"2026-08-06T22:10:25.298666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T22:10:21.182215Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning.arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.182215Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:b6b6c8f86ef23133260eb6a50abb36125d6dbd73be61de8800b60b20a879d99f","observation_id":"c2810585-c011-4c7d-8ccb-bc2427e70979","resolution":{"observed_at":"2026-08-06T22:10:21.182215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.109310Z","title":"Mmiu: Multimodal multi-image understanding for evaluating large vision- language models","venue":null,"work_id":"dfb044d0-0fae-4016-9a66-eec52fd012dd","year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.303114Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:695158345b87b246ac7241a9d68c062554823df18ff42bea60f3594612b8779b","observation_id":"508e4ff3-66f7-41f2-a4d8-e6703505eadd","resolution":{"observed_at":"2026-08-06T22:10:25.162989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-13T02:20:42.980627Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-06T22:10:21.421604Z","title":"Skywork r1v: Pioneering multimodal reasoning with chain-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.421604Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:358d6a2a2756a1307e9c7cb92cf8a3e6d9a08ccd5d4f87e07ede3b2c7729ac9d","observation_id":"41ca8a4b-5b82-4ff3-a3b4-f32a305a2bd7","resolution":{"observed_at":"2026-08-06T22:10:21.421604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-06T22:10:21.546619Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl.arXiv:2503.07536, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.546619Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:5577b89ba4e9bc4a7608bdb064a5a8a67663f80a069512d3c6ef3faad9857df9","observation_id":"1f566777-8f5c-4265-890a-d60523701d0c","resolution":{"observed_at":"2026-08-06T22:10:21.546619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:21.645213Z","title":"Seed-thinking-v1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.645213Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:6cd92ed0acf4d6b296341d27c59f805400334e30d144bd41476f7e499f6a9b49","observation_id":"74b28711-97ec-463d-9e80-aa6dcca57847","resolution":{"observed_at":"2026-08-06T22:10:21.645213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T22:10:21.712099Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.712099Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:35a7416a1fb6c98e45535121cbdcf1d0c9a905837bd99862bfc1fcf06e60b526","observation_id":"429e076a-6e03-4d5e-b0b4-22dd59d2653b","resolution":{"observed_at":"2026-08-06T22:10:21.712099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:21.814227Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv:2503.20752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.814227Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:dd0c618c9c4e2fc3d7fba08aa0a383f4e8b89d8a4ab192f5a48b7b7116734e56","observation_id":"82cc9a97-fd6c-4e9d-84df-525ab92e2c2c","resolution":{"observed_at":"2026-08-06T22:10:21.814227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-13T15:06:39.861200Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-08-06T22:10:21.932155Z","title":"Vidgen-1m: A large-scale dataset for text-to-video generation.arXiv:2408.02629, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.932155Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:ecf42560e31d0707416886aeb689824d0cd883ebef79fb76b578ca09cfa5635b","observation_id":"f858776c-a47b-478c-b409-976b86053609","resolution":{"observed_at":"2026-08-06T22:10:21.932155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T22:10:22.028060Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.028060Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:73b0124f3931f1ac87318b29e010b6b5db7ff41041654f4cda1b4ec7b60524cc","observation_id":"b5ccabef-a66a-42c6-a438-ff63745e2410","resolution":{"observed_at":"2026-08-06T22:10:22.028060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.971768Z","title":"Muirbench: A comprehensive benchmark for robust multi-image understanding","venue":null,"work_id":"33959bc7-85b1-4b63-a05b-c22ae4f437d8","year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.089405Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:5661d0436be62a29d66fddc44421640d1cdd5ea127c7f450cbfa851e6fbf9fef","observation_id":"7d9b5079-b267-42ad-8466-aa1573e257a6","resolution":{"observed_at":"2026-08-06T22:10:25.033961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T22:10:22.153445Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.153445Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:87302cbb2ee7e8e2ce86b050bc5ec69fff1871d894a03d49aa7449f953923a15","observation_id":"65027c1c-7b21-48d4-9e46-8f1b6da2f3e1","resolution":{"observed_at":"2026-08-06T22:10:22.153445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-12T13:11:38.446061Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-06T22:10:22.226382Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement.arXiv:2504.07934, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.226382Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:7c5ca2bd616c02c72adc9e5726a79964dee892190b18706b015e75965d862c3f","observation_id":"fa107860-b77c-457c-bd26-239bb6829ccf","resolution":{"observed_at":"2026-08-06T22:10:22.226382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.853613Z","title":"Omniedit: Building image editing generalist models through specialist supervision","venue":null,"work_id":"a66fff19-8fb1-463a-95d1-cb53ac990045","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.310213Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:adc505484df9b47a3a55fbccde270c31ab5921372319398719e107330666451a","observation_id":"89425d77-f32b-436d-8a79-d4d75a0b76e4","resolution":{"observed_at":"2026-08-06T22:10:24.899197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.747040Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"c7c003e9-f494-4a1f-9fcf-8291bc013ccd","year":2022},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.379211Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:d66f34c41a8f931ffe283114dc6b6ec868e246e3df6e7e9417146029f7d49055","observation_id":"aa15e761-d7e7-4dfb-bd56-d4c133797abc","resolution":{"observed_at":"2026-08-06T22:10:24.792525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.614411Z","title":"Towards open-ended visual quality comparison","venue":null,"work_id":"ac0c070b-ba36-433f-8e2d-2f28fde4fa7d","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.476519Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:6de88154210ec08b8f47ae87e6a94711093678e2ef8070577540495b2c294f20","observation_id":"f311559c-40f0-497b-bd9e-f8c5f4fb16d1","resolution":{"observed_at":"2026-08-06T22:10:24.690395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.512260Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"5d9407f7-530b-4b95-8759-44997e1c8bcf","year":null},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.548940Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:54dc9610446319cf5ccc5386973b8a91187e4b49a1024d4a449c53d3a98846f7","observation_id":"7a41f29b-b701-4235-b643-88ca56801731","resolution":{"observed_at":"2026-08-06T22:10:24.556572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.393359Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"c2d81398-28d9-410e-ae9e-fc3c4a869ccd","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.635408Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:35fb1e9e66e50f808da99a40ff724426e5372f11024a78d6221ac2dbf16488bb","observation_id":"90f9bd71-b043-4599-ace4-89f419051ef8","resolution":{"observed_at":"2026-08-06T22:10:24.453840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12084","last_updated":"2025-07-02T07:38:09Z","snapshot_observed_at":"2026-08-07T18:11:33.173051Z","submitted_at":"2025-02-17T17:57:50Z","title":"VLM2-Bench: A Closer Look at How Well VLMs Implicitly Link Explicit Matching Visual Cues","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12084","snapshot_observed_at":"2026-08-06T22:10:22.722405Z","title":"Vlm2-bench: A closer look at how well vlms implicitly link explicit matching visual cues.arXiv:2502.12084, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.722405Z"},"links":{"cited_paper":"/paper/2502.12084","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:a09c66d2c5ab4064d4ee24b5863507f96c222f0ff7ca61d08a5c0f399227e35f","observation_id":"0e367bb4-2cbc-4d97-ac8b-e3719455b251","resolution":{"observed_at":"2026-08-06T22:10:22.722405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20199","last_updated":"2025-04-28T19:02:18Z","snapshot_observed_at":"2026-08-12T08:14:45.726760Z","submitted_at":"2025-04-28T19:02:18Z","title":"Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains","version":1},"cited_work":{"arxiv_id":"2504.20199","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20199","snapshot_observed_at":"2026-08-06T22:10:23.511066Z","title":"Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains","venue":"cs.CV","work_id":"2c424537-9c38-47ff-9334-0343e8596568","year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.804765Z"},"links":{"cited_paper":"/paper/2504.20199","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:49a249615783fedd141cf5f0a1b6b338ce37d3f658608e309a5a2ebdaa0d5fd7","observation_id":"1ed0821a-b305-4cb4-a1fe-aa014113d41e","resolution":{"observed_at":"2026-08-06T22:10:23.589277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T22:10:22.903154Z","title":"Long context transfer from language to vision.arXiv:2406.16852,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.903154Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:24760536250e2075d86e734c1552a4f33b26ea6bcbd7dcce726e0e83cba4de19","observation_id":"ac77033f-768b-4197-b7c0-04d0923444c2","resolution":{"observed_at":"2026-08-06T22:10:22.903154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T22:10:22.971564Z","title":"Video instruction tuning with synthetic data.arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.971564Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:6b50049b3b9c77c9e3eb989882a1cc9e1b4434a62ac6e581474184e6ac0583e8","observation_id":"d6e43932-032a-497b-a74f-48c42b77f00f","resolution":{"observed_at":"2026-08-06T22:10:22.971564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12742","last_updated":"2024-06-18T16:02:18Z","snapshot_observed_at":"2026-08-12T23:39:56.903028Z","submitted_at":"2024-06-18T16:02:18Z","title":"Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12742","snapshot_observed_at":"2026-08-06T22:10:23.068331Z","title":"Benchmarking multi-image understanding in vision and language models: Perception, knowledge, reasoning, and multi-hop reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.068331Z"},"links":{"cited_paper":"/paper/2406.12742","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:a47d12ba082c36361dce154e9f405995cd2584d97a5e4a47039650be595d53a7","observation_id":"8ba2266b-47ea-4432-87f9-5ebfd913950d","resolution":{"observed_at":"2026-08-06T22:10:23.068331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.220455Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale","venue":null,"work_id":"891ffbaa-274b-4b88-8e42-d2cde93d8a54","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.158141Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:dd74af5b8c95b3d2e93f418594c14e03555d978b454ba5847920e003142e5290","observation_id":"626392d1-1c8c-4849-8999-a0fbb297730b","resolution":{"observed_at":"2026-08-06T22:10:24.301168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04670","last_updated":"2025-07-09T08:04:21Z","snapshot_observed_at":"2026-08-14T03:18:34.834807Z","submitted_at":"2025-01-08T18:30:53Z","title":"Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04670","snapshot_observed_at":"2026-08-06T22:10:23.293868Z","title":"Are image1 and image2 the same?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.293868Z"},"links":{"cited_paper":"/paper/2501.04670","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:3b756c6a568d3dec26e7d54bb590f751b178389e185d557e8a04df3674756835","observation_id":"cab53f23-af9c-4c36-83a5-25d31c6b7cc9","resolution":{"observed_at":"2026-08-06T22:10:23.293868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T20:31:26.413578Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 7 inbound Pith citation observations for arXiv:2506.22434."}