{"as_of":"2026-08-10T02:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:375c2d5e1a7cf2e49874f59bf1780d3e90f7f6f0ca49aebabaea3bef2a463ebf","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:05:20.044416Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:54:43.474266Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T00:12:50.323154Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04280","snapshot_observed_at":"2026-08-04T09:54:43.474266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.12953","last_updated":"2026-08-03T22:42:44Z","snapshot_observed_at":"2026-08-07T23:09:08.076264Z","submitted_at":"2025-10-14T19:57:03Z","title":"Epistemic-aware Vision-Language Foundation Model for Fetal Ultrasound Interpretation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:43.474266Z"},"links":{"cited_paper":"/paper/2506.04280","citing_paper":"/paper/2510.12953"},"observation_digest":"sha256:7bf9be35f941c37b471fd5fa309018d79e60fbd32b5562574155aef7cf87645e","observation_id":"5c6864df-b047-4bee-bf80-fedc21632611","resolution":{"observed_at":"2026-08-04T09:54:43.474266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2506.04280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04280","snapshot_observed_at":"2026-06-29T00:12:50.323154Z","title":"Evaluating mllms with multimodal multi-image reasoning benchmark","venue":null,"work_id":"91488ac0-e55e-404d-b2cd-0e78aa28a2a0","year":2025},"citing_paper":{"arxiv_id":"2604.00799","last_updated":"2026-04-02T21:20:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-01T12:06:54Z","title":"Multimodal Language Models Cannot Spot Spatial Inconsistencies","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-13T23:12:27.333405Z"},"links":{"cited_paper":"/paper/2506.04280","citing_paper":"/paper/2604.00799"},"observation_digest":"sha256:ec8e25dd1e636a713d0a14ebfe869011417431ce8382b7c6cd84f2382e43cb0b","observation_id":"d334f9d5-9cff-48f6-91d2-3fba26525cc2","resolution":{"observed_at":"2026-05-13T23:13:24.779717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2506.04280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04280","snapshot_observed_at":"2026-06-29T00:12:50.323154Z","title":"Evaluating mllms with multimodal multi-image reasoning benchmark","venue":null,"work_id":"91488ac0-e55e-404d-b2cd-0e78aa28a2a0","year":2025},"citing_paper":{"arxiv_id":"2604.19544","last_updated":"2026-04-21T15:02:50Z","snapshot_observed_at":"2026-07-06T23:06:12.542013Z","submitted_at":"2026-04-21T15:02:50Z","title":"DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T01:45:30.001398Z"},"links":{"cited_paper":"/paper/2506.04280","citing_paper":"/paper/2604.19544"},"observation_digest":"sha256:0daee06e44e8d3194b114de9c5aaaa2b65f7b9f28336705dac32dea2044a0e0a","observation_id":"92fa0042-066d-4efb-aa58-7d57f2915315","resolution":{"observed_at":"2026-05-11T13:26:03.830119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2506.04280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04280","snapshot_observed_at":"2026-06-29T00:12:50.323154Z","title":"Evaluating mllms with multimodal multi-image reasoning benchmark","venue":null,"work_id":"91488ac0-e55e-404d-b2cd-0e78aa28a2a0","year":2025},"citing_paper":{"arxiv_id":"2604.20806","last_updated":"2026-04-22T17:37:40Z","snapshot_observed_at":"2026-08-02T21:32:46.195325Z","submitted_at":"2026-04-22T17:37:40Z","title":"OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T00:40:47.562861Z"},"links":{"cited_paper":"/paper/2506.04280","citing_paper":"/paper/2604.20806"},"observation_digest":"sha256:5c410d8300088c70b82ad9fdad78e28df37bc5c802319d2c841afc4ccb30299f","observation_id":"8425e803-0d62-4c85-bd60-4fbd56364dac","resolution":{"observed_at":"2026-05-11T13:46:02.750336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2506.04280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04280","snapshot_observed_at":"2026-06-29T00:12:50.323154Z","title":"Evaluating mllms with multimodal multi-image reasoning benchmark","venue":null,"work_id":"91488ac0-e55e-404d-b2cd-0e78aa28a2a0","year":2025},"citing_paper":{"arxiv_id":"2606.00148","last_updated":"2026-05-29T03:20:05Z","snapshot_observed_at":"2026-07-06T23:40:51.363776Z","submitted_at":"2026-05-29T03:20:05Z","title":"StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T23:15:56.598968Z"},"links":{"cited_paper":"/paper/2506.04280","citing_paper":"/paper/2606.00148"},"observation_digest":"sha256:dae4e7eb536abe8d5b1e2bbb3682fef8aa1a22ca23dce394219dbfefd7c06677","observation_id":"a1c2534f-54a4-4485-8371-831cfd49b2d7","resolution":{"observed_at":"2026-06-29T00:12:50.324575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04280/citation-record","integrity":"/paper/2506.04280/integrity","json":"/paper/2506.04280/citation-record.json","paper":"/paper/2506.04280"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.093166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.093166Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:a21851e3705f6e362095392b7dc78dbe6a9b1014460f335b3f4f48e88e7ae793","observation_id":"5391bfd9-4e4c-4283-b50a-84b1f44de3e1","resolution":{"observed_at":"2026-08-07T11:05:19.093166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:05:19.125992Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.125992Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:f0c567a7b8023f2d462c11d37e9f7b4f6d0dc538be92f16f1b56dcda551ca6a7","observation_id":"c72cb348-886c-46ff-9438-363f60a1b434","resolution":{"observed_at":"2026-08-07T11:05:19.125992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:05:19.149385Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.149385Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:e60e3568da8e798be9405e1941d4760620040d192d53df1cf56814c4bedb76fd","observation_id":"c92bdff2-402b-46bf-92af-c5ffe95e425b","resolution":{"observed_at":"2026-08-07T11:05:19.149385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.168229Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.168229Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:c5fc7f93d3434699e2780a960e12208bf7d152f84824d851f8df29501d7c19d4","observation_id":"c657ea92-7c09-48a2-9414-40d49c3df2a0","resolution":{"observed_at":"2026-08-07T11:05:19.168229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:05:19.206037Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.206037Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:6fac503449c6844151363b127df2f489574d62f303e3094ff61fb7dcaf78ccca","observation_id":"449cf1fb-3f45-442d-9e5a-69ee1fe9b17a","resolution":{"observed_at":"2026-08-07T11:05:19.206037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:23.285840Z","title":null,"venue":null,"work_id":"43c4ff08-43c2-4ebc-8ba4-1e0ef8f0ade4","year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.221144Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:0e7f5353a021b1f0e1349c74d4f281261b03fd4732ba07dcf52aea97fd5d9713","observation_id":"b2332d1c-679a-49e9-9264-e55557eb3bbf","resolution":{"observed_at":"2026-08-07T11:05:23.314570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.232426Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.232426Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:b334989f6eef6fffcc12b4cf9f51c14b134a8686ddca8bd08375e6a37ef863c0","observation_id":"aee44f84-b50e-4f52-8e75-f1d730020eeb","resolution":{"observed_at":"2026-08-07T11:05:19.232426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.246975Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.246975Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:5fe5732816c611957e0870241f103ec01fbfe2384a8649cd08cf8f5bb59b06b1","observation_id":"4f0b9bfc-e67f-4693-b269-3faff3a84983","resolution":{"observed_at":"2026-08-07T11:05:19.246975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.06364","last_updated":"2018-09-17T17:59:13Z","snapshot_observed_at":"2026-08-02T01:51:56.235582Z","submitted_at":"2018-09-17T17:59:13Z","title":"Generalizing Across Multi-Objective Reward Functions in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1809.06364","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.06364","snapshot_observed_at":"2026-08-07T11:05:21.649291Z","title":"Generalizing Across Multi-Objective Reward Functions in Deep Reinforcement Learning","venue":"cs.LG","work_id":"c3e70b02-72e3-40cd-bd5c-7bfb83fb5b33","year":2018},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.279701Z"},"links":{"cited_paper":"/paper/1809.06364","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:c251df5c3cc9b9eeb6b1e86f67760178dcbc64b108c57b7a082e8d1be9aecb44","observation_id":"3769c6c6-8602-491c-8a98-64c15c0dde53","resolution":{"observed_at":"2026-08-07T11:05:21.666096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.286471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.286471Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:f684affd9aaea1b9ce411872a06ec267d348446c149ad3e1bf4e54718e350720","observation_id":"b83ffd3f-dd39-4fec-9365-ec175c24b1c8","resolution":{"observed_at":"2026-08-07T11:05:19.286471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06606","last_updated":"2025-04-09T06:09:40Z","snapshot_observed_at":"2026-08-07T16:07:18.452869Z","submitted_at":"2025-04-09T06:09:40Z","title":"Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06606","snapshot_observed_at":"2026-08-07T11:05:19.291846Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.291846Z"},"links":{"cited_paper":"/paper/2504.06606","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:862e9666915f06eba336c15727f0af6595eab4114d0440f1370bf93c0f3371a7","observation_id":"87f573ed-96f7-49dc-b444-396ddc047ac6","resolution":{"observed_at":"2026-08-07T11:05:19.291846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:23.058761Z","title":null,"venue":null,"work_id":"1ed54350-229d-4247-b9ff-21a3cc143bf7","year":2009},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.302473Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:a735258ef8c314fccf2b6a50fdab1cf501e6ab8a9ee609842679f049b07f9c98","observation_id":"2a463a9b-c158-4504-b449-7030e94417d5","resolution":{"observed_at":"2026-08-07T11:05:23.067313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T11:05:19.318506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.318506Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:1049ef4a01f5abd17b9673f75d7e11aa135bc7ab8e811b89ac46f41632761aa9","observation_id":"b7a365eb-80de-45f2-8806-193219db6b68","resolution":{"observed_at":"2026-08-07T11:05:19.318506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-07T11:05:19.352234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.352234Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:185487e9a4c21eab7661d74092d15ff1bf03ed573192237ab38d8a36177cfffa","observation_id":"3783139e-c5f8-4251-832e-b1894c57c50b","resolution":{"observed_at":"2026-08-07T11:05:19.352234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-09T00:23:29.329507Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T11:05:19.357259Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.357259Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:c282bc481d5144ae34ab2915b9fd89d70d4735f9e098f031c681ef162e35c3a0","observation_id":"110bcaec-d601-4d7f-807d-775cf6756cf5","resolution":{"observed_at":"2026-08-07T11:05:19.357259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:23.028218Z","title":null,"venue":null,"work_id":"a5ef7591-4808-4350-b1b6-dec80f94cbcc","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.373052Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:0a62eb0ba6e2bf89bacb785aba793cbe69ae92ea2ba92670e642cfde569e3efc","observation_id":"7a7f698c-e082-4f45-9278-6ee28fb1844e","resolution":{"observed_at":"2026-08-07T11:05:23.033572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T11:05:19.396582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.396582Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:a4f97a28542387fa97b96d1a3fb59ba0a1cff139ca3c50b0d1f32d52a1c6c2b0","observation_id":"b7622b24-9377-4fb8-bc24-f16a898b13f7","resolution":{"observed_at":"2026-08-07T11:05:19.396582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04152","last_updated":"2024-05-25T14:56:21Z","snapshot_observed_at":"2026-08-07T11:39:49.685292Z","submitted_at":"2023-08-08T09:32:43Z","title":"Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04152","snapshot_observed_at":"2026-08-07T11:05:19.405502Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.405502Z"},"links":{"cited_paper":"/paper/2308.04152","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:42dd43e6c3372190e8622d31243a631e9cc53f091f4771531b3801605b6b16ff","observation_id":"e7821c05-6750-4e3b-91b5-d3fde00a313e","resolution":{"observed_at":"2026-08-07T11:05:19.405502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.423016Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.423016Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:88429520daac26f78a9fb05802020042e8dc25c532fc189f7ba9efbf6c2c8322","observation_id":"e2f30b36-44ac-44b6-a637-bb39ff2dd03a","resolution":{"observed_at":"2026-08-07T11:05:19.423016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.980695Z","title":null,"venue":null,"work_id":"a1f37d49-3dca-4417-808d-f4efb1691f04","year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.386373Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:d96343aa70ee3256bc556107d8a28b6f489ab36df36e1138298c1c416107fa5e","observation_id":"d1523ac9-2457-485e-81b5-2463cdc7d8fe","resolution":{"observed_at":"2026-08-07T11:05:22.986394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.875426Z","title":null,"venue":null,"work_id":"00a47e11-4f9c-4867-bcb4-4e7633467810","year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.445145Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:8ae5f158730d34aae8f9c4971b5e2bbf0f9bc6d3cb0a38d6f35add1f4798ef15","observation_id":"813a2978-95cb-40c9-b6a3-adacfaeb7e29","resolution":{"observed_at":"2026-08-07T11:05:22.889599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T11:05:19.462282Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.462282Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:8e36f6cc89512ebe516d6d3f8de930c0bc4085b5b752181e720db74d6c159d57","observation_id":"55e9a714-8997-4266-9b20-f54251a95a86","resolution":{"observed_at":"2026-08-07T11:05:19.462282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02718","last_updated":"2024-08-05T17:56:41Z","snapshot_observed_at":"2026-07-06T18:57:09.545013Z","submitted_at":"2024-08-05T17:56:41Z","title":"MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02718","snapshot_observed_at":"2026-08-07T11:05:19.472918Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.472918Z"},"links":{"cited_paper":"/paper/2408.02718","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:b7e9c0cfcbc987238ba1417362a6252352a81d727050f2964ba5f1d22a614cfd","observation_id":"57dc166e-b0ca-4809-8d63-1189cd44c09b","resolution":{"observed_at":"2026-08-07T11:05:19.472918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.913147Z","title":null,"venue":null,"work_id":"8e8b88dc-e60c-4419-9014-314961614370","year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.432019Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:b5f4a50354d5723d3455c23b993803f4608bb4473558cfcc1fee7f264483cbe3","observation_id":"934bdc89-a9a3-4304-b26a-b210f382595f","resolution":{"observed_at":"2026-08-07T11:05:22.927157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.791730Z","title":null,"venue":null,"work_id":"a924e94f-f300-4326-8527-a000944dd8b0","year":2022},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.491198Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:f9f2d8e956481e05eca511add1343f634dd862b3e1fed1178dd847eac02387b2","observation_id":"383301d0-48b3-47a5-a9fa-aff5a789d17f","resolution":{"observed_at":"2026-08-07T11:05:22.810498Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.499218Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.499218Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:4535c92d2b664c534fae04ad002863e089a77d8143921b61d28b1d7ba37f903c","observation_id":"28d0fb4b-8fb2-40ad-906b-aae4f0d84da1","resolution":{"observed_at":"2026-08-07T11:05:19.499218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18532","last_updated":"2024-05-15T05:43:30Z","snapshot_observed_at":"2026-08-04T01:28:52.686106Z","submitted_at":"2024-04-29T09:19:05Z","title":"MileBench: Benchmarking MLLMs in Long Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18532","snapshot_observed_at":"2026-08-07T11:05:19.523326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.523326Z"},"links":{"cited_paper":"/paper/2404.18532","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:5918ccfdadb8a4522271cf2cc7b6dd75f1092a5f08ba8ab7b0674de76b82fb01","observation_id":"0d9ba4f4-81b9-478f-84f5-54dd0f3419fd","resolution":{"observed_at":"2026-08-07T11:05:19.523326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.483720Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.483720Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:db0d4f2c3af97d2715e062ea328171170dc39dd694785e9826b07564d27a4a13","observation_id":"7ac23c4c-fbae-43fb-bea4-f92333afc950","resolution":{"observed_at":"2026-08-07T11:05:19.483720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.734152Z","title":null,"venue":null,"work_id":"ea309cbd-5c5a-4bd3-9635-343c8f686d3f","year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.546625Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:e23f689b5fe42e6210e451c5b55950a7b3ddaaf374c9aa3f8f74bfea32ca32af","observation_id":"bed07209-e2ff-4850-9771-6ba94f4008fc","resolution":{"observed_at":"2026-08-07T11:05:22.744082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-07T11:05:19.555184Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.555184Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:fcaebd0d1ef9b20d6288f793238d108c90a427d6c27467c7cbd9e1e1ecf67324","observation_id":"2a7da2ce-8183-4bf8-b05e-358ed8c1ce6e","resolution":{"observed_at":"2026-08-07T11:05:19.555184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-09T15:18:46.301127Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-07T11:05:19.565467Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.565467Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:decab7f9c9d1a6a753a8e733fc67ecde31617ab69fc30bab29f9c2d273f51389","observation_id":"2c0f76dd-9160-4dd7-8fd6-571bc8943ae7","resolution":{"observed_at":"2026-08-07T11:05:19.565467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.580744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.580744Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:be718925d7f48b9fcc69e3cd7a20778603c08ce17727f5bb8a28af8c6118675d","observation_id":"991b90ed-dccd-416d-b568-5e449d05da9f","resolution":{"observed_at":"2026-08-07T11:05:19.580744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10411","last_updated":"2019-09-23T15:10:41Z","snapshot_observed_at":"2026-07-06T08:23:53.657345Z","submitted_at":"2019-09-23T15:10:41Z","title":"NLVR2 Visual Bias Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10411","snapshot_observed_at":"2026-08-07T11:05:19.537088Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.537088Z"},"links":{"cited_paper":"/paper/1909.10411","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:9d6e6a3745ce5c8acab1138077cf0c65cc296b423cec347f3df5d53d46ad5afa","observation_id":"072f0cd2-45ba-4135-88d6-0ead62ec9e8c","resolution":{"observed_at":"2026-08-07T11:05:19.537088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-07T21:25:47.268391Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-07T11:05:19.613480Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.613480Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:edfe16bbf2c0ef5b1304995dc92f2c42e4fe090cd72d92cdaff9e840138a9cb6","observation_id":"6290e526-21b7-4b54-ad8e-4f63cb734c17","resolution":{"observed_at":"2026-08-07T11:05:19.613480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.653398Z","title":null,"venue":null,"work_id":"f1f41708-cbde-48fc-9532-36dd11514932","year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.622195Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:2a9200e058ee838318af73067f9c3e31763371bf53014a13e0f13a52f34c79c7","observation_id":"0c55dbbe-cfdc-41e9-8a47-d5c02a572196","resolution":{"observed_at":"2026-08-07T11:05:22.676752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.643578Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.643578Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:be48c335e269b6fec4f39edc1c1edbf23094d1c463abea0981459e794821e848","observation_id":"4a5f715c-91b1-4750-bea6-34f1d1fa0f3d","resolution":{"observed_at":"2026-08-07T11:05:19.643578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-08-09T09:24:00.370216Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-07T11:05:19.654435Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.654435Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:b0bf499d8c6cda39c75b7ab11b69a66870ab11f1b14fc75c922ce6218a95b046","observation_id":"c7c041f0-6fd7-491e-b307-15c86595814e","resolution":{"observed_at":"2026-08-07T11:05:19.654435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T11:05:19.601376Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.601376Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:7e180679db0e230cdc955f0047860d78d5bd502cee408aa532e13c3e045a678c","observation_id":"daac543d-7b2b-4ab2-a972-1effe3b51c83","resolution":{"observed_at":"2026-08-07T11:05:19.601376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T11:05:19.683399Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.683399Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:8e3438137f520bfcee07b258274faadc58e36f55f6ac4eec0176a0a6316de60d","observation_id":"0921162d-cacd-4676-966b-647ed987a204","resolution":{"observed_at":"2026-08-07T11:05:19.683399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-07T16:00:29.784743Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-08-07T11:05:19.704763Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.704763Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:da397d7d1f39bdd5a5436a87a10162e337d86db3fd3b912c9cb8afd0b6de7dcf","observation_id":"7278bfc9-b506-4303-a6a8-b0c457cedc3d","resolution":{"observed_at":"2026-08-07T11:05:19.704763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T11:05:19.713959Z","title":"Yichang Zhang, Yinger Zhang, Yu Wan, Yuqiong Liu, Zekun Wang, Zeyu Cui, Zhenru Zhang, Zhipeng Zhou, and Zihan Qiu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.713959Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:85281d11ef2a20d1972db2f56ceadfa364890c2a8ac440afb6b71202ed3e30a1","observation_id":"7e2399a7-c682-4cf5-9248-a7ad6c9ad0bf","resolution":{"observed_at":"2026-08-07T11:05:19.713959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14191","last_updated":"2025-02-20T01:48:13Z","snapshot_observed_at":"2026-08-07T18:03:15.507750Z","submitted_at":"2025-02-20T01:48:13Z","title":"Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14191","snapshot_observed_at":"2026-08-07T11:05:19.719944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.719944Z"},"links":{"cited_paper":"/paper/2502.14191","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:bd31cc6a71a753bb38fccc433626e208de002b04f7a8644f89e79dbbd0dbdf62","observation_id":"4f95da42-0fbe-49f0-b7a7-b9d955e24ffa","resolution":{"observed_at":"2026-08-07T11:05:19.719944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-09T22:43:34.534202Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-07T11:05:19.667340Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.667340Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:7db180232557d7f41d262b58ba54be6e2a44448dcd2da9548a268e56f15bb013","observation_id":"406e5081-45d4-448a-93c0-300a95aa87e7","resolution":{"observed_at":"2026-08-07T11:05:19.667340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-06T01:46:05.964793Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-07T11:05:19.748441Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.748441Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:b50b3126fe6c28937ff4e859029e7878acdb50da52eda08facbb7fd800884f5d","observation_id":"869ae997-430e-4c73-89a3-0a3e0ab35c59","resolution":{"observed_at":"2026-08-07T11:05:19.748441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-07T11:05:19.759069Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.759069Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:1a411faf06f8ad0e049d3be270e842fbd07992bc2bb3a47038be397a167a17b9","observation_id":"b207ca52-e644-403c-a340-c47554341d74","resolution":{"observed_at":"2026-08-07T11:05:19.759069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03272","last_updated":"2024-05-06T08:42:34Z","snapshot_observed_at":"2026-07-06T18:10:16.760984Z","submitted_at":"2024-05-06T08:42:34Z","title":"WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03272","snapshot_observed_at":"2026-08-07T11:05:19.768115Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.768115Z"},"links":{"cited_paper":"/paper/2405.03272","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:c2a97e12ce3de46de8b0126ca90dde2c076047fa5d53489a63c758ced6498ddb","observation_id":"04bcbfa7-9314-4b0c-83ac-9331cbf40313","resolution":{"observed_at":"2026-08-07T11:05:19.768115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-07T11:05:19.779262Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.779262Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:f2ea15529c6370807da9f806a54d80f7c8d315ce8fc9c2a1e873c6b9f0ad4283","observation_id":"5c512187-0b0e-4e92-b81e-804a018e0106","resolution":{"observed_at":"2026-08-07T11:05:19.779262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.737053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.737053Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:1846a85e0b53f7f1781582c2d659d2fe64af79161eabe6a9c76e8a7adabbcae7","observation_id":"674a23ef-a859-4fa0-abfb-8c3dd55cf2d9","resolution":{"observed_at":"2026-08-07T11:05:19.737053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14668","last_updated":"2025-02-28T12:57:03Z","snapshot_observed_at":"2026-07-06T19:36:05.879892Z","submitted_at":"2024-10-18T17:57:40Z","title":"MiCEval: Unveiling Multimodal Chain of Thought's Quality via Image Description and Reasoning Steps","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14668","snapshot_observed_at":"2026-08-07T11:05:19.808950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.808950Z"},"links":{"cited_paper":"/paper/2410.14668","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:bdaa2f05be318cbb57c2f871bcf680b0291aa3dbf54ca9524b267edfd5e62093","observation_id":"374273db-e653-4a63-945d-d745994c824d","resolution":{"observed_at":"2026-08-07T11:05:19.808950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:05:19.821194Z","title":"Do not in- clude any explanation. Only output your final answer in the ex- act format: Answer[<letter> or <your_answer_here>]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.821194Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:c6fd987589d813d72f965d92a1178368d77e33c0b1481eeebfedf2264197cfcf","observation_id":"242fbcc3-9161-4688-add2-97f2000fa578","resolution":{"observed_at":"2026-08-07T11:05:19.821194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T11:05:19.790349Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.790349Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:884e55aa91dbca26c89e8220d22e0341f8b303a731c478a2b7e7faf23cf2a347","observation_id":"48a225fb-5b1d-4cf3-8168-4a210622fcce","resolution":{"observed_at":"2026-08-07T11:05:19.790349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.533818Z","title":null,"venue":null,"work_id":"e8940912-82ae-4c66-9cfc-e76d082656bd","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.834814Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:986bbf968eae95a6e05a36aa0b09aeb64ab8b2af11d954bbd07183aaa32683e2","observation_id":"1e7286e3-27d0-49ca-b3d0-4040e9b2d71e","resolution":{"observed_at":"2026-08-07T11:05:22.541576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.495397Z","title":"reasoning step","venue":null,"work_id":"441e3101-dbe6-4ffe-a854-ce838e615e4f","year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.856925Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:6af26e72de5ae8ffdb9f1fb5a28a4720c471dc84d134aef826e63648d2f25b54","observation_id":"9afa9931-c062-408b-a212-7cdd30230c4c","resolution":{"observed_at":"2026-08-07T11:05:22.504739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.298342Z","title":"equally good","venue":null,"work_id":"e157a222-054c-49d2-99c1-d561e68c8028","year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.900673Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:86ed6eee7a5867c56fe12735da302ea1db029d4b222eefd42170d8df8a26319e","observation_id":"c25669a8-8996-44f7-be32-3c9ab4488f32","resolution":{"observed_at":"2026-08-07T11:05:22.311098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.244458Z","title":"equally good","venue":null,"work_id":"77152c00-d164-4da7-b6b7-c9d49465bd45","year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.946132Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:1d88e6cabd88bf842f14ed747ec875f9765574d55eb7c95a1c1543b3bb040dc8","observation_id":"09ab0e9d-67e1-47e7-9269-464b8458d6a1","resolution":{"observed_at":"2026-08-07T11:05:22.259112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.439555Z","title":null,"venue":null,"work_id":"68d7c516-7790-4447-ba53-809e836678b1","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.961296Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:2a11de36fb4c6b198961192738bac84aadd7e3e2fa0d04c08f371ba1cfe25c27","observation_id":"2cb14538-63db-429e-98ba-48aa6e23b6e2","resolution":{"observed_at":"2026-08-07T11:05:22.465449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.389292Z","title":null,"venue":null,"work_id":"8caf7115-818e-4bf9-83c0-aedf37f53763","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.971376Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:62a2cc6f91befb2f54c292b61fa4cc04db2782cc80b0b3e7de45850648334af4","observation_id":"c130aa28-c9d8-4f8c-93ac-78e6f1e19275","resolution":{"observed_at":"2026-08-07T11:05:22.395288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.344981Z","title":null,"venue":null,"work_id":"48eda53f-49e9-4336-bf28-27cfff2bb034","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.980113Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:0a7e5f0860d65eec2f7a45a12370dea77f55246000ac7cf71f44ec4c137612cb","observation_id":"b7038d16-669d-460c-a5e0-4ef8f49abba8","resolution":{"observed_at":"2026-08-07T11:05:22.363949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.182553Z","title":"equally good","venue":null,"work_id":"490a0081-6a79-4c1e-a54c-6c5971e8881a","year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.988591Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:a11318bb07917aa7b3f447f3a59db27b8122f45623f53601754e9c7f6ba00710","observation_id":"56aba37e-d952-4cb6-ad57-00930f296933","resolution":{"observed_at":"2026-08-07T11:05:22.199841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.104031Z","title":"Responses should minimize the mention of objects not present in the ground truth answer, and inaccuracies in the description of existing objects","venue":null,"work_id":"c6715844-43f4-4194-acbd-7a36957fda7c","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:20.013797Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:1ad314ee0f7038f5b376d35d46bf26caeedf68af2e68f48465236641c4ac5d6a","observation_id":"d4e85cc4-f8a5-487e-b582-eee8aea80311","resolution":{"observed_at":"2026-08-07T11:05:22.116840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.056553Z","title":"Rank higher the responses that least misrepresent these relationships","venue":null,"work_id":"d8f50db1-43c0-4017-9454-f2e30be7e62c","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:20.026221Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:9c3cd4b912c794586fe7cb2cac7d9709645726a0ee0e6403c5febb7f336a6313","observation_id":"78a0e081-f8d1-4af4-bf4f-192fa85a8888","resolution":{"observed_at":"2026-08-07T11:05:22.066928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.004244Z","title":"Responses should avoid inaccuracies in describing the characteristics of the objects present","venue":null,"work_id":"33251c6e-90c9-49f4-86ab-bfe7436ea327","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:20.034083Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:cbbf90b7705dc3665477c3b5abf28b03cd139fd33135d1f1035cd9d462b869a6","observation_id":"88f71158-6ef9-430c-88b4-7f57a2d86032","resolution":{"observed_at":"2026-08-07T11:05:22.020746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:21.949565Z","title":"Equally good","venue":null,"work_id":"36e63bde-2861-488c-92a7-865e6def5290","year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:20.044416Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:48c291ee6b7722e0aa586ecb5a222bc9b45f98f7b94f2d76bf25e600e0a8c8ef","observation_id":"edc4972b-8872-4d0a-b8bc-92ad31259023","resolution":{"observed_at":"2026-08-07T11:05:21.962642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:05:19.509807Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.509807Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:a76caade1d12b80ec372e35a43b2520ccd5bcce5eb2bffb6b98a3d52b2ae3b3e","observation_id":"7994fa18-e622-4d8b-b9ee-64d433200258","resolution":{"observed_at":"2026-08-07T11:05:19.509807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.114146Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.114146Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:d11f0f7b0545698582948a6d97c87ff6ec91726bca5b28023458359c4903b8b9","observation_id":"3823083d-0afc-468d-bd06-d4c92fc52bff","resolution":{"observed_at":"2026-08-07T11:05:19.114146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:23.143159Z","title":"InProceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"2c4e0838-11dc-4b4d-b126-1b2cd79f6f1b","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.262204Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:97faec9e95e29f2ec396400a9bd6153e64516ffdf2bf02a92c58ab6cb5a1d59a","observation_id":"c013ae08-676f-4166-8fbe-e7b9fac4652c","resolution":{"observed_at":"2026-08-07T11:05:23.155612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T11:05:19.193447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.193447Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:ee8a074fccec1fcd54e8dbb22686e14d0a8895d32ba222f8bfc284b43add0a92","observation_id":"2760d9a4-0362-4c1d-a434-7a40e9ef31e0","resolution":{"observed_at":"2026-08-07T11:05:19.193447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 5 inbound Pith citation observations for arXiv:2506.04280."}