{"as_of":"2026-08-09T19:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ae0344be09fe5fe79618be5c00f57e5b2264a1ef99494b64abe3dfcda4ab5f7","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:13:58.155456Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.16151/citation-record","integrity":"/paper/2505.16151/integrity","json":"/paper/2505.16151/citation-record.json","paper":"/paper/2505.16151"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:13:51.828346Z","title":"DeepSeek-R1: Incentivizing reason- ing capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:51.828346Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:12466b7c6c9eeaa262f0c9e89d095e3b5c834382c59feafbed9874052f833761","observation_id":"b4a03c8d-c0d0-4c32-b66d-099fb747db79","resolution":{"observed_at":"2026-08-07T15:13:51.828346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T15:13:51.879241Z","title":"Kimi K1.5: Scaling reinforce- ment learning with llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:51.879241Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:fa027fb7762050f45ad7e96f03fafdb48ab445a3b93242b436459ed6c29bb572","observation_id":"57845998-5e7e-4750-bcdc-a2068d408ced","resolution":{"observed_at":"2026-08-07T15:13:51.879241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-08-07T18:08:48.524378Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-08-07T15:13:51.984499Z","title":"S 2 R: Teaching llms to self-verify and self-correct via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:51.984499Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:6e915a137973d83fcaf4ecfa42ada297989a0f92a63a1160d59d1bc812d120bf","observation_id":"93e86eb5-d40a-4b50-8c8c-b65249a2b758","resolution":{"observed_at":"2026-08-07T15:13:51.984499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:04.267210Z","title":"Let’s verify step by step","venue":null,"work_id":"18957867-928b-40b4-918b-8dc7668715cf","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:52.146034Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:767ea77744e1bf7fcfe14be33633045b997ee52b7382894793cfb252ce85d886","observation_id":"0c42477e-565d-45e7-b736-146e083932f4","resolution":{"observed_at":"2026-08-07T15:14:04.355711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:04.055620Z","title":"OpenAI o1","venue":null,"work_id":"a3415c97-1495-4c50-b0e5-5a5dfda5acdd","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:52.295443Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:c104ac9ec7b5792cb9596c557d0c46fca33fefe8f52ba4e64829b0c9b23d4429","observation_id":"beb3ea43-93c7-4bfa-92dd-cf5433b58684","resolution":{"observed_at":"2026-08-07T15:14:04.149806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T15:13:52.385935Z","title":"LLaV A-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:52.385935Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:35e01a7b311ef3868c68d16b6eb6a1d63d8af8dee011ea98c0794958a46d425b","observation_id":"41caa1b0-7bc0-4854-b185-0b4f219ffe8b","resolution":{"observed_at":"2026-08-07T15:13:52.385935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:03.864859Z","title":"Insight-V: Exploring long-chain visual reasoning with multimodal large language models","venue":null,"work_id":"d6f3b708-3a33-47a9-a969-019abafc0e25","year":2025},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:52.502448Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:b1fd1ae4625ecbe81f32b3cb1d3abf1a301eb36ac805e3e8391ca11ead9ad4a6","observation_id":"14cf2302-bd83-4130-928c-a89068c677ce","resolution":{"observed_at":"2026-08-07T15:14:03.936163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-08T00:04:35.299538Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-07T15:13:52.634235Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:52.634235Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:e51e40a10e90ef12ccde4a0823c263bac8ce350d5f0d2d872f01ce8db29d3dd9","observation_id":"9d634656-5c72-4ccb-9890-89369531f8f8","resolution":{"observed_at":"2026-08-07T15:13:52.634235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T15:13:52.747958Z","title":"Visual- RFT: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:52.747958Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:5d9ef1e88d3a95cc280e0c3fbb7a7796746d6665814e3cab631c7cacf43f524c","observation_id":"c58e677e-b258-4034-85c2-3c79f7f93288","resolution":{"observed_at":"2026-08-07T15:13:52.747958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T15:13:52.912688Z","title":"Vision- R1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:52.912688Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:89117ec641e9a90639c2beb43e1234c9aa230e34d5c1030a3bca26193abd41cb","observation_id":"c0044c76-f0d6-480e-bf76-6e1045f06c76","resolution":{"observed_at":"2026-08-07T15:13:52.912688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-07T15:13:53.084279Z","title":"LMM-R1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:53.084279Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:886c2c1e682ad40825a3c6ff26e2c7ceef914b59650294de83758894f5a575e1","observation_id":"c16d2579-a035-41ab-91e7-114625bcacae","resolution":{"observed_at":"2026-08-07T15:13:53.084279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T15:13:53.259417Z","title":"R1-VL: Learning to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:53.259417Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:597a1bae036ab582edcf4a1b4970ada003c4e8fe13f722e9c34cd1b09a1e0ef6","observation_id":"0c3d472a-cddc-490d-aac9-d9e2ba56f329","resolution":{"observed_at":"2026-08-07T15:13:53.259417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:03.689432Z","title":"Morcos, Hongseok Namkoong, Ali Farhadi, Yair Carmon, Simon Kornblith, and Ludwig Schmidt","venue":null,"work_id":"b3d7811a-7f1f-4445-87dc-a2b9a61a629b","year":2022},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:53.411747Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:8717f089bf6ffd712fdaeb712d641df9f40d6db4574c806cb092c4a2624940ae","observation_id":"b9901528-38be-4f40-ad0f-a6bc60af2194","resolution":{"observed_at":"2026-08-07T15:14:03.795695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:03.554627Z","title":"Editing models with task arithmetic","venue":null,"work_id":"5a9d9d4f-fc89-4d19-a11d-15d90b89c8d9","year":2023},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:53.532874Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:e4696f95b4eeec513fbdf0787eb689c9a9c2b8f487f25975bce6b6bb8e69bb33","observation_id":"d55647b8-133f-4200-a45d-331eab01d5c3","resolution":{"observed_at":"2026-08-07T15:14:03.631396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:03.352539Z","title":"Composing parameter-efficient modules with arithmetic operation","venue":null,"work_id":"d00693fe-4579-4e80-af70-5bb4a5db35fb","year":2023},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:53.655470Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:480683a568296aa41e0c6617e62f1b8eca0348275c2eca9cd3ad2c91f24149a4","observation_id":"fd227eb9-e86f-44c5-9d0d-9148a56e3c05","resolution":{"observed_at":"2026-08-07T15:14:03.426559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:03.160367Z","title":"Gradual progression from sensory to task-related processing in cerebral cortex","venue":null,"work_id":"6fef156f-0de2-4c95-ad1e-85d0e8f4d777","year":2018},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:53.801760Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:47342a1836cb5c726e28a575b7cb3869746591b0a64f6da33b78573e5062f00c","observation_id":"93053a11-4333-411e-9419-5bb4c56a9471","resolution":{"observed_at":"2026-08-07T15:14:03.243842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:02.989108Z","title":"Hierarchical processing of visual and language information in the brain","venue":null,"work_id":"dea45f9f-70e1-415c-8157-aef08cbfa0d1","year":2022},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:53.915991Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:f57f1a0c18b90c90c7412e5bbe5ac40b033cec2543b6e8354a4ffa1ad02fc2b9","observation_id":"db001b72-5745-4abe-abc6-1b1c1e4d1378","resolution":{"observed_at":"2026-08-07T15:14:03.048780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:13:54.045942Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:54.045942Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:22ec4af4563e877efff00015f9ec609ad1fdc08d4166af6b2402a65d86836b34","observation_id":"37983c83-55b1-4773-8a90-c17d4a67db5d","resolution":{"observed_at":"2026-08-07T15:13:54.045942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T15:13:54.232145Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:54.232145Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:4b7d72a3b013273f48d99206e29bd09c2e64aad54ab709e3f40fdea2b5f01097","observation_id":"ae20434e-d4d3-41ad-933e-ed70bf3a7f99","resolution":{"observed_at":"2026-08-07T15:13:54.232145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:02.771323Z","title":"Visual instruction tuning","venue":null,"work_id":"2cd89b47-665f-41fa-83f6-fbde4bfa7e2e","year":2023},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:54.390407Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:28e8c74275a7e75ce454091f1b6b038b19c5c6d59cae9f0e6aeed586207f8769","observation_id":"9bd3e0e5-35f8-4239-8ce2-90440b2bab58","resolution":{"observed_at":"2026-08-07T15:14:02.852006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:02.583145Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"c5c90742-a665-4b42-97e5-1e9d2373a557","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:54.529176Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:69c27146b4c523bac55716a09c17067711b2bc38b47998f2552a118923f8ea14","observation_id":"6cde11fc-f8ee-44cb-91ca-8af5c0207f04","resolution":{"observed_at":"2026-08-07T15:14:02.676886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:02.402643Z","title":"Chi, Quoc V","venue":null,"work_id":"9502f4cd-c68e-43c2-b066-8fb0f6e38c41","year":2022},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:54.654112Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:8bbdfe2c8605c170bc07e40f0ed703607da92b97535cd3ef68f4da5591f98ee4","observation_id":"7ee25ad8-f013-4c6f-b450-7203ce445ce8","resolution":{"observed_at":"2026-08-07T15:14:02.505631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-08T03:30:51.616377Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-07T15:13:54.759630Z","title":"Improve vision lan- guage model chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:54.759630Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:e2cf30f5fb95b6ea02d6052354a66751772d151614fcc2bf8ae8ff95bd14af3b","observation_id":"7068f311-2234-4343-9571-58b2bc26b0ea","resolution":{"observed_at":"2026-08-07T15:13:54.759630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:02.242168Z","title":"Compositional chain-of-thought prompting for large multimodal models","venue":null,"work_id":"908e3a55-7b23-468a-ad3a-612830250f36","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:54.882809Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:106596e142e99389a92a4f78190578c961e74cedc1b5c33f24468047602f8ad3","observation_id":"cd65305a-d2d3-4566-9141-65de8ebf159f","resolution":{"observed_at":"2026-08-07T15:14:02.272805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09797","last_updated":"2024-04-15T13:54:35Z","snapshot_observed_at":"2026-08-09T19:46:42.652537Z","submitted_at":"2024-04-15T13:54:35Z","title":"TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09797","snapshot_observed_at":"2026-08-07T15:13:55.011386Z","title":"TextCoT: Zoom in for en- hanced multimodal text-rich image understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:55.011386Z"},"links":{"cited_paper":"/paper/2404.09797","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:32fc8d340e19eb38d5ecda06c69ad924c4ceebbad7b585848610a435ad5441b4","observation_id":"14d2e6a5-43c5-4b83-9c53-e5550f74b49f","resolution":{"observed_at":"2026-08-07T15:13:55.011386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T15:13:55.145082Z","title":"MM-Eureka: Exploring the frontiers of multimodal reasoning with rule-based re- inforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:55.145082Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:3083d561f513f765ce998f3bc14bd42758d47f63656f8ac8d7e2c2e647863527","observation_id":"6727c625-bba4-4568-a169-45ca1b8fe1a3","resolution":{"observed_at":"2026-08-07T15:13:55.145082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:02.097771Z","title":"Merging models with fisher-weighted averaging","venue":null,"work_id":"6290c4f4-d471-4c5f-981d-b00a6a0823ed","year":2022},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:55.288092Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:b204d03ea9f41c82ed510e32b06b81f8abd63cd209e2667ef965025949a6c1c1","observation_id":"897af4c1-7e20-4dd4-878f-c34a3423183d","resolution":{"observed_at":"2026-08-07T15:14:02.178644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:01.945588Z","title":"Raffel, and Mohit Bansal","venue":null,"work_id":"97a19d44-5694-461e-aec3-284d7f7684d1","year":2023},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:55.377913Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:a8ddaa8ef27318a8700dea1dcb6ba1d877bda3db1de2f051e9b90730c17d5ccd","observation_id":"b96f9645-0ec3-4ef9-ac84-ff3177a291a9","resolution":{"observed_at":"2026-08-07T15:14:02.038488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:01.776049Z","title":"Metagpt: Merging large language models using model exclusive task arithmetic","venue":null,"work_id":"939ad4bd-a13f-44bd-aa85-fd61cd3c7fd5","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:55.488112Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:1c04affe96599f5aa957e3f101c6b4673bfba4b6a627da4a9ce87ed460b21e00","observation_id":"198173b2-c49d-4ca9-8ece-5f69c3f9a79a","resolution":{"observed_at":"2026-08-07T15:14:01.860402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:01.693465Z","title":"Dataless knowledge fusion by merging weights of language models","venue":null,"work_id":"77120d08-2531-46f1-8036-05dde624d70e","year":2023},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:55.556366Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:6b5feb8298f0d18927d5a236a08f3e562f09c631c2436a04a3c7294a238976e7","observation_id":"b0e58955-0b2b-44e3-99ae-a2e60fbe3d22","resolution":{"observed_at":"2026-08-07T15:14:01.719617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:01.491649Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch","venue":null,"work_id":"00e7c832-352f-4113-945e-8ac8d566f6a0","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:55.649661Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:e0327a17d71cbdeb5530b8f3c5081587189529af0b51013a91ad6a1759baa27f","observation_id":"c95559bb-14b1-4004-9cb1-c43d4b8ecdc7","resolution":{"observed_at":"2026-08-07T15:14:01.603696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05464","last_updated":"2025-07-15T06:09:44Z","snapshot_observed_at":"2026-08-07T15:48:41.620409Z","submitted_at":"2025-05-08T17:56:23Z","title":"Bring Reason to Vision: Understanding Perception and Reasoning through Model Merging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05464","snapshot_observed_at":"2026-08-07T15:13:55.819405Z","title":"Bring reason to vision: Understanding perception and reasoning through model merging","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:55.819405Z"},"links":{"cited_paper":"/paper/2505.05464","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:185a7450451f0c86443368583848dc7a5c02674356455638ebf9f0813bd3685a","observation_id":"c9568ce4-e1e1-418e-97cd-37470082b171","resolution":{"observed_at":"2026-08-07T15:13:55.819405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:01.351473Z","title":"Neu- ral Tangent Kernel: Convergence and generalization in10 neural networks","venue":null,"work_id":"1862d25b-1793-4ddd-87b3-4d4118236891","year":2018},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:55.972987Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:70ef898add51d43283b43e6b8bde9ae5f99fcc70d8b05eeafe44283bde57a078","observation_id":"babf7510-ac6f-4b55-b94a-f9be4d6483b0","resolution":{"observed_at":"2026-08-07T15:14:01.423826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:13:56.060872Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:56.060872Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:b3019a14dc769eb7bbb929e8709af64a3b72a556dd1e7aaf499d9fa5b899b61f","observation_id":"5fdac022-bc8f-44fd-b5b0-c1eba68b3f94","resolution":{"observed_at":"2026-08-07T15:13:56.060872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:01.172763Z","title":"AGIEval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":"7c4d73d6-9c5c-42f1-81e8-3f6f84a3ffa0","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:56.214550Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:42994f4777263f083dd8c89dbe1379a5f56f470918fe2e20efbc4292362b2653","observation_id":"383efb5e-2548-4a87-a036-59f905451354","resolution":{"observed_at":"2026-08-07T15:14:01.259648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:01.040082Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"a7d302b4-800d-49c5-be2c-8d7f454a6ed0","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:56.305641Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:87cc1848dfc17ffbd096d9b170bf980812fa49f7e648e7c2a99fcc39f0dd732c","observation_id":"a0006f44-3ad8-4b4c-bafb-60e3314e2184","resolution":{"observed_at":"2026-08-07T15:14:01.109036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:00.871427Z","title":"Llava- next","venue":null,"work_id":"eceade65-79f9-4d2d-b25d-c0447f831d81","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:56.410192Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:26da6b0cf0fb671889cea6455a7b4a87267afa785aaff1545f3f50e053640ec4","observation_id":"80fa561b-4be0-40a4-bc90-2158c8d5e01e","resolution":{"observed_at":"2026-08-07T15:14:00.942818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:00.745757Z","title":"VILA: on pre-training for visual language models","venue":null,"work_id":"fb546cc4-99f4-4b76-9c5f-b149febfc923","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:56.536836Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:1908b6536c1167e0c34f073c8cebafeb8a9ebc3606bb4e567b8c8945a195fb81","observation_id":"0a029e9f-43ef-4f43-a265-d67a00e0aef5","resolution":{"observed_at":"2026-08-07T15:14:00.804085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:00.617999Z","title":"Building and better understanding vision- language models: insights and future directions","venue":null,"work_id":"434770e1-8636-411c-91d4-1b1ad7e8105e","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:56.609209Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:f974d5288dd049adce7efb6442207168396b6b5300d04b3d4846e4c6897c01f0","observation_id":"71c96e96-d19e-42a1-9d43-e83aa32072a7","resolution":{"observed_at":"2026-08-07T15:14:00.681087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:00.435915Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":"06e9ccdc-9f4a-4194-bdd7-94f2bb99baec","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:56.679480Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:eddd70ac0fd483d11608250726e6161d1a01714d14c435333e9c9f1084631878","observation_id":"79992ad2-8c98-474b-ba7a-df3a9f70a619","resolution":{"observed_at":"2026-08-07T15:14:00.508551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T15:13:56.772463Z","title":"Nvila: E fficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:56.772463Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:a00b3be054ad95e8d6571f542a9f18c171031f1971d509c9c42bcf8e055bfe94","observation_id":"a8dab4d0-57e2-4045-bbef-6ea7cf7dc34d","resolution":{"observed_at":"2026-08-07T15:13:56.772463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:00.253108Z","title":"LLaV A-OneVision: Easy visual task transfer","venue":null,"work_id":"a93d025c-9651-4a76-b23b-8fdd7e19b35a","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:56.841558Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:11761229713f04274eca7aba0b4bc3a31cbc0f34d334458e10cbf643798303ce","observation_id":"69526aa6-a77e-4f0d-8ee7-a0e8566f7696","resolution":{"observed_at":"2026-08-07T15:14:00.340628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T15:13:56.924965Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:56.924965Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:6c5372af820fd5f7dc29b7c8bd6154e624bc0a58e7f0527fc4b475c4138d4e85","observation_id":"52f83b67-50cc-4255-8a95-013e8a8d3ad3","resolution":{"observed_at":"2026-08-07T15:13:56.924965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:14:00.072063Z","title":null,"venue":null,"work_id":"a2a05a67-a70f-44ee-b050-6a7354a96e66","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:57.024187Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:2a99ebbdd706c5e9108dd1d6d644e1c9db19cf51bc2efee4aeb28fd971ff2fae","observation_id":"2cdb1580-914e-48d7-af6b-f22e16ec8d97","resolution":{"observed_at":"2026-08-07T15:14:00.145206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:13:57.151656Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:57.151656Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:1ec9f5741278111f9b2032d2fb4ae064b08f03b9a4e300bb6424dce64abcf68e","observation_id":"294efcf3-6fe5-4ed8-bcf1-da716dec89ff","resolution":{"observed_at":"2026-08-07T15:13:57.151656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:13:59.888859Z","title":"MMMU: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert AGI","venue":null,"work_id":"dd900abb-6bdb-4e3d-a947-dab46242619f","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:57.319687Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:a14ba2ee8cb0f36b6a61d1fec7681a9ba903a9725460cac2d5af3bdad82e6705","observation_id":"ce5f00e2-6d81-4ddf-a05d-8b68d7b1f3bb","resolution":{"observed_at":"2026-08-07T15:13:59.979941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T15:13:57.403852Z","title":"MMMU-Pro: A more ro- bust multi-discipline multimodal understanding bench- mark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:57.403852Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:e64a67f86a0ec6f40d4774d232fb7ce28114614cb40f742d9652335571fabc5f","observation_id":"7a260aa3-ee5a-4850-a16c-4fa8b2149eb9","resolution":{"observed_at":"2026-08-07T15:13:57.403852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:13:59.752009Z","title":"MathVista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"29e2dd40-1bfb-44b0-9df2-853efa38dea6","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:57.534671Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:780f8cc38812647128fe1e4d7fbcb290d69febdc902b80b1a7b716572d64fd7c","observation_id":"598d3a4f-c541-4a1e-85f4-24484d68a512","resolution":{"observed_at":"2026-08-07T15:13:59.801231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:13:59.641968Z","title":"Measuring multimodal mathematical reasoning with math- vision dataset","venue":null,"work_id":"0135067e-cd06-420c-8c3a-adfb0f4eb4e3","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:57.670724Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:a96f72113f011c32b26094a0deff534048979621851f298caed6d8794704a439","observation_id":"1f77ec34-5c6e-427d-8fbf-dba8e89d4de6","resolution":{"observed_at":"2026-08-07T15:13:59.680133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-07T15:13:57.748180Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning? arXiv preprint arXiv:2407.01284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:57.748180Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:1bc98cbdf69101b2cbda1b9bf4a3731232d4f36eb1ec784d83594e9ae4a84932","observation_id":"237520f4-695a-42dd-bf94-e5bc8b55970d","resolution":{"observed_at":"2026-08-07T15:13:57.748180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:13:59.531991Z","title":null,"venue":null,"work_id":"2389567a-7e3b-491e-9e85-991f7c309386","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:57.824122Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:89796b7f3bd138496cd3a2aa5d02694ddb15060a9647e0569580ca3522e5d832","observation_id":"c4dd5115-8240-4cc4-8aee-bf37bff505c7","resolution":{"observed_at":"2026-08-07T15:13:59.569232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:13:59.385428Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":"fec25243-f34d-44b5-8b8b-802ae4e10935","year":2014},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:57.957815Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:6233cd00c8d74ec3522234c85f7988c6580878abb704fd78a511e7903e302d36","observation_id":"f9cbc9b4-afda-41ea-be0c-aa0ac8f62cd1","resolution":{"observed_at":"2026-08-07T15:13:59.427612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:13:59.236924Z","title":"Non-Reasoning MLLM","venue":null,"work_id":"f948e8ca-2a63-43d5-a676-11574c70412a","year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:58.054094Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:5fe4972a914b1fd06bd800b173690d8e43481e654e60c7506785ea3b8c093305","observation_id":"a7941d7c-dc4a-4bf6-96fa-b588987efdcd","resolution":{"observed_at":"2026-08-07T15:13:59.285079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:13:59.076338Z","title":null,"venue":null,"work_id":"4bb7ae30-50a9-4054-910a-60917245e6e7","year":null},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:58.155456Z"},"links":{"citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:7e78841f892ab1eed9bbb76ee9ef1cffea4b05e5de623f77559af337fd202e82","observation_id":"35c9be25-702f-4eb6-99ec-11fa196a66ac","resolution":{"observed_at":"2026-08-07T15:13:59.157793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2505.16151."}