{"as_of":"2026-08-10T05:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8bc46e6fb82197d274217477f7a3cdad0a8f4edf06da9b2365f3f87e14fc60e7","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:54:48.162766Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T05:51:18.233043Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:55:25.118073Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13362","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing spatial reasoning in vision-language models via chain-of-thought prompting and reinforcement learning","venue":null,"work_id":"59b66da2-a9ca-41c3-aa89-2359963af0ee","year":2025},"citing_paper":{"arxiv_id":"2511.00710","last_updated":"2026-04-13T19:25:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-01T21:19:41Z","title":"Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T00:59:29.584299Z"},"links":{"cited_paper":"/paper/2507.13362","citing_paper":"/paper/2511.00710"},"observation_digest":"sha256:fb4a93ed3cf0bca4eae3cbb1e96ab79b05ee345edb0e5f72469c94c045ce207c","observation_id":"205bf49e-2912-4f14-97fd-2c0ad26eddea","resolution":{"observed_at":"2026-05-18T01:00:34.244407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13362","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing spatial reasoning in vision-language models via chain-of-thought prompting and reinforcement learning","venue":null,"work_id":"59b66da2-a9ca-41c3-aa89-2359963af0ee","year":2025},"citing_paper":{"arxiv_id":"2605.18209","last_updated":"2026-05-18T10:54:55Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:54:55Z","title":"SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T11:06:29.022994Z"},"links":{"cited_paper":"/paper/2507.13362","citing_paper":"/paper/2605.18209"},"observation_digest":"sha256:f83a695cdae5d4a391f451baa866fb9f2dd568e0bc6e00611d5c623ecc80a12a","observation_id":"8864a7cd-4258-41a7-8c93-e9db60e40cd3","resolution":{"observed_at":"2026-05-20T11:08:13.509580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13362","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing spatial reasoning in vision-language models via chain-of-thought prompting and reinforcement learning","venue":null,"work_id":"59b66da2-a9ca-41c3-aa89-2359963af0ee","year":2025},"citing_paper":{"arxiv_id":"2605.19859","last_updated":"2026-05-21T18:05:34Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:50:40Z","title":"Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T05:57:45.964145Z"},"links":{"cited_paper":"/paper/2507.13362","citing_paper":"/paper/2605.19859"},"observation_digest":"sha256:6238a5047d8c88f73da2e0e979c504c70dbd2c01c36dcb49464007af0684dadb","observation_id":"fafb401a-850a-41f4-a92c-12801b397889","resolution":{"observed_at":"2026-05-20T05:58:04.874738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13362","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing spatial reasoning in vision-language models via chain-of-thought prompting and reinforcement learning","venue":null,"work_id":"59b66da2-a9ca-41c3-aa89-2359963af0ee","year":2025},"citing_paper":{"arxiv_id":"2605.19859","last_updated":"2026-05-21T18:05:34Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:50:40Z","title":"Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-25T05:51:18.233043Z"},"links":{"cited_paper":"/paper/2507.13362","citing_paper":"/paper/2605.19859"},"observation_digest":"sha256:6abe0b01503fa1bbd30e067bf0bbd263699c850d494fe09a9cc4d60ff345b5de","observation_id":"12a1fb11-346b-4f01-b440-4f0280f224b8","resolution":{"observed_at":"2026-05-25T05:55:25.121803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13362/citation-record","integrity":"/paper/2507.13362/integrity","json":"/paper/2507.13362/citation-record.json","paper":"/paper/2507.13362"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T19:54:48.058714Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.058714Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:a92d0858ddf0057c8c10d9475d3203cd095968942edf1ed0d86563cb80b08ef0","observation_id":"026491a9-7bf9-4eb7-93f4-0d6ff127268f","resolution":{"observed_at":"2026-08-06T19:54:48.058714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00363","last_updated":"2023-03-22T15:42:50Z","snapshot_observed_at":"2026-08-07T10:33:25.603798Z","submitted_at":"2022-04-30T23:03:49Z","title":"Visual Spatial Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.00363","snapshot_observed_at":"2026-08-06T19:54:48.062289Z","title":"Visual spatial reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.062289Z"},"links":{"cited_paper":"/paper/2205.00363","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:b68adc5dcd9ca4eed5e435ea0f565a7ec38dba40beb45cafd473f3e64469115e","observation_id":"660692e1-7f6f-4f16-a9a7-57b0b0c008ba","resolution":{"observed_at":"2026-08-06T19:54:48.062289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.065213Z","title":"Sat: Dynamic spatial aptitude training for multimodal language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.065213Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:43ae6d7ac4bcfc44f62cddc322ac6503347fb371ae590fe5b14a7e896d6d6687","observation_id":"7237e9ee-d699-4820-a06a-8563f308b19f","resolution":{"observed_at":"2026-08-06T19:54:48.065213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-06T19:54:48.068292Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.068292Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:5c047127e197d12f3bf2b6ea114e4d4facf49449f684b867f577a1f5841f8554","observation_id":"2cede708-7895-4775-8ce0-f9e6f9ce8811","resolution":{"observed_at":"2026-08-06T19:54:48.068292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.610328Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning,","venue":null,"work_id":"b84a01da-c0cc-41ae-b3f3-cead35cc9db2","year":2017},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.071617Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:8c680cb9cfafb45cf8e2eaa2c7b6a46eda17661d1680aac0f7d3206af959e5c5","observation_id":"8b8cc7d2-446f-4491-bc6b-7dfa4da6239e","resolution":{"observed_at":"2026-08-06T19:54:48.613029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-06T19:54:48.074302Z","title":"Visual-rft: Visual reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.074302Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:a84b9a4f750968fe138967ab582ba4de396477f139d565baa2c0967266639153","observation_id":"344944d5-44eb-4806-a839-9e0064ee6aed","resolution":{"observed_at":"2026-08-06T19:54:48.074302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-06T19:54:48.077400Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.077400Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:cfda60e4f917a7f55a8e2702db90ac24a4e58879ade4af3f5bc7fa5ecf6c3bdd","observation_id":"31ce173d-4c71-403f-8b5b-69c00dc94c58","resolution":{"observed_at":"2026-08-06T19:54:48.077400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.601162Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3,","venue":null,"work_id":"5fbe64b5-abf5-4f39-852b-39a2eae96de3","year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.079868Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:2d6d63cfff233293b710f957a342e7785f0ea3d70345681f27334e624309d5b7","observation_id":"f0f284c0-8e9b-41f3-93a9-c12961eda8de","resolution":{"observed_at":"2026-08-06T19:54:48.604078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.593013Z","title":"Rlvr in vision language models: Findings, questions and directions,","venue":null,"work_id":"9a20a974-b13f-464e-a680-2252fba8b97c","year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.082191Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:5ce012956bf69add4f0b3289921a8c4f0847aefebea572967e93b58a7289e3e1","observation_id":"b5752c06-a821-4f2b-832b-c9732a089370","resolution":{"observed_at":"2026-08-06T19:54:48.595750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.585262Z","title":"R1-zero’s","venue":null,"work_id":"b481a765-a948-4b1e-8b1f-5c1227f6f560","year":null},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.084730Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:a6ddc23cb5faa1df602421ff9dab3b02257fb83ee74f65b1046ebe31bdb6c39a","observation_id":"93e83563-3570-4ed1-b0e7-64ee2a7f3db7","resolution":{"observed_at":"2026-08-06T19:54:48.587733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-06T19:54:48.090566Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.090566Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:a0f7c885123eafc46416a3b4f53abd380f84fe1bbe6388aadb9687142b2cf9c7","observation_id":"c9714968-8465-4d2e-960e-7030c0c7d297","resolution":{"observed_at":"2026-08-06T19:54:48.090566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.093206Z","title":"Think or not think: A study of explicit thinking in rule-based visual reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.093206Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:cd9f87005cfc4f2d49081a85a6ee4e720fa1bff5b2dc7733ca2ad879797056e9","observation_id":"1aeb14d0-f97e-4d0c-b62a-c21146162283","resolution":{"observed_at":"2026-08-06T19:54:48.093206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T19:54:48.095753Z","title":"Video-r1: Reinforcing video reasoning in mllms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.095753Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:683ce1fbf76b1691bfa95b0e429ef724ac9c7470ad7c0e2517ce62d090c75b82","observation_id":"459ba278-8570-4a00-a6cf-778ca1f6a78e","resolution":{"observed_at":"2026-08-06T19:54:48.095753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.576097Z","title":"Spatial-r1: Enhancing mllms in video spatial reasoning,","venue":null,"work_id":"2ded617b-c027-4676-936f-2537c675c6df","year":null},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.098417Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:ead0b7bceacb896a1ecf683755226ceffcd9cfb4adfe29a1165b7098004957d4","observation_id":"403e28e2-fd40-4f71-9f1f-50b839a7a5a1","resolution":{"observed_at":"2026-08-06T19:54:48.579259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00883","last_updated":"2025-04-14T20:12:57Z","snapshot_observed_at":"2026-08-07T16:17:09.409469Z","submitted_at":"2025-04-01T15:11:11Z","title":"Improved Visual-Spatial Reasoning via R1-Zero-Like Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00883","snapshot_observed_at":"2026-08-06T19:54:48.103936Z","title":"Improved visual-spatial reasoning via r1-zero-like training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.103936Z"},"links":{"cited_paper":"/paper/2504.00883","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:58d394d6700ff109bae8bbcdeca5438d9e60958fee2aaa57f27463287c02d8cc","observation_id":"d1911141-ba6d-45a0-9592-05121f0c56cf","resolution":{"observed_at":"2026-08-06T19:54:48.103936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01805","snapshot_observed_at":"2026-08-06T19:54:48.101125Z","title":"Available: https://arxiv.org/abs/2504.01805","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.101125Z"},"links":{"cited_paper":"/paper/2504.01805","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:35a7f807cc674570f8516e53a1a481e65dda3dcb0e18c5ac512f33405d7744b6","observation_id":"08e55a4f-c9fb-4548-899a-300f02ff56b2","resolution":{"observed_at":"2026-08-06T19:54:48.101125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17076","last_updated":"2024-04-01T03:17:09Z","snapshot_observed_at":"2026-07-06T16:53:58.875152Z","submitted_at":"2023-11-27T22:23:27Z","title":"Compositional Chain-of-Thought Prompting for Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17076","snapshot_observed_at":"2026-08-06T19:54:48.110228Z","title":"Compositional chain- of-thought prompting for large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.110228Z"},"links":{"cited_paper":"/paper/2311.17076","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:7ffab6180e264ea6d5ae9426d3529a086ed0587a4ed98082597c8dfd2dc10d7a","observation_id":"ef361559-baec-48aa-b250-31ffba03bdd6","resolution":{"observed_at":"2026-08-06T19:54:48.110228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-06T19:54:48.107118Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.107118Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:8e3fa0b3a7f7e85ee589c30379c203e7af84b264b08917575eac546bfa1a2c70","observation_id":"8bcc650d-7dcb-4299-bb70-9ff14e903ad3","resolution":{"observed_at":"2026-08-06T19:54:48.107118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03622","last_updated":"2024-10-23T07:20:26Z","snapshot_observed_at":"2026-08-01T23:41:06.358986Z","submitted_at":"2024-04-04T17:45:08Z","title":"Mind's Eye of LLMs: Visualization-of-Thought Elicits Spatial Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03622","snapshot_observed_at":"2026-08-06T19:54:48.116134Z","title":"Mind’s eye of llms: Visualization-of-thought elicits spatial reasoning in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.116134Z"},"links":{"cited_paper":"/paper/2404.03622","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:f8969ef96f41cefac123944f74b3e9d8c76173467984051412a0994f1cff7a8f","observation_id":"5666202e-5beb-4160-8ff1-4c59f3288bbb","resolution":{"observed_at":"2026-08-06T19:54:48.116134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10074","last_updated":"2025-01-23T02:31:25Z","snapshot_observed_at":"2026-08-08T13:13:18.176772Z","submitted_at":"2025-01-17T09:46:27Z","title":"SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10074","snapshot_observed_at":"2026-08-06T19:54:48.113277Z","title":"Spatialcot: Advancing spatial reasoning through coordinate alignment and chain-of-thought for embodied task planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.113277Z"},"links":{"cited_paper":"/paper/2501.10074","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:cc0c02366a1a196c1b0043cdffc04d72535a29725cd7129c0281765022125288","observation_id":"474139ab-99b5-46cc-801e-99b140d37b0b","resolution":{"observed_at":"2026-08-06T19:54:48.113277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.568421Z","title":"Clevr cogent valb,","venue":null,"work_id":"fbaa5533-4d12-4a6f-b0a8-1fc1888d9dad","year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.122022Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:27dfa8b0017b90ab1c8fc94a61cdc83cbfb29559129c76497a8f4db30c651a86","observation_id":"b4a23978-495e-42ab-a85a-5013e648f521","resolution":{"observed_at":"2026-08-06T19:54:48.571061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10276","last_updated":"2024-08-05T04:52:16Z","snapshot_observed_at":"2026-08-05T10:25:06.999919Z","submitted_at":"2023-05-17T15:07:50Z","title":"Chain-of-Symbol Prompting Elicits Planning in Large Langauge Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10276","snapshot_observed_at":"2026-08-06T19:54:48.118975Z","title":"Chain-of-symbol prompting elicits planning in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.118975Z"},"links":{"cited_paper":"/paper/2305.10276","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:e5921874ef564607fbbcd8d66a74b56c09bf10e2326270641103209f9a995b06","observation_id":"a241cba3-ce08-431e-90ed-5525cdbb95cc","resolution":{"observed_at":"2026-08-06T19:54:48.118975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-06T19:54:48.127358Z","title":"Depth anything v2,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.127358Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:a30ed2960b160b594b34e83892ca83d7d2bf69fd1b24eef43d80cf33a69cf422","observation_id":"7f53ab88-b6a3-4746-9d32-22d246d838f3","resolution":{"observed_at":"2026-08-06T19:54:48.127358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00259","last_updated":"2023-06-01T03:57:12Z","snapshot_observed_at":"2026-07-06T14:25:28.974939Z","submitted_at":"2022-12-01T03:53:24Z","title":"Super-CLEVR: A Virtual Benchmark to Diagnose Domain Robustness in Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00259","snapshot_observed_at":"2026-08-06T19:54:48.124661Z","title":"Super-clevr: A virtual benchmark to diagnose domain robustness in visual reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.124661Z"},"links":{"cited_paper":"/paper/2212.00259","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:f70db04e1027ad1c25e63f19a22b36e331fadc55fe0fae06ca07c5f61eed62ec","observation_id":"e63589c4-b6e1-4889-b392-73cd413e2956","resolution":{"observed_at":"2026-08-06T19:54:48.124661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12665","last_updated":"2024-01-29T10:57:38Z","snapshot_observed_at":"2026-08-09T10:45:27.478125Z","submitted_at":"2024-01-23T11:20:03Z","title":"ClipSAM: CLIP and SAM Collaboration for Zero-Shot Anomaly Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12665","snapshot_observed_at":"2026-08-06T19:54:48.132799Z","title":"Clipsam: Clip and sam collaboration for zero-shot anomaly segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.132799Z"},"links":{"cited_paper":"/paper/2401.12665","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:a71a9bdab1f69e3e3ff215ccae7a9fbb013ce7e79e4d426535917410dfaa0af2","observation_id":"6fe160ae-13f8-4435-baf3-d27e065c7463","resolution":{"observed_at":"2026-08-06T19:54:48.132799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T19:54:48.130017Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.130017Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:2523e0d4e079ebb1cb4ccd9ae6d259d25306b98e7cec2d09bc2b4fcace9b1bd2","observation_id":"426118d5-58bd-4f7f-a067-ed12597e2dc4","resolution":{"observed_at":"2026-08-06T19:54:48.130017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T19:54:48.139134Z","title":"Dapo: An open-source llm reinforcement learning system at scale,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.139134Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:e10f310e6afeb81ca3098d78b7913c6b36633a77c0d1249ffba74c8cf00de5e2","observation_id":"a27f093c-9609-49fb-8719-68d3b7ce78f9","resolution":{"observed_at":"2026-08-06T19:54:48.139134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-06T19:54:48.136009Z","title":"Paligemma 2: A family of versatile vlms for transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.136009Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:d26042091bee6f6ed48966e590b182122b6f8c9c09a1dd73db26aa6ae3d7ac76","observation_id":"5b1b369b-9af6-4c77-bc28-85882706c23c","resolution":{"observed_at":"2026-08-06T19:54:48.136009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T19:54:48.144642Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.144642Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:247fab15dc4e4583f263e665c1ccbdb85fd49cdbd104bd9775f0b04d0aa5e5fd","observation_id":"50ae8837-e520-4134-81e2-36491a27c56e","resolution":{"observed_at":"2026-08-06T19:54:48.144642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-06T19:54:48.142033Z","title":"Program of thoughts prompting: Disentangling computation from reasoning for numerical reasoning tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.142033Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:5f65e764283cfeadba3407e07494f26940d34ab6b2255f66d579070c606501b3","observation_id":"fb0e9815-b80d-47f6-b11a-6cf7316cedc1","resolution":{"observed_at":"2026-08-06T19:54:48.142033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-06T19:54:48.150801Z","title":"Training large language models to reason in a continuous latent space,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.150801Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:019d4390ac3160b66634fbf67923b87927273b62fc2bdb4866acb8f262afa380","observation_id":"248d13b4-d54a-449a-91f8-49431fa02145","resolution":{"observed_at":"2026-08-06T19:54:48.150801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11089","last_updated":"2025-03-14T05:06:07Z","snapshot_observed_at":"2026-08-07T17:04:59.001128Z","submitted_at":"2025-03-14T05:06:07Z","title":"EmbodiedVSR: Dynamic Scene Graph-Guided Chain-of-Thought Reasoning for Visual Spatial Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11089","snapshot_observed_at":"2026-08-06T19:54:48.147566Z","title":"Embodiedvsr: Dynamic scene graph-guided chain-of-thought reasoning for visual spatial tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.147566Z"},"links":{"cited_paper":"/paper/2503.11089","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:aacb32704e66d5675af9f533999d7236c97c60b2c5dc6c1cf1a93482b4867a76","observation_id":"25ecb92a-5ce5-4dd3-9db3-cc0770f60934","resolution":{"observed_at":"2026-08-06T19:54:48.147566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-09T16:57:03.077389Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-06T19:54:48.156627Z","title":"Spatialbot: Precise spatial understanding with vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.156627Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:4b53a9a25627397554c8903fa957ec4d3e72195fef21ef738b7c4ced63967434","observation_id":"46a2075a-2a04-4750-af4a-544bd439c12c","resolution":{"observed_at":"2026-08-06T19:54:48.156627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-06T19:54:48.153646Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.153646Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:422341c3d81d43ac9a4f75fa4ff1e6d360411e257c90eb6fe720c5797ccddf5d","observation_id":"9faaa57f-7cfc-4f53-a10a-cf3e13efeb9a","resolution":{"observed_at":"2026-08-06T19:54:48.153646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-08T07:48:26.170625Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-06T19:54:48.162766Z","title":"Spatialvlm: Endowing vision- language models with spatial reasoning capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.162766Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:9db52d6da74c6e6623dedc68a3209f06ecfe56813aeb304f78b902d8b71bc1dc","observation_id":"e7f85b5b-2a86-40c6-b069-8646390f3e0c","resolution":{"observed_at":"2026-08-06T19:54:48.162766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13438","last_updated":"2024-10-30T00:47:52Z","snapshot_observed_at":"2026-07-06T17:47:34.522070Z","submitted_at":"2024-03-18T17:38:29Z","title":"SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors","version":5},"cited_work":{"arxiv_id":"2403.13438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.13438","snapshot_observed_at":"2026-08-06T19:54:48.199427Z","title":"SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors","venue":"cs.CV","work_id":"256988b5-a092-4652-8361-2c0a097dec81","year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.159895Z"},"links":{"cited_paper":"/paper/2403.13438","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:3afabc52bc121f2676b7172e2cdb2fc38d4f9c829e99448cf7e3e12321337c79","observation_id":"bd595542-d108-48c3-8ae1-71279158c07e","resolution":{"observed_at":"2026-08-06T19:54:48.204284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-06T19:54:48.087387Z","title":"Available: https://arxiv.org/abs/2503.05132","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.087387Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:2d35f00db77da363d8b49669df284a73d509342c2df10ff88c1fdf36c3ef9be9","observation_id":"d72bffca-7bf1-4666-bb7f-eb04a5452b88","resolution":{"observed_at":"2026-08-06T19:54:48.087387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 4 inbound Pith citation observations for arXiv:2507.13362."}