{"as_of":"2026-08-17T22:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a5ce8330a6be3fefadef3aebae9820c7d5da2996cfe472dfc3d911d92bf13e0c","coverage":[{"denominator":266,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:09:17.882743Z","state":"measured"},{"denominator":118,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":118,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:17:33.785540Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:59:52.515977Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2504.21850","last_updated":"2026-05-14T18:32:02Z","snapshot_observed_at":"2026-08-16T08:46:08.684546Z","submitted_at":"2025-04-30T17:57:22Z","title":"Visual Compositional Tuning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:09.890605Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2504.21850"},"observation_digest":"sha256:74263b936ba9f3dd6f95a769a5fac536147208aeb73f9787e8a42ead63cdba79","observation_id":"29394350-4395-427a-a682-5f18b5a73c2a","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-08-03T20:57:29.860215Z","title":"Explain before you answer: A sur- vey on compositional visual reasoning.arXiv preprint arXiv:2508.17298, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.17731","last_updated":"2026-06-30T21:37:31Z","snapshot_observed_at":"2026-08-14T07:35:41.065056Z","submitted_at":"2025-11-21T19:30:24Z","title":"VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T20:57:29.860215Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2511.17731"},"observation_digest":"sha256:db68ed820e86c51c4e290310705cfa14f5d345bd8f3175d9058d9e95f1e5f25d","observation_id":"ebf4352f-6fef-4a35-8e24-3dbbcb426783","resolution":{"observed_at":"2026-08-03T20:57:29.860215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2512.10941","last_updated":"2026-04-30T17:59:42Z","snapshot_observed_at":"2026-08-17T16:36:13.869490Z","submitted_at":"2025-12-11T18:59:08Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T22:57:04.802871Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2512.10941"},"observation_digest":"sha256:27880f0d7c2ada989651d4a6cc6d40172d65fa1dd13b99a6818661c96ec6fc8e","observation_id":"bd14d4ff-deff-46a7-baa7-ea0fadf4891e","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2604.13313","last_updated":"2026-04-14T21:28:46Z","snapshot_observed_at":"2026-08-13T15:13:50.391868Z","submitted_at":"2026-04-14T21:28:46Z","title":"Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T15:24:57.169737Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2604.13313"},"observation_digest":"sha256:4b714f50ee9558ae4ef0af76811e9f66d5f83c5ef39ea86a656258fc33019d20","observation_id":"0c472c11-a78d-4401-866d-41d28e17055c","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-08-14T13:38:39.932714Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:33.464951Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:7f45e8daa35b3f82cb4d0f2a72f9f260ec7e1819f0b9968d9745ff1d0dab409a","observation_id":"fb7f47e8-e6dc-4614-bcff-b50c7d0c8fd3","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-12T19:10:41.883296Z","title":"arXiv preprint arXiv:2508.17298 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-08-14T13:38:39.932714Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T19:10:41.883296Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:699d51da197242ce6a72bfe49154fc32ba890c44a9684b596dc9cd3d019bf640","observation_id":"58a0db0e-ef8d-42d6-9981-1ec18f092e7f","resolution":{"observed_at":"2026-07-12T19:10:41.883296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T23:56:02.856878Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:26b2690abae32e484b16cace6ab1510fef4b3ed75c85c1c2e5abb0857385860b","observation_id":"ac0e57e9-6067-4f03-b674-14f2ab0d56d3","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:4a413ac004384bc7e15e4f6251185a8be84bf143f0fd0bb28dd91ebf27e45d42","observation_id":"b1fb141f-8865-4542-a2d2-af25d41ca59a","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2605.00943","last_updated":"2026-05-01T07:11:58Z","snapshot_observed_at":"2026-08-11T08:31:36.256032Z","submitted_at":"2026-05-01T07:11:58Z","title":"ARIS: Agentic and Relationship Intelligence System for Social Robots","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T19:24:45.954058Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.00943"},"observation_digest":"sha256:2b131e09b275acb608edd2503f614629109a9f645a3a7cb2d03e425df8deba99","observation_id":"7b62a7a6-9669-4863-8b9d-7ec826435d21","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-14T22:04:51.869204Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T01:45:35.282421Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:97872bb1188b785d11424dc933a43a8dbbbc3f98d0c0a2fd96b47641091bb0c5","observation_id":"a4274836-00e4-42d0-8f9e-846c186d3db9","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-14T22:04:51.869204Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T23:09:57.202867Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:e485c85a675fcb990e97ad9f8f8a935075672249e6da71dc7bfd39a53fc1fc0f","observation_id":"5ee90f4c-549c-4719-886f-36445f090c3e","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-14T22:04:51.869204Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T22:46:26.117927Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:7c8c32c15fb20a45306c1359284507c6d725db6d6bc5290db7387df5917f1143","observation_id":"8fd5c76c-67fe-4ad7-ad5a-cdd969354892","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-08-03T02:22:11.160316Z","title":"Explain before you answer: A survey on compositional visual reasoning.arXiv preprint arXiv:2508.17298, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-14T22:04:51.869204Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:11.160316Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:d80e0307db7b3410ed29b99dace09fe0e16dc87ae2eecc1afa5c4afd34bc8c8c","observation_id":"f249f835-12cb-48f8-ad7b-7876f7ebab44","resolution":{"observed_at":"2026-08-03T02:22:11.160316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2605.23602","last_updated":"2026-05-22T13:11:23Z","snapshot_observed_at":"2026-08-16T00:21:12.948923Z","submitted_at":"2026-05-22T13:11:23Z","title":"GlowGS: Generative Semantic Feature Learning for 3D Gaussian Splatting in Nighttime Glow Scenes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T04:59:57.934468Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.23602"},"observation_digest":"sha256:2e8db02887100ddcfbce6b948e85bfb9728851c4e031fffed84c93cfe02da5c8","observation_id":"6f9d7c78-088b-4eae-938e-c9872e5efe55","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-08-15T12:27:32.305698Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:6944da71b04dee8db2282bea9443ec42b7b3f739506eff052597ff29bb8d8601","observation_id":"bcf55865-2ecb-4bf6-907e-250b4f2f899e","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2606.27264","last_updated":"2026-06-27T10:50:32Z","snapshot_observed_at":"2026-08-13T10:23:41.888529Z","submitted_at":"2026-06-25T16:47:05Z","title":"CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T05:40:03.047274Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2606.27264"},"observation_digest":"sha256:2f21082f7166022846796d62253690b1bc6dd4d081b7c0c7d42b408ac8f07569","observation_id":"8a48c267-2168-4d6c-9355-5843f187446e","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2606.27264","last_updated":"2026-06-27T10:50:32Z","snapshot_observed_at":"2026-08-13T10:23:41.888529Z","submitted_at":"2026-06-25T16:47:05Z","title":"CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T09:39:49.120139Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2606.27264"},"observation_digest":"sha256:77ef5f830f22b8ce955ca244fd7ea12e571306a7dced838b3940efc8615c30c4","observation_id":"aaa942f2-5d63-45c0-9d8e-f0ec27d554d8","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-08-16T00:17:33.785540Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.785540Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:0f77a044129f4a73960b4495fb2eb8b4da175f6f442fb04d0bd889312e7686c0","observation_id":"e58da99f-15e6-4f75-ae40-28dbe6609a75","resolution":{"observed_at":"2026-08-16T00:17:33.785540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.17298/citation-record","integrity":"/paper/2508.17298/integrity","json":"/paper/2508.17298/citation-record.json","paper":"/paper/2508.17298"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.513735Z","title":"A Benchmark for Compositional Visual Reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.513735Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:0ac2c7b6868a9718c1b254b9eda4f862b34b8fd1b63b33cfa506273efc84d418","observation_id":"bf9a193c-382c-40e5-bdc0-23b094869826","resolution":{"observed_at":"2026-08-15T17:09:17.513735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.518180Z","title":"Take A Step Back: Rethinking the Two Stages in Visual Reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.518180Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:df4ea263ac53fe22215fba9bf6846643e8a59e5ced0b089b40a3aa9d49fb50ae","observation_id":"83611022-30e1-43e8-9896-77fd7aa45eae","resolution":{"observed_at":"2026-08-15T17:09:17.518180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.521694Z","title":"The Book of Why: The New Science of Cause and Effect","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.521694Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:54aaac00a60fa66eef43d6f799ba98ccb30cdb57a51ca21cf8f615b935e5299f","observation_id":"924adcb7-85f5-44d2-b420-1bf109c57bac","resolution":{"observed_at":"2026-08-15T17:09:17.521694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.526199Z","title":"Inferring and Executing Programs for Visual Reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.526199Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:83aedbcf0c9c068edc83d1f27a9fb81739b86a4b9a24bff0e56f3081cc4539f3","observation_id":"5bd42100-d56e-4ac5-a5df-668a858ae1f0","resolution":{"observed_at":"2026-08-15T17:09:17.526199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.530233Z","title":"CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.530233Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:09ab2622d092387b4baa46650a06e90dac124ef0647d35967920d3987ea2c50a","observation_id":"70ba1066-30bf-407e-8f16-35b1c2b99abb","resolution":{"observed_at":"2026-08-15T17:09:17.530233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.533928Z","title":"RA VEN: A Dataset for Relational and Analogical Visual REasoNing","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.533928Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:d9d5d19b148dbdb41995dbc49cf83766d028b3304d310fb6c82907275938598c","observation_id":"f44fd22e-c38b-4cdb-a66b-86b7bf678bee","resolution":{"observed_at":"2026-08-15T17:09:17.533928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00840","last_updated":"2017-12-03T21:17:07Z","snapshot_observed_at":"2026-08-14T20:07:27.203500Z","submitted_at":"2017-12-03T21:17:07Z","title":"Visual Explanation by High-Level Abduction: On Answer-Set Programming Driven Reasoning about Moving Objects","version":1},"cited_work":{"arxiv_id":"1712.00840","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00840","snapshot_observed_at":"2026-08-15T17:09:19.570251Z","title":"Visual Explanation by High-Level Abduction: On Answer-Set Programming Driven Reasoning about Moving Objects","venue":"cs.AI","work_id":"f1fac570-9742-4f41-a035-acb07d02f353","year":2017},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.538323Z"},"links":{"cited_paper":"/paper/1712.00840","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:96cb0acd7f12ed04ac35d739fe267b7e0da45912c61c4805a1758c0b49815401","observation_id":"bf4e9e29-bbb8-482e-ab01-1cdef4a157c6","resolution":{"observed_at":"2026-08-15T17:09:19.574350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.542217Z","title":"Maintaining Reasoning Consistency in Compositional Visual Question Answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.542217Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:8f1d803138c6e957a8e359a7996e161c39568d0fb2799412666bf532bc05f0f3","observation_id":"f9d54651-546f-40c1-be8f-cc8b0b4c4ba3","resolution":{"observed_at":"2026-08-15T17:09:17.542217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.545552Z","title":"Visual Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.545552Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:115313431f39f597715042bb38d5be9a9be3cfe2ed555ba89cbe0b2f43819420","observation_id":"5f3077c1-cef7-4d19-835a-8a9cc3205176","resolution":{"observed_at":"2026-08-15T17:09:17.545552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T17:09:17.549166Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.arXiv preprint arXiv:2308.12966,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.549166Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:3e15bbb2f3170ace308bfddea9871cc0fcda39c1ca0f4b5a56e8beba190b788a","observation_id":"0b3b3d39-4673-414f-84e2-c0fb42fc0b6d","resolution":{"observed_at":"2026-08-15T17:09:17.549166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.553400Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.553400Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:e57f0576c50c011477cdf8131a0b55e492249e053bf51c152f771268436cc90b","observation_id":"719d8d4f-3419-4e9f-ab68-3fc22040ea3e","resolution":{"observed_at":"2026-08-15T17:09:17.553400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.557143Z","title":"InstructBLIP: towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.557143Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:cfd91418464e53b38c14d73f1ce0dc9b04e5891a7928721babad1c4deff5af90","observation_id":"9372ac24-3045-4847-a1fa-c748255303ca","resolution":{"observed_at":"2026-08-15T17:09:17.557143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.560723Z","title":"A Survey of Multimodel Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.560723Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:e55b520f63c2e23a3e9e782f339124c479aceac62cd17e9c0b8db4d35cf2e42a","observation_id":"e174f2f3-7221-4093-849e-c6e360e8dc2d","resolution":{"observed_at":"2026-08-15T17:09:17.560723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.564558Z","title":"Interpretable Visual Reasoning: A Survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.564558Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:0e891251ece67412850e458e13d8170b7a8eb654f6ceceb174e175aaf9d6021e","observation_id":"6e70e9c5-698a-4ac0-a3df-92b461415d20","resolution":{"observed_at":"2026-08-15T17:09:17.564558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10814","last_updated":"2025-03-13T19:03:41Z","snapshot_observed_at":"2026-08-16T12:50:14.908183Z","submitted_at":"2025-03-13T19:03:41Z","title":"Thinking Machines: A Survey of LLM based Reasoning Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10814","snapshot_observed_at":"2026-08-15T17:09:17.568659Z","title":"Thinking Machines: A Survey of LLM based Reasoning Strategies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.568659Z"},"links":{"cited_paper":"/paper/2503.10814","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:671ce2f7e4ee96d545d0ca10308c20179043b1c49278bde8ae6786d6a2a3b916","observation_id":"e0a07f5f-c192-4958-a691-081a514198a5","resolution":{"observed_at":"2026-08-15T17:09:17.568659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-15T17:09:17.572947Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.572947Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:daba95845acc3f3fa33e82c8b83f09c344519bc4162b90562a5a6ae74e711590","observation_id":"0e2b5f02-331d-461e-aadf-b9937102a53b","resolution":{"observed_at":"2026-08-15T17:09:17.572947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.576724Z","title":"Position: Prospective of Autonomous Driving - Multimodal LLMs World Models Embodied Intelligence AI Alignment and Mamba","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.576724Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:331743f7c93de535c9419c9ced481215a1cb1d42a951ef17d4b65e8dffaa2803","observation_id":"512ec9a5-7708-4f86-bf24-29a0b4fdf499","resolution":{"observed_at":"2026-08-15T17:09:17.576724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10196","last_updated":"2024-09-16T11:42:15Z","snapshot_observed_at":"2026-08-16T13:18:13.732559Z","submitted_at":"2024-09-16T11:42:15Z","title":"NEUSIS: A Compositional Neuro-Symbolic Framework for Autonomous Perception, Reasoning, and Planning in Complex UAV Search Missions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10196","snapshot_observed_at":"2026-08-15T17:09:17.580278Z","title":"NEUSIS: A Compositional Neuro-Symbolic Framework for Autonomous Perception, Reasoning, and Planning in Complex UA V Search Missions.arXiv preprint arXiv:2409.10196, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.580278Z"},"links":{"cited_paper":"/paper/2409.10196","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:a81b7e66968ad9201a55b8d4c220863a91eb7e86d0ba52c5f5bef92f3514e4fe","observation_id":"815e063b-a98a-4958-ac2d-0ddd06033f11","resolution":{"observed_at":"2026-08-15T17:09:17.580278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.584057Z","title":"UA V-based Urban Structural Damage Assessment Using Object- based Image Analysis and Semantic Reasoning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.584057Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:b832a395921d2de1443791b69c11181334368e49830ecdd169ab54d515a09630","observation_id":"d43da455-eb95-4631-abf3-20648f47a5c2","resolution":{"observed_at":"2026-08-15T17:09:17.584057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.587663Z","title":"A Study of Visual Reasoning in Medical Diagnosis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.587663Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:4311daa3ab7bac6cda2e50f226ca6b2af6dca8ce3fe7f9f39ef20d2afd9735a2","observation_id":"987e6fbc-1c5d-487a-92b8-82eb754d8265","resolution":{"observed_at":"2026-08-15T17:09:17.587663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.590944Z","title":"Medical Visual Question Answering via Conditional Reasoning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.590944Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:8426b6837df2f3f97826a78581c86e9e1a0769853c72c0182c9e63df855f56ea","observation_id":"96a9982d-3315-4005-abf4-39a1116d614a","resolution":{"observed_at":"2026-08-15T17:09:17.590944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13826","last_updated":"2023-04-26T20:56:40Z","snapshot_observed_at":"2026-08-16T15:37:25.320775Z","submitted_at":"2023-04-26T20:56:40Z","title":"Programmatically Grounded, Compositionally Generalizable Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13826","snapshot_observed_at":"2026-08-15T17:09:17.594301Z","title":"Programmatically Grounded, Compositionally Generalizable Robotic Manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.594301Z"},"links":{"cited_paper":"/paper/2304.13826","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:6c5aab3d54a47cb0c2d9b8dc12110a5c90703517ef8fdbbd59b109dff78538cd","observation_id":"79ab4d51-8731-415c-9a36-9f3079477b69","resolution":{"observed_at":"2026-08-15T17:09:17.594301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.598754Z","title":"Winoground: Probing Vision and Language Models for Visio-Linguistic Compositionality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.598754Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:dc15d794ba32a41c38471f6f95b646489e26b57429d55e87a6d33490a576bf8f","observation_id":"33a7b91a-c907-4811-8035-29075a1d6879","resolution":{"observed_at":"2026-08-15T17:09:17.598754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.602375Z","title":"When and Why Vision-Language Models Behave like Bags-Of-Words, and What to Do About It? In The Eleventh International Conference on Learning Representations ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.602375Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:f78acadd407026d5b162eb982b6f700d8cfd7de9451f31f390f97f601eba2c67","observation_id":"297a2486-68bd-44b4-8619-b25f63c90620","resolution":{"observed_at":"2026-08-15T17:09:17.602375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.605883Z","title":"Challenges and Prospects in Vision and Language Research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.605883Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:f8de7f709619a995eb48ef923f5cf62891d97403364a6f35c9de68b27ccf2bf9","observation_id":"99030bc0-26ea-4050-a685-58bd8e373122","resolution":{"observed_at":"2026-08-15T17:09:17.605883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-08-16T17:40:08.900487Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-08-15T17:09:17.609224Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.609224Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:882221e5c7e0ee6187636c07c69aa55d434ac7f82e959826869ea70b5a9633a7","observation_id":"196cf821-1c40-4821-b251-93dbff6c6ea7","resolution":{"observed_at":"2026-08-15T17:09:17.609224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.612998Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.612998Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:c6433053f73d8a4913369fefe34e8c85968a5d3aabf8eefcd90a1f8886a8ce1a","observation_id":"2fd5befd-2d65-4ff3-a00c-4e9608088e1a","resolution":{"observed_at":"2026-08-15T17:09:17.612998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.616473Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.616473Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:c259bafea825e3dd72b4b2def4268d56663bf0ce2a75868429a8fc827a77eb7e","observation_id":"4d087fe7-1755-40e9-98ea-16743f97646e","resolution":{"observed_at":"2026-08-15T17:09:17.616473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.620594Z","title":"HYDRA: A Hyper Agent for Dynamic Compositional Visual Reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.620594Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:a129c06a20518a209c221f8f08df5830d52441ad73b9690dbf84bc7d75302336","observation_id":"3daeb3fe-c31d-429a-a273-1e2da67a7da6","resolution":{"observed_at":"2026-08-15T17:09:17.620594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.624093Z","title":"Towards Truly Zero-shot Compositional Visual Reasoning with LLMs as Programmers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.624093Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:7893ea24dee3b48636cb50b4f14193cb9c167b9342daa7ec531f16d5c0bc79f3","observation_id":"53e0aaa8-566d-42d4-9045-52f301a33acb","resolution":{"observed_at":"2026-08-15T17:09:17.624093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-15T17:09:17.627597Z","title":"Multimodal Chain-of- Thought Reasoning: A Comprehensive Survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.627597Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:9e22abc30cb4d67dd7c759edee51d442f7aad16b3d94c259b68d27f1d11c70f7","observation_id":"b1388ad6-63e2-47fc-baad-db756fcd9eea","resolution":{"observed_at":"2026-08-15T17:09:17.627597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.631786Z","title":"Enhancing Multimodal Compositional Reasoning of Visual Language Models With Generative Negative Mining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.631786Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:c12929c74e74a09d9a5e08620ca3f6be62d8e87aa058d652b3a37298a85ff97f","observation_id":"8d1ceb2c-3880-4c4f-b55b-82c3818c16cc","resolution":{"observed_at":"2026-08-15T17:09:17.631786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.635381Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.635381Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:4f828ad6fd89c405a6a72c34ab893b70c236a5690cc0e5889fe632298746f678","observation_id":"85856c28-b570-4790-9b5d-f4e1b6ca1e72","resolution":{"observed_at":"2026-08-15T17:09:17.635381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.638828Z","title":"Cascaded Mutual Modulation for Visual Reasoning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.638828Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:12dc3b3aba10d0ac354490a843a5c719356cec6a09963ac902438ce94c57e594","observation_id":"64d1eec0-1361-4820-ad73-17f8e09fad9b","resolution":{"observed_at":"2026-08-15T17:09:17.638828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.642304Z","title":"Compositional Chain-of-Thought Prompting for Large Mul- timodal Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.642304Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:90d24f68c95dad6071ca857dc8324631328bde55d462fa93d5dec7c70e5b3ba6","observation_id":"a2df30ad-5b05-4301-9b66-9afb134bfb95","resolution":{"observed_at":"2026-08-15T17:09:17.642304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.646029Z","title":"Building Machines That Learn and Think Like People","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.646029Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:5fc048c0c24544fdbb4636ec31c731a7a547aa0ee3ddb53025393f6b175fa953","observation_id":"d784b18a-9cbd-4deb-90b5-9eda1f65b23a","resolution":{"observed_at":"2026-08-15T17:09:17.646029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.649583Z","title":"Meta Module Network for Compositional Visual Reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.649583Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:fe09c05ebad671ac32ed2ac0dbd6d3490bdaf4d871707c4a9f6f186d2fbb0f1f","observation_id":"918a7128-311b-4c4c-ad4e-de30c815e0a4","resolution":{"observed_at":"2026-08-15T17:09:17.649583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.653229Z","title":"Improving Visual Reasoning Through Semantic Representation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.653229Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:ad4fa3b36420188a5c67a60eddfedd94b221ca37729f9f4ab4450b4eab066275","observation_id":"3d198a3e-97a6-4c85-a11e-aa27679b8ef0","resolution":{"observed_at":"2026-08-15T17:09:17.653229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.656988Z","title":"What’s Left? Concept Grounding with Logic-Enhanced Foundation Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.656988Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:a70ccb9b6b63dc9f3bb759c1e3b82c831912da4e8ab1b8a46e6d9926b44e9b93","observation_id":"b25d1405-e144-46fd-ab8e-b15b530a418f","resolution":{"observed_at":"2026-08-15T17:09:17.656988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.660571Z","title":"Visual Question Answering: A Survey of Methods, Datasets, Evaluation, and Challenges","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.660571Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:12859dbc769cecc50036220b3105a2ca6eeecefc327a68917f0c2a6f26b75be9","observation_id":"683be0f2-2665-4239-afec-bcb50526e037","resolution":{"observed_at":"2026-08-15T17:09:17.660571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.664117Z","title":"Visual Question Answering: a State-of-the-Art Review","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.664117Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:11c2ee4d9d30e67520a35adce74500909523aa8fd64bab541fa1dab21e55ed78","observation_id":"fc3fc673-c443-42a2-b420-165676db93b1","resolution":{"observed_at":"2026-08-15T17:09:17.664117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.667724Z","title":"Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.667724Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:3a13cbcfef05889119fa59b245819ba7cf6271629b7f5377855d7a064ad1b717","observation_id":"2d033639-8414-435d-8263-eeebc82ec403","resolution":{"observed_at":"2026-08-15T17:09:17.667724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18071","last_updated":"2025-03-23T13:40:44Z","snapshot_observed_at":"2026-08-16T12:47:36.171272Z","submitted_at":"2025-03-23T13:40:44Z","title":"Mind with Eyes: from Language Reasoning to Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18071","snapshot_observed_at":"2026-08-15T17:09:17.671253Z","title":"Mind with Eyes: from Language Reasoning to Multimodal Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.671253Z"},"links":{"cited_paper":"/paper/2503.18071","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:4338bffa0eeab3e8296d1cb470083aa2fc138c92be30e4ab40555279825f89c8","observation_id":"e4977987-e095-4c48-8059-9b2636c812a4","resolution":{"observed_at":"2026-08-15T17:09:17.671253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.674787Z","title":"A survey of neurosymbolic visual reasoning with scene graphs and common sense knowledge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.674787Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:861fb34d5485446b2ea1a1b6c757e3b8ecbeb64ae6f54c5112c90704a5cd9cba","observation_id":"f4ae5747-05cf-4036-bf44-e2481bc8e361","resolution":{"observed_at":"2026-08-15T17:09:17.674787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.678225Z","title":"Deep Learning Methods for Abstract Visual Reasoning: A Survey on Raven’s Progressive Matrices","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.678225Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:eb26640afb6d3eb64268f51dbd18c04395c2a3e8ee2c0f2324d1297bd10e8bfa","observation_id":"c960d985-fdbd-4ba9-abb0-3c3a02cd2d7c","resolution":{"observed_at":"2026-08-15T17:09:17.678225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-08-17T12:58:57.049746Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-15T17:09:17.681651Z","title":"Large Multimodal Agents: A Survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.681651Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:b6a8ee6ea77db481908c04f09fb0eb376edb7013b0bfabde54ae51e78637440d","observation_id":"06ab9bbb-a02a-4267-a8bb-86804d9c61db","resolution":{"observed_at":"2026-08-15T17:09:17.681651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.685501Z","title":"From image to language: A critical analysis of Visual Question Answering (VQA) approaches, challenges, and opportunities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.685501Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:bb66a7e8295963455f93c76e052b7ba86c07c01fc6e92964ca3ee185c58d1aca","observation_id":"bbef4951-f830-443c-94dd-8e38f18c843d","resolution":{"observed_at":"2026-08-15T17:09:17.685501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.689858Z","title":"Robust Visual Question Answering: Datasets, Methods, and Future Challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.689858Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:0e48167cc87e8ae089b82a6232c3963a35d2684e7062911d517cb8648eca0d10","observation_id":"1c15a348-49a0-4fee-8ca8-1f237413e057","resolution":{"observed_at":"2026-08-15T17:09:17.689858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-15T17:09:17.693163Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models.arXiv preprint arXiv:2505.04921,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.693163Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:deec69860bd87f49546706a50b81f12e0de8bc9da627bd1e14bec47eefa6f09a","observation_id":"ba5105d8-c291-475e-bc8e-29ac4f2cd677","resolution":{"observed_at":"2026-08-15T17:09:17.693163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.696947Z","title":"How to Bridge the Gap Between Modalities: Survey on Multimodal Large Language Model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.696947Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:d7a2971956ffc7038da2ab3a1ec7e91c0a6dad431f82ed2a90f4cc3f40356c4f","observation_id":"94d521e2-9d73-4f3e-81d2-107b850daa29","resolution":{"observed_at":"2026-08-15T17:09:17.696947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.700806Z","title":"Tool learning with large language models: a survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.700806Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:0adec93b3575e2827d9c37dbffc14b1ec7081d56ba69a44dea694f3d48135689","observation_id":"deb20ad6-fd0f-4386-b1f4-d13d21265ad4","resolution":{"observed_at":"2026-08-15T17:09:17.700806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.704220Z","title":"Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.704220Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:b486b04d9d0850d98f6bb80e220debc961054d4cd125b3d7c9192866b274aadf","observation_id":"77ab8f79-80a7-451e-8d54-432ec300cc0d","resolution":{"observed_at":"2026-08-15T17:09:17.704220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.707897Z","title":"Multimodal Intelligence: Representation Learning, Information Fusion, and Applications","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.707897Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:a2871776de108027d3e73639b397edbbc158a78df17b7fff330de1aeca396d9e","observation_id":"02920ede-5fbd-4de5-b835-f6a418c41248","resolution":{"observed_at":"2026-08-15T17:09:17.707897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.712111Z","title":"Transformation Driven Visual Reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.712111Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:02d52d9604eca10b4c9835929ee1d224a4e2ca43e5ce6522109f778e87d790d3","observation_id":"2f2659f7-bea5-4572-afa9-8c2b0efb2b45","resolution":{"observed_at":"2026-08-15T17:09:17.712111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.716819Z","title":"Deep Residual Learning for Image Recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.716819Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:b069035bb9990a203c8b17470ceb52a18c0453932d03dd53d444d3d12fd1b00b","observation_id":"1b81e6d5-89b6-45c5-b512-b315b8302a38","resolution":{"observed_at":"2026-08-15T17:09:17.716819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.720344Z","title":"Two-stage Rule-induction visual reasoning on RPMs with an application to video prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.720344Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:89fe55b0e2ec45fc7a936fc8b66512304a42ec0f3e0bf885b30ea2336febe96d","observation_id":"b1010c49-1a83-43c7-bccc-18c96da62785","resolution":{"observed_at":"2026-08-15T17:09:17.720344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.724028Z","title":"Hierarchical ConViT with Attention-Based Relational Reasoner for Visual Analogical Reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.724028Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:01c1a5b137a6c812fe357f2ce4055d8acb9e9991f00f6fb5d404ebe6110d6a56","observation_id":"ca4d0ffc-6df0-41e3-ab35-cf09a055772c","resolution":{"observed_at":"2026-08-15T17:09:17.724028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.727468Z","title":"You Only Look Once: Unified, Real-Time Object Detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.727468Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:daabed1c2c6f1d6809f484758a651e2a39251f51f63189a966ea79c5603ad545","observation_id":"90671fdd-138e-4c0c-9b78-b6022419b97b","resolution":{"observed_at":"2026-08-15T17:09:17.727468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.730761Z","title":"Multi-Modal Factorized Bilinear Pooling With Co-Attention Learning for Visual Question Answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.730761Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:8061e70cf6f16e98cc0fb010c19490fdff65b1acdf86b2e5957fa1f1653188f3","observation_id":"688bf382-7594-46c3-b2a0-26b482a034c4","resolution":{"observed_at":"2026-08-15T17:09:17.730761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.734056Z","title":"Bilinear Attention Networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.734056Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:d22e387b27fa019bdc29493b98cd3e31e3daad07b8a5c2d9346115dcf19c18ee","observation_id":"8dde71b0-5067-4b54-af20-57d9a50dc076","resolution":{"observed_at":"2026-08-15T17:09:17.734056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.737492Z","title":"Improved Fusion of Visual and Language Representations by Dense Symmetric Co- Attention for Visual Question Answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.737492Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:5c238b9126e7a79ffca8c80f71564d702d67fe2edcde7df116cdd05918090046","observation_id":"941cd9c1-6dfe-4474-9d73-c0242e7b12d4","resolution":{"observed_at":"2026-08-15T17:09:17.737492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.741248Z","title":"Deep Modular Co-Attention Networks for Visual Question Answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.741248Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:4c8937174b37e771ef4cd0add0d961a98eadb86e3bce966d98bada38d13a82a2","observation_id":"062c41e1-e85c-4bc4-bd55-c6aedc3761e8","resolution":{"observed_at":"2026-08-15T17:09:17.741248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.745210Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.745210Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:b05a1fa53c6ae189e83eeae85d73a8746f406110afbc9fc19e64cf66cd807ec5","observation_id":"a0c7384f-0162-4842-a675-56c7f7180120","resolution":{"observed_at":"2026-08-15T17:09:17.745210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.748896Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.748896Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:a6b0aa2e0d1ee0e6fda7342d5dd99d39b8eb9246e07042320a56ebfedb6e1a7e","observation_id":"a2a5f4f7-200d-47c1-959f-5b217f210384","resolution":{"observed_at":"2026-08-15T17:09:17.748896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.752421Z","title":"UNITER: UNiversal Image-TExt Representation Learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.752421Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:19ba088147baa262ddf7139d6712bed5e57772dc9d3089fce1bde26d1618e8c8","observation_id":"b4ac0030-bd44-4619-9630-5854e783e3f8","resolution":{"observed_at":"2026-08-15T17:09:17.752421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.756195Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.756195Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:d6cea58ad8d2b5b665d99a4e6683ef5c155ad4eaeb1e248c1805b49b7d850f1d","observation_id":"55445a2a-d4e0-4e52-b950-feee7d366620","resolution":{"observed_at":"2026-08-15T17:09:17.756195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.759948Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.759948Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:f2f63f1d2318585570859c4c0cbe3d0b85426d55595f1c3f9c1dbe4b6c945f13","observation_id":"57c32c0e-3d8e-406c-be76-bceed02b541c","resolution":{"observed_at":"2026-08-15T17:09:17.759948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.763717Z","title":"Otter: A Multi-Modal Model With In-Context Instruction Tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.763717Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:3f45c6c38e5ba59b66d4c8a2405ba3271b8c8932a6c15eab41996bcfd7067977","observation_id":"2b23ce4f-6699-4b99-8f80-0196f07275b9","resolution":{"observed_at":"2026-08-15T17:09:17.763717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.767580Z","title":"CREPE: Can Vision-Language Founda- tion Models Reason Compositionally? In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 10910–10921, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.767580Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:e564b6df04882975fafdc70d5b4e4a3cadd445d5d28190c1cffd05f87dffe531","observation_id":"f7ed05ab-d852-437c-b3cd-3ff03a1c8f2a","resolution":{"observed_at":"2026-08-15T17:09:17.767580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.771070Z","title":"Logics and Languages","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.771070Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:7bf959e1ea4b030df0984aeedc78b0dd6d92fa09e03d9cd41bae903a63cab00f","observation_id":"84fb288c-bba1-47aa-91a0-ddd47bc24e45","resolution":{"observed_at":"2026-08-15T17:09:17.771070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.775107Z","title":"From Recognition to Cognition: Visual Commonsense Reasoning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.775107Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:5b4e66fe54ef2fd87219d4da817e12074585ab95b0178c84f0d5f47c1e0512be","observation_id":"f4ad16d1-0bed-4eee-960b-6027a2807b91","resolution":{"observed_at":"2026-08-15T17:09:17.775107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.778592Z","title":"Visual Programming: Compositional Visual Reasoning without Training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.778592Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:62a311652168a145dee132146c2fb8003c50c759176329eb5910687994bbb867","observation_id":"baf19ec6-f9e9-43a4-bb37-7391120e77c8","resolution":{"observed_at":"2026-08-15T17:09:17.778592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.782737Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.782737Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:6ff0cdd8ad5e6c19e05df9519a89868ac408cd4d5a226cea732a52bbea9988ab","observation_id":"99f6c90f-0741-4e80-bb46-f36ffe1334c4","resolution":{"observed_at":"2026-08-15T17:09:17.782737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.786176Z","title":"Chameleon: Plug-and-Play Compositional Reasoning with Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.786176Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:3e16fe63508469c6fbd1974641cbad3fbd2725c6252e59dd8ab9acc959cec46c","observation_id":"2bc9b9a0-95bb-4356-8361-fd0d53e5ac2c","resolution":{"observed_at":"2026-08-15T17:09:17.786176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.789732Z","title":"Bongard-HOI: Benchmarking Few-Shot Visual Reasoning for Human-Object Interactions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.789732Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:83a31dd2faf91cfaff440b410dc6b06caf194220701d5d374fec54f872f9ede1","observation_id":"42dac3b9-737c-4faa-9eaa-dd61249f1bd7","resolution":{"observed_at":"2026-08-15T17:09:17.789732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.793148Z","title":"DWIM: Towards Tool-aware Visual Reasoning via Discrepancy-aware Workflow Generation & Instruct-Masking Tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.793148Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:c598da49f7a5e2c2bdb1c254fd5004a08c396266920e319041a4dcb20a750197","observation_id":"1e1b648b-eb9d-4cd7-a375-5885712aef3d","resolution":{"observed_at":"2026-08-15T17:09:17.793148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.796395Z","title":"Iterated Learning Improves Compositionality in Large Vision-Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.796395Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:df761c21fbb10ee59e27d5349c603906e50253c41653bc5617c1eb0db69dfb76","observation_id":"219d2711-261d-4c2a-8821-b4e16c67407e","resolution":{"observed_at":"2026-08-15T17:09:17.796395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15436","last_updated":"2025-12-05T05:44:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T12:18:15Z","title":"Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15436","snapshot_observed_at":"2026-08-15T17:09:17.799892Z","title":"Chain-of-Focus: Adaptive Visual Search and Zooming for Multimodal Reasoning via RL","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.799892Z"},"links":{"cited_paper":"/paper/2505.15436","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:ecdcfd2abfc0bb504201298da1d65c44155947793d2cc70234605ec8bac952c3","observation_id":"0be00509-5529-45a1-9744-ea2ffe4877ee","resolution":{"observed_at":"2026-08-15T17:09:17.799892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.804131Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.804131Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:b761593aaec2cb5ca43d7d5f301072d86f51372210c0054f21e846e7d89255b8","observation_id":"402ae171-e88e-405b-8586-0d8f42ab9c48","resolution":{"observed_at":"2026-08-15T17:09:17.804131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.807533Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.807533Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:223dd26dd9720fbeac88fd32bb0f774e3f8d8a59feb071220a8a76490abd1a4e","observation_id":"fd81ad9a-57cb-4db9-a2e5-1c4001c63617","resolution":{"observed_at":"2026-08-15T17:09:17.807533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.810619Z","title":"Visual Compositional Learning for Human-Object Interaction Detection","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.810619Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:ae40f052b43b80f32d4869a847ade5789d923275a4adec858d449483355c8e55","observation_id":"5003c3c9-2241-4807-bf99-040ceabd0e34","resolution":{"observed_at":"2026-08-15T17:09:17.810619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.814504Z","title":"Learn- ing Visual Composition through Improved Semantic Guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.814504Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:822b932af6cc1793566a566b386b95f0e5268cc9e0d5063d62ca33b426291f93","observation_id":"768452f4-e668-425f-9073-9215c305e181","resolution":{"observed_at":"2026-08-15T17:09:17.814504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.817979Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Lan- guage","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.817979Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:272d867e3d13478f585d4470ff0df7627a99fe1c78f7df0c3a8635666669197a","observation_id":"192f2e11-89cd-4f08-a990-e135ce90ee3a","resolution":{"observed_at":"2026-08-15T17:09:17.817979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.821769Z","title":"Synthetic Visual Genome: Dense Scene Graphs at Scale with Multimodal Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.821769Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:3db5f1c12577ece7fe4247cd4418290ec9c486f4a7ab982a54e680e93cee1d79","observation_id":"8930522c-42f9-4904-9d26-9b80d0fa34ba","resolution":{"observed_at":"2026-08-15T17:09:17.821769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19322","last_updated":"2024-06-18T05:57:14Z","snapshot_observed_at":"2026-08-16T18:22:19.151071Z","submitted_at":"2024-03-28T11:26:30Z","title":"Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19322","snapshot_observed_at":"2026-08-15T17:09:17.825678Z","title":"Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.825678Z"},"links":{"cited_paper":"/paper/2403.19322","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:f8de5d640745664c7eabf55787a8582d56ca920dedfd56901fdb0c1530c43e94","observation_id":"987437d3-de0a-4659-b914-f0228fce6e58","resolution":{"observed_at":"2026-08-15T17:09:17.825678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.829651Z","title":"DisCo: Improving Compositional Generalization in Visual Reasoning through Distribution Coverage","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.829651Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:4e7264da38ce7ac76e79170fa93219be7bfcffb2ed66e5442fb01412786c176e","observation_id":"278a00d6-4fee-4601-8e17-672634a531d7","resolution":{"observed_at":"2026-08-15T17:09:17.829651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.833925Z","title":"Divide and Conquer: Answering Questions With Object Factorization and Compositional Reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.833925Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:079fe597cccae76d093f7b64891fd7d5a8b80f9004cc866d139df9a1e5c2a54f","observation_id":"29a18e16-e797-45cb-9f18-3830955ce0c2","resolution":{"observed_at":"2026-08-15T17:09:17.833925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.837525Z","title":"VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.837525Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:43640c86994549894f56533f22e615643a8a2ac44a56bdf96a25ad57c76fcaed","observation_id":"b9db1b69-797a-4db1-95d2-c85d21c96437","resolution":{"observed_at":"2026-08-15T17:09:17.837525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.840955Z","title":"Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.840955Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:671dd8874fac2981957cf158d2d49220c65495e849858609f17e0a55d3c4826f","observation_id":"f2878906-a8f7-4076-99eb-00848f53b154","resolution":{"observed_at":"2026-08-15T17:09:17.840955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.844636Z","title":"From the Least to the Most: Building a Plug-and-Play Visual Reasoner via Data Synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.844636Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:17902efdc7593a7d9fbc77d41029659c9c006abef4a02dc0409e791493f91baf","observation_id":"9da7e67f-463c-45f7-bad2-459093ead803","resolution":{"observed_at":"2026-08-15T17:09:17.844636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-08-16T16:52:49.240000Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-08-15T17:09:17.848322Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.848322Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:a970a3047e1d133422650ce30c03122d00e31b203ca9ecc193c4667d1724cd77","observation_id":"604da5ec-4610-4637-958d-0ea41dd807fb","resolution":{"observed_at":"2026-08-15T17:09:17.848322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13872","last_updated":"2024-05-29T02:24:36Z","snapshot_observed_at":"2026-08-16T13:50:31.641345Z","submitted_at":"2024-05-22T17:56:51Z","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13872","snapshot_observed_at":"2026-08-15T17:09:17.852321Z","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.852321Z"},"links":{"cited_paper":"/paper/2405.13872","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:0b8216c2103ffa733ea12da978f387aa8bab2dae651d8b5a94f3a645f006f1d4","observation_id":"61c5613e-7010-4d73-8542-7ce9f4cea9a7","resolution":{"observed_at":"2026-08-15T17:09:17.852321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-08-17T12:24:00.878640Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-15T17:09:17.857411Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.857411Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:c215734988e0623893d6e91436b72063c98094acaef0f83dd947e76a3680f447","observation_id":"fb4e0f90-1e84-4ef2-953a-0144669a021b","resolution":{"observed_at":"2026-08-15T17:09:17.857411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-16T12:49:29.988082Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-15T17:09:17.861449Z","title":"Grounded Chain-of- Thought for Multimodal Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.861449Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:5a299e6d904272f9ea048c69250c9e6924236b12fcf200546519748aaefe7e08","observation_id":"a50aad1e-035b-4fc0-94c0-b621b2a5082a","resolution":{"observed_at":"2026-08-15T17:09:17.861449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.865349Z","title":"NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.865349Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:cf6d8f57bbc054d11f983b3d2bf1573dc23be8cc35ad8dccd05518d9275358df","observation_id":"cd5e1b7d-bb3d-48b5-9f69-0480c2afb333","resolution":{"observed_at":"2026-08-15T17:09:17.865349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.868949Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.868949Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:37184df3f0b9227a434c0aff74406d12283e4c4e44d127992ec4d0b217905926","observation_id":"4b9dacbf-46aa-4491-8e98-36ae4e4777fe","resolution":{"observed_at":"2026-08-15T17:09:17.868949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.872314Z","title":"ConceptMix: A Compositional Image Generation Benchmark with Controllable Difficulty","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.872314Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:0a8e725ebabf5270f5a51aae95cbaedb06451bfae857c455e895772c023d0f69","observation_id":"e37c4b36-3475-43e2-af63-4f2ab3164986","resolution":{"observed_at":"2026-08-15T17:09:17.872314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.875627Z","title":"Visual Reasoning by Progressive Module Networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.875627Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:957e1ea2a06627d1ab9f000cc7b972ecc38777bc1e00b45fc50063102db27484","observation_id":"bb85a1dc-0e06-459c-8797-1cbb510a0bbb","resolution":{"observed_at":"2026-08-15T17:09:17.875627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12481","last_updated":"2025-02-18T03:08:37Z","snapshot_observed_at":"2026-08-17T07:37:12.297021Z","submitted_at":"2025-02-18T03:08:37Z","title":"Predicate Hierarchies Improve Few-Shot State Classification","version":1},"cited_work":{"arxiv_id":"2502.12481","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.12481","snapshot_observed_at":"2026-08-15T17:09:19.338061Z","title":"Predicate Hierarchies Improve Few-Shot State Classification","venue":"cs.CV","work_id":"25c7517b-489b-41da-a269-31a9bd5c2dfa","year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.878832Z"},"links":{"cited_paper":"/paper/2502.12481","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:38a7942e1edc3f72b1dcc2e89db73788ac6160ea987a2d2a1033fe0913b195c0","observation_id":"b1c5f0c2-31fa-45fc-8e88-0d21b6eb56a9","resolution":{"observed_at":"2026-08-15T17:09:19.342455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.882743Z","title":"Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.882743Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:0cae226597174c8d5cd1358db2c1e8cf629b101f34bfbf1fda06c11e5a710bb8","observation_id":"bf64629d-8068-4973-8e84-c06fc4d03311","resolution":{"observed_at":"2026-08-15T17:09:17.882743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":266},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 266 outbound references and 18 inbound Pith citation observations for arXiv:2508.17298."}