{"as_of":"2026-08-14T14:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:016c78065cd12df410c409ef83f2fd8ec8723a60f306aadca4fd46896767df37","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T01:12:22.931098Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T04:55:06.999018Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07106","snapshot_observed_at":"2026-07-31T04:55:06.999018Z","title":"Retrieve, integrate, and synthesize: Spatial-semantic grounded latent visual reasoning.arXiv preprint arXiv:2605.07106,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28516","last_updated":"2026-07-30T16:55:00Z","snapshot_observed_at":"2026-08-10T14:40:08.313631Z","submitted_at":"2026-07-30T16:55:00Z","title":"Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T04:55:06.999018Z"},"links":{"cited_paper":"/paper/2605.07106","citing_paper":"/paper/2607.28516"},"observation_digest":"sha256:ebde82d6581d0dcd3256444f4c95947f8e08950deae5e17c288cb5ce0f9ca155","observation_id":"7a903fe6-ff2c-4282-b772-bc3acbc5e319","resolution":{"observed_at":"2026-07-31T04:55:06.999018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.07106/citation-record","integrity":"/paper/2605.07106/integrity","json":"/paper/2605.07106/citation-record.json","paper":"/paper/2605.07106"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.595164Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"a3ac3b4d-8c58-4772-ad55-18e8fb162bd1","year":2022},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:530fea8b106b73e661e99da98429e108f5975b2230bd1a3ae43b5f32e27c64b0","observation_id":"f30be200-80c3-4379-a9f3-a4352cdede76","resolution":{"observed_at":"2026-05-14T17:27:31.373546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.030675Z","title":"Large language models are zero-shot reasoners.Advances in neural information processing systems, 35:22199–22213","venue":null,"work_id":"4e01a1de-c54d-4105-8a25-d2d9c98bbc5a","year":2022},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:937044bea8ce13d5749cd5a02da3fb09dcea0f9cb5f78c415acd0c91741a9520","observation_id":"2a2659ef-4497-472f-947e-1bc1c23f2b93","resolution":{"observed_at":"2026-05-14T17:27:31.383327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"1a0c8b15-d0e9-4ea0-8e2b-6f2deddb8f47","year":2022},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:d539ef76e7d33a1eb38eda55781f90046689d100a6ee6cc2e5e2518c50049ae0","observation_id":"b718ad6d-f801-4db6-aea0-66706690e3f9","resolution":{"observed_at":"2026-05-14T17:27:31.366423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-08-13T14:15:32.704144Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":"2506.23918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-07-11T03:17:51.399835Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","venue":"cs.CV","work_id":"760ebd7d-977d-4280-afae-adb421d49ed4","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:4431d6f3910c74193d935e8157b4c3f7808a30d41de5a017051138e4678a8f58","observation_id":"19d474a0-ae56-435c-92a8-b4c16eccf2b3","resolution":{"observed_at":"2026-05-13T08:34:23.540456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":"2303.11381","doi":"10.48550/arxiv.2303.11381","metadata_source":"pith","pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","venue":"cs.CV","work_id":"6dc43db8-227d-438e-8658-0c8acecba08a","year":2023},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:0f8e20f977ed755aeab318763f9f9b426abc680e45b7e431646e3eaddf1b5864","observation_id":"3adfb8e0-4d71-4e5f-b3a2-9fb6e0822618","resolution":{"observed_at":"2026-05-14T01:17:58.977376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"1010b0c0-3433-41fc-9eb2-09bd3c057fec","year":2024},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:1f954a96c613d3efabc9e1fbb3e5dcddb3e6a57ccf6580b99197c683c86d716d","observation_id":"e5d4afc5-7a43-4bcf-9b08-e5f02efe6293","resolution":{"observed_at":"2026-05-14T17:27:31.445108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23590","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jigsaw-r1: A study of rule-based visual reinforcement learning with jigsaw puzzles","venue":null,"work_id":"659e85ba-e742-4f40-866a-7c14ea27eb37","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:ddd083a4bf6458c7730be9c52ebc21c54d3ed170f4ed40ecaa3d581ffdc42906","observation_id":"730654a4-c88c-4cf8-9781-d7fc512a27e9","resolution":{"observed_at":"2026-05-11T04:35:59.640305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":"9f2cc711-91e5-4b8c-b6c8-51348698a7ed","year":2023},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:5abe40a6d3fa140167ecba2a8317d54b3075a3b2b7439be7c2ce1a0cfe9597b5","observation_id":"772fc35f-fb3f-4c72-8320-ed114569a506","resolution":{"observed_at":"2026-05-14T17:27:31.452265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.759888Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"508e14a6-ab4c-40aa-852c-82323b429767","year":2023},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:649421434ccb2c20c1623cfae9896296e6153d1c475dcaa04a98f1dda42f8349","observation_id":"049a28f5-82cd-4c0b-9b02-2f215d44fe27","resolution":{"observed_at":"2026-05-14T17:27:31.468839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual program distillation: Distilling tools and program- matic reasoning into vision-language models","venue":null,"work_id":"6d424d53-1289-4e03-bd0e-6da916f5631f","year":2024},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:352c1dbceac9dd027a0113e63d22ffbf85f4d86c70b0511f05f5fc264c74ee30","observation_id":"fd48fd69-35e0-4bb2-804c-a5b2753e6e72","resolution":{"observed_at":"2026-05-14T17:27:31.437297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"cited_work":{"arxiv_id":"2604.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.02029","snapshot_observed_at":"2026-07-09T05:36:01.166323Z","title":"The latent space: Foundation, evolution, mechanism, ability, and outlook.arXiv preprint arXiv:2604.02029","venue":"cs.AI","work_id":"66adad9d-c3df-4cf7-9601-cf9d67d19ef5","year":2026},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2604.02029","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:94dd3fff3cfbe09b6eab249e433ca4d4525f1b47aeec07f9596079476dabd304","observation_id":"29593fa8-184e-4cd6-a4a2-33cad8972be6","resolution":{"observed_at":"2026-06-08T02:03:55.088792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-08-10T21:20:13.670725Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2509.24251","doi":"10.48550/arxiv.2509.24251","metadata_source":"pith","pith_arxiv_id":"2509.24251","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Latent Visual Reasoning","venue":"cs.CV","work_id":"b6468cfa-4f13-4e02-b0ec-24ff5cd6785a","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2509.24251","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:d30c1b67ce25ec01e0bd5306c42d649cfb86e945d0100644925772a57b43bbb6","observation_id":"402a1fec-1c14-4069-919b-65d696137a6b","resolution":{"observed_at":"2026-05-15T18:41:30.500607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.21395","doi":"10.48550/arxiv.2511.21395","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Monet: Reasoning in latent visual space beyond images and language","venue":"ArXiv.org","work_id":"ce4ac531-7907-4d8a-afe2-9a0dae21ffa5","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:af6e4cfef17aff368dc5c47622b7d39d5b84de1e6769ade10962d6e8de041726","observation_id":"5da0f996-d261-4397-a636-c57c874ce105","resolution":{"observed_at":"2026-05-11T04:35:59.550348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-06T01:15:52.220969Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"cited_work":{"arxiv_id":"2602.22766","doi":"10.48550/arxiv.2602.22766","metadata_source":"pith","pith_arxiv_id":"2602.22766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagination helps visual reasoning, but not yet in latent space","venue":"cs.CL","work_id":"3c18fa46-7ceb-410e-bbbb-a4b656259287","year":2026},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2602.22766","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:a89160711783278e1c9a2ca543a6dd4918d9b0e28cc4b9f1784a2d5b5b80df19","observation_id":"1f98e667-4a78-42f7-afa9-c586a6b07fe4","resolution":{"observed_at":"2026-06-09T02:06:14.979939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:55efd0e6270a7ce5910a2d5a91f2c87f368188f7ecf75c8b30dc1cf746630382","observation_id":"151ac1cc-7389-4b8c-9675-c8f91395a498","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2503.12605","doi":"10.48550/arxiv.2503.12605","metadata_source":"pith","pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","venue":"cs.CV","work_id":"a8fbb385-8ed1-4952-9ee8-8d03be2b6821","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:e343efa4ad7185d72c875a76e0115f5fbb46da53f1b3133ff7834b42fa6114b1","observation_id":"3ea7456d-c685-4ce1-bd30-b3387d2be9ef","resolution":{"observed_at":"2026-05-15T17:18:53.866178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":"2412.06769","doi":"10.48550/arxiv.2412.06769","metadata_source":"pith","pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","venue":"cs.CL","work_id":"3ddd0fd2-c176-408f-9b58-0666c2707f2d","year":2024},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:926eb2215bcd51e4a031d03e068bd20ca88d3385acad5f163515cea90de53205","observation_id":"24f70aeb-2147-4bdd-98a5-b9771943db9d","resolution":{"observed_at":"2026-05-11T10:29:05.896693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:51:35.620761Z","title":"Codi: Com- pressing chain-of-thought into continuous space via self-distillation","venue":null,"work_id":"1a10cfac-e21f-4603-9bcd-6bd82a9489d4","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:e97fa10ca6c1a2b2f11df0197de9184132326b63699f0bd716f1beac7f1b7c7c","observation_id":"e5910887-2f0f-4c79-8e06-dd73ae5c1bbc","resolution":{"observed_at":"2026-05-14T17:27:31.461386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15522","doi":"10.48550/arxiv.2510.15522","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fan, Y ., He, X., Yang, D., Zheng, K., Kuo, C.-C., Zheng, Y ., Narayanaraju, S","venue":"ArXiv.org","work_id":"61635942-d332-438e-bf44-97a5c1ecfc83","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:60b1cd22dbd120d11be5094e03de472844caf946779dd246c460418689264dc8","observation_id":"4cbd606c-8f58-4820-8a63-acba136633d7","resolution":{"observed_at":"2026-05-11T04:35:59.524353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-13T03:28:19.590253Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:bbfc99652eb8c3d849a81e98c19fd9091a5d8372c0dfe46faf304bb0440e9ff4","observation_id":"b3257744-8fbc-4791-9ae0-3a7d3ed086b0","resolution":{"observed_at":"2026-05-11T04:35:59.653902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hudson and Christopher D","venue":null,"work_id":"ed354ba0-828f-4e70-8f33-74d09ecfc386","year":2019},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:6c51aa00a216bb6fcf561030f5c8390257464f0ceb5e138fe64e4af76e98bab6","observation_id":"ade04805-f270-47f2-9564-23bc3b7da21f","resolution":{"observed_at":"2026-05-14T17:27:31.388478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":"2303.05499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-10T23:17:45.410080Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":"cs.CV","work_id":"3757dc8f-79d5-4beb-a03b-eb4c9a33427d","year":2023},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:af7c5ca169fe0afb38fb5c30b584134e5c5950b65abfafb532e3ab4cbe0ffb1c","observation_id":"17493145-aec6-408f-828c-c56646fb4f58","resolution":{"observed_at":"2026-05-11T04:35:59.609673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:13:49.537511Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":"8cce8101-1a0a-4da5-a8d4-8b72b9d0c60f","year":null},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:72a31dac77d9466be4beab0f5dd0d540e2cb17da77af79f5d302297055c6c956","observation_id":"0ecea5ee-58eb-4429-967f-0d32834f2e75","resolution":{"observed_at":"2026-05-14T17:27:31.399164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:999e044672e564d3278ac4cf61a7f2c8d4657c5c28a180a3b7e26ff7c3c5f911","observation_id":"4fd9394f-8fca-4044-86be-7736e1e946ca","resolution":{"observed_at":"2026-05-11T04:35:59.633185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2733.2024","doi":"10.1109/cvpr52733.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emogen: Emotional image content generation with text-to-image diffusion models","venue":null,"work_id":"7efbc2dd-b0f2-4f71-bb1c-d2fcf110d805","year":2024},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:e1030b2942fac2be9d77fc203c24f464bea9fcb8139a507c347c804c91f4be83","observation_id":"a309c390-f6e4-4aca-8955-d4c92ae5057b","resolution":{"observed_at":"2026-05-11T01:15:51.823830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:26.559218+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:26.559218+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.577684Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models","venue":null,"work_id":"18e020b7-d80c-49a4-9868-c69a03ba15de","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:a75d11898e78fca148c6083111ea43da7d7c8111acea01874981bbd0f5d00408","observation_id":"53566c6c-b41a-4d84-b6ff-701b49d4a4b9","resolution":{"observed_at":"2026-05-14T17:27:31.409051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.559513Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"b6e49ece-cf6b-436a-987f-4e6e369d5b22","year":2024},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:bbcb8a4417f684324d7d2b1fe18a37b0b1244aaf4168028d7e721261c509f26a","observation_id":"b2a722a3-2039-47e8-943d-ca67f1c46170","resolution":{"observed_at":"2026-05-14T17:27:31.428672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:51:35.594632Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":"0f53fdf1-7151-4197-86a2-081455a42131","year":2024},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:b4962d0b3e3eaa80471704f0bd7df2e0c338f4d5487f0bddf9a01a69df5a27f5","observation_id":"ab48df36-fd47-46a8-af7d-1414478f447a","resolution":{"observed_at":"2026-05-14T17:27:31.420059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-12T19:08:23.336705Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:569073d0b2ef071aade64caaf3e1aa61384e5336a7b0e7112513e1ee9d899270","observation_id":"dde8b3f4-8951-41de-841d-81380f1b3855","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":14,"verified_fuzzy":13},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2605.07106."}