{"as_of":"2026-08-10T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b46fbe7bdcbeb9ceb233f4bc17f46309ffb74a0200f162efbe0991e92f0bd4d","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:30:23.447065Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01709/citation-record","integrity":"/paper/2608.01709/integrity","json":"/paper/2608.01709/citation-record.json","paper":"/paper/2608.01709"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:25.058503Z","title":"MineDojo: Building open- ended embodied agents with internet-scale knowledge,","venue":null,"work_id":"21644ce1-34ae-46a2-bbf6-9287be9bac27","year":2022},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.283714Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:8c18a98eecd23457e16c09297b07b161c029a72051370e45677453bf2f423a01","observation_id":"87dc45e4-5c3a-4b44-b641-e9305154b74e","resolution":{"observed_at":"2026-08-04T22:30:25.062789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:25.043788Z","title":"Guiding long-horizon task and motion planning with vision language models,","venue":null,"work_id":"526ba7ef-980c-41fa-8a4d-44e542da8a69","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.290888Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:d126f453a5fd1595c8ba4d43ebe9fb32f5725235be761a62ea5e6f51ef37d600","observation_id":"0298819c-8cbf-4328-a7a1-ce84e788a605","resolution":{"observed_at":"2026-08-04T22:30:25.048813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:25.029446Z","title":"RoboSpatial: Teaching spatial understanding to 2D and 3D vision- language models for robotics,","venue":null,"work_id":"ae736c87-c8e9-40b7-a0fe-60b69d25b0a2","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.296266Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:57c3c2daf1d8f1ba945c0def7551d7ea69a2d2bf0d5930e623b56afdecd44278","observation_id":"0e2cf3ad-b986-4786-b06d-431500771a15","resolution":{"observed_at":"2026-08-04T22:30:25.033839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T22:30:23.301651Z","title":"GPT-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.301651Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:9b2deb52781c24ca362fc9a36d0a334d30211a51f1a80f2d4a1481fcb7a0b67e","observation_id":"e059d53f-7add-4df2-8310-8f46e39ad889","resolution":{"observed_at":"2026-08-04T22:30:23.301651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T22:30:23.306951Z","title":"Qwen2.5-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.306951Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:1846fa33ffbfb2a285caacc2ac79cd3acdd0b6887e0fbad25c257f6fbfc68961","observation_id":"88cd2bc2-5f58-48c9-b623-af5589a23aea","resolution":{"observed_at":"2026-08-04T22:30:23.306951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-04T22:30:23.311855Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.311855Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:8a2d17cbf06f4432f2685dc37de41cea5fe1c3e7913aef12dec322b4e357089d","observation_id":"2c2728c8-37d0-4036-a589-887823782f92","resolution":{"observed_at":"2026-08-04T22:30:23.311855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:25.015405Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities,","venue":null,"work_id":"b1b1b967-c535-486f-904f-0ed5b7465fc8","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.317415Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:d27e7cf49dc3f7e99ac9e7f014ebd7fbcb3f42b6cff708c8ffd097103052ebc8","observation_id":"c7ba22f9-c844-40a4-a82c-974a8572ea26","resolution":{"observed_at":"2026-08-04T22:30:25.019844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.976499Z","title":"SpatialRGPT: Grounded spatial reasoning in vision language models,","venue":null,"work_id":"ca75ebb4-17bc-4f1b-9dc2-149783362f2b","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.321859Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:e8c68ae8407ac8e37b9ccfe8296e98c636f2dac8289f02c995f0d75544015d95","observation_id":"7780fd84-6fd8-4081-a9f1-6dc0f4b9312d","resolution":{"observed_at":"2026-08-04T22:30:23.981742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.961581Z","title":"Depth Pro: Sharp monocular metric depth in less than a second,","venue":null,"work_id":"b4260191-9765-4909-91e5-053f6ddc376d","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.326320Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:fbf9030c289de1eda115b6c0e707e7c276d111bfb4e6f7e8d50ae023e282d310","observation_id":"0af0b425-a73e-4e18-bdec-9a14837c73c1","resolution":{"observed_at":"2026-08-04T22:30:23.966492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.946556Z","title":"SpatialPIN: Enhancing spatial reasoning capabilities of vision-language models through prompting and interacting 3D priors,","venue":null,"work_id":"6d0cb673-9618-40be-858d-90b265cd59fe","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.330689Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:d870b54df7bca5b8bfb122cbabb05227da0752d56b48fecbfb69d14d16df7bf0","observation_id":"c095fd52-af47-432e-bba2-c8b4e30fe240","resolution":{"observed_at":"2026-08-04T22:30:23.951835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.334788Z","title":"Spatial reasoning with vision-language models in ego-centric multi-view scenes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.334788Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:87fbdcb767d20e9388545819b27e957d35c1f31c50bcccd165a0a04c3ca81622","observation_id":"d0a5471f-d938-4158-b714-03cfe772a3aa","resolution":{"observed_at":"2026-08-04T22:30:23.334788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.930430Z","title":"Talk2BEV: Language-enhanced bird’s-eye view maps for autonomous driving,","venue":null,"work_id":"6dfa37d5-deed-4854-a3c4-fabe44c4a2e0","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.339916Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:f22abdd53432e912203f693ded1edf027ff64fe51168d19b042b77bad942d289","observation_id":"61b5f3fd-bcbb-40fb-8227-3e6125283936","resolution":{"observed_at":"2026-08-04T22:30:23.935532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.915279Z","title":"BLINK: Multimodal large language models can see but not perceive,","venue":null,"work_id":"a553c2c1-822c-4070-b496-c8928317ed32","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.344222Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:48382a84402c45b56146435519a7f692478e3bfc369edaf13ce0025da75fc2e2","observation_id":"379014f2-0657-4b13-bf6c-f11a96ad612e","resolution":{"observed_at":"2026-08-04T22:30:23.920062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.898029Z","title":"Does spatial cognition emerge in frontier models?","venue":null,"work_id":"135892d7-8c50-4df6-85c4-1a3fbd879ced","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.348928Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:ce4cd677b3c047c11d2c9f2eb9c5a4def34dd68e383fef6d3083626079374c19","observation_id":"92576b2f-e40d-428d-b5b6-4d2fece80fc6","resolution":{"observed_at":"2026-08-04T22:30:23.904450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.881672Z","title":"3DSRBench: A comprehensive 3D spatial reasoning bench- mark,","venue":null,"work_id":"7812c326-f5d6-43b6-bb24-3f1f08a4e2e8","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.353214Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:578b9d007ae2e5250d75a01f0d560d1a8088d12e64641291caacdbf82f793315","observation_id":"10da9520-ed85-4023-899a-c9abdafac454","resolution":{"observed_at":"2026-08-04T22:30:23.886760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.865796Z","title":"Do vision-language models represent space and how? evaluating spatial frame of reference under ambiguities,","venue":null,"work_id":"32f9faca-5559-4738-89d6-d64d2b16d47d","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.357336Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:ebec907a0a732d8519b3e54e22f6b39e49e6ad384971e39811190e844f4c1f71","observation_id":"52425481-1a17-43f5-a128-b77b882d059c","resolution":{"observed_at":"2026-08-04T22:30:23.870793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12969","last_updated":"2024-09-02T16:32:03Z","snapshot_observed_at":"2026-07-06T19:18:21.930632Z","submitted_at":"2024-09-02T16:32:03Z","title":"Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12969","snapshot_observed_at":"2026-08-04T22:30:23.362399Z","title":"Seeing through their eyes: Evaluating visual perspective taking in vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.362399Z"},"links":{"cited_paper":"/paper/2409.12969","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:4619cf14a646bdd6ae6b981c94aa71e8df4b4a6189617ac985beb08bdfcc9fe5","observation_id":"a188f309-9bbc-4fe2-99cd-3c1766bfa726","resolution":{"observed_at":"2026-08-04T22:30:23.362399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.849637Z","title":"Perspective- aware reasoning in vision-language models via mental imagery simula- tion,","venue":null,"work_id":"0bce1e38-5a5d-4634-931c-2730bc40cf01","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.367294Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:93bfc4f63123e68e57aeea0d6e813b7b13a457b70da64e142c5ec3f859ffd6aa","observation_id":"f656a0d9-57bc-4b85-b574-913e22555982","resolution":{"observed_at":"2026-08-04T22:30:23.854558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.833327Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":"c811a26a-4833-4a23-bad3-5b9444837abf","year":2022},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.371626Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:3c3f1c572f00cac006d7f555aad600ff277f45521a62d8c04d16851b03b44537","observation_id":"68fe7054-dc93-4cc0-a620-c70ac1b07b1d","resolution":{"observed_at":"2026-08-04T22:30:23.838503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-04T22:30:23.376141Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in GPT-4V,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.376141Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:83e170afedf279aa047a40b6a87db2b2eccf95520f959b14a0e6e16d0901ad86","observation_id":"476a93d6-80f9-4514-bf07-ed793b2fd837","resolution":{"observed_at":"2026-08-04T22:30:23.376141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.817047Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models,","venue":null,"work_id":"caf813e6-cfcb-4fb6-9665-f49ff9dcb8ac","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.381375Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:cdb13a7cb5f34ad42864b20e2ff6eb7586a22515ea8108202019da54b13a3939","observation_id":"7f30990f-4b6e-424d-8950-e472965b64d5","resolution":{"observed_at":"2026-08-04T22:30:23.822322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-04T22:30:23.385878Z","title":"Qwen-VL: A versatile vision-language model for un- derstanding, localization, text reading, and beyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.385878Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:6ba4524e790cd72db63e238ce623659d7300f3a4c1765c9adcc615ed71b11ffe","observation_id":"519062f1-9c41-454c-9c55-856aa0b2c012","resolution":{"observed_at":"2026-08-04T22:30:23.385878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.799375Z","title":"Grounding DINO: Marrying DINO with grounded pre- training for open-set object detection,","venue":null,"work_id":"8545f034-84c3-4b5b-99ec-c2e781f985a6","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.390647Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:d6a951801074b01526b570c6a1fac917b30d5faec08659a54cda69cb2e3a753e","observation_id":"ca127aa8-a717-4cf9-9b82-6f0af81548ff","resolution":{"observed_at":"2026-08-04T22:30:23.804991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.780072Z","title":"SAM 3: Segment anything with concepts,","venue":null,"work_id":"ce9c2e7b-c7e9-4505-8017-313501afaf03","year":null},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.395556Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:c9c9c8e8406935063eb3405635ff29c36fec00c28632ad828e14a5a6e0a96188","observation_id":"c9ef6415-a750-4044-bbf2-9d2b8d5436b6","resolution":{"observed_at":"2026-08-04T22:30:23.785581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.762825Z","title":"MM-Spatial: Exploring 3D spatial understanding in multimodal LLMs,","venue":null,"work_id":"16d177d1-e7d2-4e3c-8b86-1f13af228695","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.404699Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:966d088c4531d05f45db7e8c9bc4ce623079f1f96fafe54afcf464003ec4a768","observation_id":"5d7dcb07-d277-4052-902e-303b3de99b80","resolution":{"observed_at":"2026-08-04T22:30:23.768789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.746419Z","title":"Cubify anything: Scaling indoor 3D object detection,","venue":null,"work_id":"55e6b634-b512-48b1-9d38-ee380c9b7edc","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.409810Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:f293f0f0a83cf065b82798cc252722a08b7cb996494a0f6fa830d4641a4bd9dd","observation_id":"5ca7e6ad-3183-4a31-91e3-627813761065","resolution":{"observed_at":"2026-08-04T22:30:23.752144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.728737Z","title":"Visual spatial reasoning,","venue":null,"work_id":"db5e66a0-5b54-480f-bfaf-844d000a7887","year":2023},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.414585Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:c1cef87e7f0968e4f810919f520f623335ce23fd779dc780ea4a2cede6411f8a","observation_id":"50d942a0-c2a3-4ed8-81c3-544d2814d9e5","resolution":{"observed_at":"2026-08-04T22:30:23.733925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.710724Z","title":"SQA3D: Situated question answering in 3D scenes,","venue":null,"work_id":"d39cc7c2-d283-473c-a350-370cc5888fdc","year":2023},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.419014Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:e1dc1fd7a210cd71772a9285b676603bed011d96ec280348839f38b2e6b31194","observation_id":"464a342f-43ad-40ed-87d0-2c1a875fdc33","resolution":{"observed_at":"2026-08-04T22:30:23.715872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16170","last_updated":"2023-12-26T18:59:11Z","snapshot_observed_at":"2026-07-06T17:08:12.928414Z","submitted_at":"2023-12-26T18:59:11Z","title":"EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16170","snapshot_observed_at":"2026-08-04T22:30:23.423033Z","title":"EmbodiedScan: A holistic multi-modal 3D perception suite towards embodied AI,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.423033Z"},"links":{"cited_paper":"/paper/2312.16170","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:06c2dead97c41da3a1a1c1024447bc5250b071da0b306a69fd17ae6d301c5a1e","observation_id":"687b4756-2895-497f-a76b-87570acbe809","resolution":{"observed_at":"2026-08-04T22:30:23.423033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.694378Z","title":"GPT-4o mini: Advancing cost-efficient intelligence,","venue":null,"work_id":"5ac06837-eb8a-488f-9627-44f486530563","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.428269Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:e7bc092f9f125e6fab95df2e26445347adfd653e5d5f5c0c32659f3a33a48241","observation_id":"c9df14e3-ee49-4a38-a992-99480078df7e","resolution":{"observed_at":"2026-08-04T22:30:23.699368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T22:30:23.433519Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.433519Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:f80bcead00111c210a9e8c6ed4bf77b29e86fe23ef93af71c58a8d78a8d4da98","observation_id":"cb2cf448-7aa0-448b-b327-272763c575e6","resolution":{"observed_at":"2026-08-04T22:30:23.433519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.678436Z","title":"SpaceThinker-Qwen2.5VL-3B: A thinking/reasoning VLM for quantitative spatial reasoning,","venue":null,"work_id":"2e58d896-d728-41df-b0c7-b5e229f793e1","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.438252Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:8e9252d1bfef62347eb8c8dc2c432b4d93640c80b1f81d5dfe8e46dfac431b2e","observation_id":"3a236af2-8546-427e-8fd4-cb0e601b11cf","resolution":{"observed_at":"2026-08-04T22:30:23.683097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.659761Z","title":"SpaceOm: Spatial reasoning with extended thinking traces,","venue":null,"work_id":"a8fa73d0-3caa-4f5b-836c-4f4077818aea","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.442696Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:377542b2f1fbae19eaf61a3746d02e16574f62f5319b19c75e369ab96362683e","observation_id":"6ea41c6d-42eb-4ab2-9905-b6372b374b1b","resolution":{"observed_at":"2026-08-04T22:30:23.667452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.639186Z","title":"Spatial-SSRL: Enhancing spatial understanding via self- supervised reinforcement learning,","venue":null,"work_id":"1f0ea5c0-2642-4dc2-bb14-62eeacc8084b","year":2026},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.447065Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:3fff5b40ca9ecb07d8036adadbda1ff1e526ec448395614e35932140256b70b6","observation_id":"4a941714-7708-4e66-a5ee-6ccbe85f1a95","resolution":{"observed_at":"2026-08-04T22:30:23.647404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-04T22:30:23.400209Z","title":"Available: https://arxiv.org/abs/2511.16719","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.400209Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:6365a19a5539dc71d74b5fc6276958a15288f54d18096838cc2bacf162d8c775","observation_id":"d991c080-7989-47ed-92cf-c07e2497874b","resolution":{"observed_at":"2026-08-04T22:30:23.400209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T02:12:26.060653Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2608.01709."}