{"as_of":"2026-08-10T02:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02d883975ac49373f1aa91bcbf6a295337ca94fc80756989da9701c9bf1b1628","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:38:58.579422Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.19119/citation-record","integrity":"/paper/2511.19119/integrity","json":"/paper/2511.19119/citation-record.json","paper":"/paper/2511.19119"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:54.657295Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.657295Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:ee1cf04b1bef66c8ae7a469bec557c5b686b17f585abe0c052550bd74af9c8b2","observation_id":"6171e5a5-9779-4182-b1c1-21820f9db851","resolution":{"observed_at":"2026-08-03T20:38:54.657295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:54.706106Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.706106Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:cb1d2578aa5cdbbcdc09ab794548e1af8d33792c0b522e04711ac1eead69da64","observation_id":"94e10a9f-6b82-451b-a339-8de016a6fb1e","resolution":{"observed_at":"2026-08-03T20:38:54.706106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T20:38:54.781179Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.781179Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:6a4a5576a2cb8fbad8462c413e495134980caed42deba5f7da1b1a95d4e1ea5e","observation_id":"12207c0e-8757-48fe-8568-fd461fa8b6be","resolution":{"observed_at":"2026-08-03T20:38:54.781179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-03T20:38:54.831472Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.831472Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:c492f4cfb41eaa66de9e9ac5e002a27f49654a527a22074f3c2850dacd04aac9","observation_id":"710d92b2-ac15-4abf-bc0b-12b491aa1962","resolution":{"observed_at":"2026-08-03T20:38:54.831472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:54.864656Z","title":"Omni3d: A large benchmark and model for 3d object detection in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.864656Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:ff4546f863b1e105f14b0c4f8a4394ed01e60e59752d32f59b95f790e3ae436a","observation_id":"0fd9d04f-37b2-42d8-a1e5-62fe5678f162","resolution":{"observed_at":"2026-08-03T20:38:54.864656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-09T16:57:03.077389Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-03T20:38:54.925300Z","title":"Spatialbot: Precise spatial understanding with vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.925300Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:5460d6340ff9be99541ded319e1ab34b12018b9854b3b32f1db1c62349ee9be3","observation_id":"89fc6ba7-bae3-419e-9de8-09a4738a8d4a","resolution":{"observed_at":"2026-08-03T20:38:54.925300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:54.954815Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.954815Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:94253fe59f9351ac26606a1a647c446f6ffd617b0b681a73b778958a883145b3","observation_id":"1c086a39-011b-49a0-9149-adc2640e85c3","resolution":{"observed_at":"2026-08-03T20:38:54.954815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:54.974631Z","title":"Perception before reasoning: Two-stage reinforce- ment learning for visual reasoning in vision-language mod- els.arXiv preprint arXiv:2509.13031, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.974631Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:41ce161a31ee314b04fc67a03b08a994025fb4b5b83466c73821083de939df4d","observation_id":"6c6b597c-a254-49e1-ab03-f7a18a027b21","resolution":{"observed_at":"2026-08-03T20:38:54.974631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.015330Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.015330Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:adc1b0143256d0b9786d43b9b8c52eadb3c1ff573f7d1987a3bf56f773e6578b","observation_id":"a8942ee0-7dbf-45b9-ac42-d7d87e28b24f","resolution":{"observed_at":"2026-08-03T20:38:55.015330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.028226Z","title":"Collins, Ilia Sucholutsky, Umang Bhatt, Kartik Chandra, Lionel Wong, Mina Lee, Cedegao E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.028226Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:5cc83b0381273a4e2edab53b8473411d016b43986650fb6b529cdec130974f80","observation_id":"508972a0-ed4b-495d-ad5b-d2c5e2b04dab","resolution":{"observed_at":"2026-08-03T20:38:55.028226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T20:38:55.094974Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.094974Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:a276f5417b607fb96ddb2f83df238e876872dc7a47d0f8138c67dd5235eb38ce","observation_id":"e73763e9-b8bb-4338-ad19-4d2eadd1c8f7","resolution":{"observed_at":"2026-08-03T20:38:55.094974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-03T20:38:55.151754Z","title":"Vlm-3r: Vision-language models aug- mented with instruction-aligned 3d reconstruction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.151754Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:be38b4d794a223dec8c5ece87204c9c2a029a98687e0427d6bb4272b2364ffdd","observation_id":"72fc96a9-1852-4a86-a0bd-ed1dcd958dde","resolution":{"observed_at":"2026-08-03T20:38:55.151754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.184590Z","title":"Surds: Benchmarking spatial understand- ing and reasoning in driving scenarios with vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.184590Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:d2b4771e2b294e023be03d4cce1d5870cc1808dd2475d24c51ead884de82e3d2","observation_id":"eee8f01c-22c9-4336-b728-07c975bf8000","resolution":{"observed_at":"2026-08-03T20:38:55.184590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.239896Z","title":"3d-llm: Inject- ing the 3d world into large language models.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.239896Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:3f64533a9a4a61bdc2dbc07f4013ca2f3ef56e0b3ace7dff670432e4e173bc7f","observation_id":"ab6ab7ac-37fd-4510-8642-cfb12d71f050","resolution":{"observed_at":"2026-08-03T20:38:55.239896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.287693Z","title":"What’s ”up” with vision-language models? investigating their strug- gle with spatial reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.287693Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:770a2a3ce3b891cb8495d2751dd869f8f002f44eb43830080c800db39a704395","observation_id":"909bc398-84c5-4dd4-b423-b1ccc8b10f08","resolution":{"observed_at":"2026-08-03T20:38:55.287693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.318595Z","title":"Lee, Jihyeon Je, Chanho Park, Mikaela Angelina Uy, Leonidas Guibas, and Minhyuk Sung","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.318595Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:fbaf85c5d7653aa9f0e776e05a371a9a20f5a500e02cda4a19d4debbb3eea4c2","observation_id":"346095bd-61b2-48d3-81e5-e9db8400d8db","resolution":{"observed_at":"2026-08-03T20:38:55.318595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.361460Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.361460Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:399ad262851f15abab57f78b874fbe81d8d1c842ba42ab8660041a7f7aa5493b","observation_id":"532c478c-b7da-43c5-85d3-6ad7c014b912","resolution":{"observed_at":"2026-08-03T20:38:55.361460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-03T20:38:55.411826Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.411826Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:6dd3cb0d4e1f0add5dbdcca2b6728c52e79f36d6bef492ecaf6382ad9c8c623c","observation_id":"cee1622d-630d-4358-9580-72b51b92f0c4","resolution":{"observed_at":"2026-08-03T20:38:55.411826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.448060Z","title":"Viewspatial-bench: Evaluating multi-perspective spatial localization in vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.448060Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:d7bc567780a615680b01e16d11843a621194fb4a9eb1ce0337a944a36b44caf5","observation_id":"95c1dadc-6fda-4c81-8d38-d9f20f4b0ee3","resolution":{"observed_at":"2026-08-03T20:38:55.448060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-03T20:38:55.503949Z","title":"Hoi, and Li Fei-Fei","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.503949Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:24aadb384f3ab5b11ede40d6c130c49f6b6bd937286156de3395385a228b901d","observation_id":"cd0f1fc6-39d2-4a64-b2c2-0c78d649dc57","resolution":{"observed_at":"2026-08-03T20:38:55.503949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.545210Z","title":"Spatialladder: Progressive train- ing for spatial reasoning in vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.545210Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:5e17e704bb9beeb7ef5113747a59c7ffb76accc283dd3202c5cbf8f81c235e00","observation_id":"8761fb1f-1515-494e-9010-dd67e17c3095","resolution":{"observed_at":"2026-08-03T20:38:55.545210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.596804Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.596804Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:dc78f01508861b47becedbaf28b9e1a43447b96bfa67b98d5639929d4ad205d7","observation_id":"f54e9786-4ca9-4ced-b037-d896d0b231c2","resolution":{"observed_at":"2026-08-03T20:38:55.596804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.643951Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.643951Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:82ff18b9c6ed7ac843582f8686542d209a7cf9cc0b36d132c2032d21083abf8d","observation_id":"a2d028f0-fe31-4c10-8379-6933e4834c96","resolution":{"observed_at":"2026-08-03T20:38:55.643951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02684","last_updated":"2023-06-05T08:20:37Z","snapshot_observed_at":"2026-08-09T00:52:28.081810Z","submitted_at":"2023-06-05T08:20:37Z","title":"A Novel Multi-Agent Deep RL Approach for Traffic Signal Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02684","snapshot_observed_at":"2026-08-03T20:38:55.718590Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.718590Z"},"links":{"cited_paper":"/paper/2306.02684","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:d1b31d3a17430dcc370bab49a41dbfe7eddfc48f770d401a447857c02ad055b9","observation_id":"65d6b3ed-76fc-44a4-bc01-4fb57d4847a8","resolution":{"observed_at":"2026-08-03T20:38:55.718590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.770035Z","title":"Visual spa- tial reasoning.Transactions of the Association for Computa- tional Linguistics, 11:635–651, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.770035Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:49f247342a7773c36de957753c40f4196fd6a0c652e1f283a0883b91e9fb0621","observation_id":"7def5476-984c-4f25-ab84-09af786d2853","resolution":{"observed_at":"2026-08-03T20:38:55.770035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.855026Z","title":"Grounding dino: Mar- rying dino with grounded pre-training for open-set object 10 detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.855026Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:486863f7f6de93bc36026c718a5f6c258c78ba52778b70a803e205d77d68e3d0","observation_id":"e9a6c7f1-deac-4565-833b-e8f48d1b5405","resolution":{"observed_at":"2026-08-03T20:38:55.855026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.901480Z","title":"3dsrbench: A compre- hensive 3d spatial reasoning benchmark.arXiv preprint arXiv:2412.07825, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.901480Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:d8a6528ae40703e20c0c084c6f156c6579ebca476f6c391df75c0dc9a31991c9","observation_id":"06e758fc-b272-4fee-b172-b22316866e94","resolution":{"observed_at":"2026-08-03T20:38:55.901480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.967821Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.967821Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:dec4aae0d6bcd07900091d595cef5979362f9fa47b82d593834ca5f99eb12b1f","observation_id":"809fd4d9-e63b-4352-8c61-e370e45e891c","resolution":{"observed_at":"2026-08-03T20:38:55.967821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.020436Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.020436Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:4dca3de177b65ed8f758237388f3c3b97f2ca6e5c1a54564d041c708a516f6b6","observation_id":"f5c72476-ad3f-498d-b895-80649dd2dc72","resolution":{"observed_at":"2026-08-03T20:38:56.020436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T20:38:56.091709Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.091709Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:70a292b468ed952cb11123257d7d5ba8dd5686a7efcf2eb4958b936dd83b5800","observation_id":"21436383-2142-4cfc-a7ad-c80fe38dfc3b","resolution":{"observed_at":"2026-08-03T20:38:56.091709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.095771Z","title":"Shapellm: Universal 3d object understanding for embodied interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.095771Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:0a931af55c0c6d3843faeb0aceaa2bafb4912421a3acb5a99b08f05be4bbc743","observation_id":"d48f1012-52dd-4854-80a4-4ad5e0383e39","resolution":{"observed_at":"2026-08-03T20:38:56.095771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.102240Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.102240Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:a97c6a0ccc0ac71bec3df3d7bdf574a45ff835c69d4b110653466deaccb01068","observation_id":"50e00068-8775-49a4-9a94-2dbaf0723a35","resolution":{"observed_at":"2026-08-03T20:38:56.102240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T20:38:56.157395Z","title":"Deepseekmath: Pushing the limits of math- ematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.157395Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:3f54ff694f10dc54f31e9bfcd1bb779589ac66f93bb98e45541137685b3a7f21","observation_id":"1e11018a-2d3c-4ed3-8394-c1f711d24bc9","resolution":{"observed_at":"2026-08-03T20:38:56.157395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.248164Z","title":"Space3D-Bench: Spatial 3D Question Answering Benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.248164Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:d76969dbe00978194b59d8ef94e9e8b48d95ee83656b8510b30e3119a7649b5f","observation_id":"ec6506ca-7cad-48d3-9bda-080642b9689e","resolution":{"observed_at":"2026-08-03T20:38:56.248164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-03T20:38:56.274268Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.274268Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:174f5030ce68b878483e3745d9f80ab79342b9064015507bf6fd77732bb38035","observation_id":"b37d4bd3-ca58-4b9d-8dc0-095031994996","resolution":{"observed_at":"2026-08-03T20:38:56.274268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03164","last_updated":"2025-04-07T03:39:02Z","snapshot_observed_at":"2026-08-07T16:09:54.936463Z","submitted_at":"2025-04-04T04:43:10Z","title":"NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03164","snapshot_observed_at":"2026-08-03T20:38:56.380114Z","title":"Nuscenes-spatialqa: A spatial understanding and reasoning benchmark for vision- language models in autonomous driving.arXiv preprint arXiv:2504.03164, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.380114Z"},"links":{"cited_paper":"/paper/2504.03164","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:e1b909d9f3d6c7d9bfd85b6a483ef5c996ac36f3978c17a4aeac1b56d03292c7","observation_id":"0ed634ff-f6e0-4037-8e01-a0acee736260","resolution":{"observed_at":"2026-08-03T20:38:56.380114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T20:38:56.472453Z","title":"Llama: Open and efficient foundation lan- guage models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.472453Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:845c3ed503880c170e50a209880bf30695f8db64c4174af7dc1b2ddfcbcf384a","observation_id":"e059e4b6-49a5-44ef-bc97-727183fc8bdf","resolution":{"observed_at":"2026-08-03T20:38:56.472453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.591800Z","title":"Cross-modal pro- jection in multimodal llms doesn’t really project visual at- tributes to textual space","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.591800Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:7a0fea1ae96b48f26fc6e7767da5aafc9e5f7e2b89594f8d9adf73182c6d3847","observation_id":"df08ed63-aad8-4ade-8dee-f858468399a6","resolution":{"observed_at":"2026-08-03T20:38:56.591800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.673894Z","title":"Learning 3d semantic scene graphs from 3d indoor reconstructions","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.673894Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:f8f30cc406a867de172cd9b70e01c9a5af99a81fc2958a0f28e5872bbbd59378","observation_id":"2e583bfd-8301-48ac-8aa6-092681b606bb","resolution":{"observed_at":"2026-08-03T20:38:56.673894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.735634Z","title":"Is a picture worth a thou- sand words? delving into spatial reasoning for vision lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.735634Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:beeca58191a5f0cb5ce2ec557ac72e0d902a4adb91e16dc92ca54552fadc433e","observation_id":"a4a5cb51-d025-44e9-b5f3-a00c59a9361b","resolution":{"observed_at":"2026-08-03T20:38:56.735634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.777803Z","title":"Spatial 3d-llm: Exploring spatial awareness in 3d vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.777803Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:f4a86165f1f83a0322adb51f50ac42b0bbfbbf02aa71214daa9b4b8cf6e13d18","observation_id":"7acbe468-8842-49d1-99d4-ca4dfe6618ae","resolution":{"observed_at":"2026-08-03T20:38:56.777803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23747","snapshot_observed_at":"2026-08-03T20:38:56.844553Z","title":"Spatial-mllm: Boosting mllm capabilities in visual-based spatial intelligence.arXiv preprint arXiv:2505.23747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.844553Z"},"links":{"cited_paper":"/paper/2505.23747","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:a0193ec018015f5683bb7457b11737768442c187a4f0a1052402a188c4d79c33","observation_id":"04f4922f-24b2-44f6-bfe3-9389f52a9375","resolution":{"observed_at":"2026-08-03T20:38:56.844553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.910137Z","title":"Pointllm: Empowering large lan- guage models to understand point clouds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.910137Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:a1bf4beb5d19be87dc43969204fa9aabf01bdff1a5aa48c1d49517a83031c417","observation_id":"0373d929-38c4-4c28-a8b6-d3554f1e5416","resolution":{"observed_at":"2026-08-03T20:38:56.910137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.976381Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.976381Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:e06f446c2f13daca5bcc6411667a95675c1581de01dd99666949748b89335f0d","observation_id":"45090bbc-c81e-4083-83e5-efdd44782115","resolution":{"observed_at":"2026-08-03T20:38:56.976381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.124463Z","title":"Open-vocabulary object detection using cap- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.124463Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:651818e64414884654ea8b94afad91567d53c3974421a74eff9a62d0442eb518","observation_id":"4ec212f5-83fa-4cbb-89f0-582422b9b7eb","resolution":{"observed_at":"2026-08-03T20:38:57.124463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.258520Z","title":"How to enable llm with 3d capacity? a survey of spatial reasoning in llm, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.258520Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:21ed2cef00b7a5bc2d30a65ce6494355f017258d7d250eb8146c68584a31e28f","observation_id":"09b0e65d-2a0c-49e7-8238-0a0cd844b2c7","resolution":{"observed_at":"2026-08-03T20:38:57.258520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.314772Z","title":"From flatland to space: Teaching vision-language models to perceive and reason in 3d.arXiv preprint arXiv:2503.22976, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.314772Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:3ec2b141cfbf8bfcc62e36d9143d416125c2022f08fa0ab5d289b37b89b920fc","observation_id":"1d04de49-7abf-40cc-ad8c-ccefd429fd3c","resolution":{"observed_at":"2026-08-03T20:38:57.314772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.422175Z","title":"Spinbench: Perspective and rotation as a lens on spatial reasoning in vlms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.422175Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:9053c87622aa7030dc3f52e3741af68e67e52a1cb7e4cc13e91ee00008f69ae9","observation_id":"904bbdd2-6d8e-42bc-9365-6868345a91a9","resolution":{"observed_at":"2026-08-03T20:38:57.422175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.553330Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.553330Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:bd78164f4d54c967ae0f123f6282b6769df56ff54aa7e5486ccf127ed42d9b88","observation_id":"2a6ba5e5-489d-4e13-b4e2-6678b7a104cf","resolution":{"observed_at":"2026-08-03T20:38:57.553330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.596020Z","title":"Scanreason: Empowering 3d visual grounding with reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.596020Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:478ba9d16c25487c20fd7db12205c472a78777dd794d63d17f4889afb5bb2186","observation_id":"b94a55ac-cab6-4579-8625-16871717526a","resolution":{"observed_at":"2026-08-03T20:38:57.596020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-03T20:38:57.652883Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.652883Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:9175f8ebda44baa1a2238391bf23105242b23f61ed04aa2130b41068fb1247bb","observation_id":"f65d7cbe-43bc-4dbc-a2d9-6e2a7126a51f","resolution":{"observed_at":"2026-08-03T20:38:57.652883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.761326Z","title":"A detailed description of each level and its cor- responding tasks is provided below","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.761326Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:8fb2347bd326bdb1c2b4d0820fce16df50ad96fe594ee0bd8af8d7a74d601b60","observation_id":"9d293d6a-d7db-4986-a1e2-6b7bd44fcead","resolution":{"observed_at":"2026-08-03T20:38:57.761326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.853194Z","title":"Specifically, after obtaining high-quality raw data through filtering, we generate image captions and construct scene graphs to serve as our underlying database","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.853194Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:076459d7282330fe50eb16cdf64b012205f7aa5df101461b17c990643cc821cc","observation_id":"ff698a18-5d01-4deb-9db5-359f450867ae","resolution":{"observed_at":"2026-08-03T20:38:57.853194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.909081Z","title":"- {variation_instruction} - The rewritten question MUST include: (a) A brief motivation clause describing WHY we need this information, consistent with the motivation hint","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.909081Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:1b153bb3bac1f53ff6c0079e46ae0f72ed9315fb6d90af838233362267752492","observation_id":"f1e64af2-c666-458b-a4b7-1e450b6963cc","resolution":{"observed_at":"2026-08-03T20:38:57.909081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.975775Z","title":"- {answer_constraint} - {task_extra} - You MUST NOT flip yesno","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.975775Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:ccedb1503e67b3d511887b1973daf490c50ef5319d1416b1c736c8e686d5efc6","observation_id":"591aa810-2306-491a-b5ac-fbdda1f876b0","resolution":{"observed_at":"2026-08-03T20:38:57.975775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.030558Z","title":"thinking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.030558Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:df54ff3e9fb065b90f56dabad3f8abaf29b5077a7afb926d9b7c56d0e4bfc372","observation_id":"39a5c178-0457-4ead-b97f-b774b381fd20","resolution":{"observed_at":"2026-08-03T20:38:58.030558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.090253Z","title":"Scene In- formation adds global context, 2D Visual Prompts improve local grounding, and 3D Bounding Boxes deliver the largest gains through explicit geometric structure","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.090253Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:8b69d84dc71a3230644ac07f556adc22ac70db58ef3cced90f347cb608f72027","observation_id":"7ab6194a-8858-4083-bc70-cf1d59d2870e","resolution":{"observed_at":"2026-08-03T20:38:58.090253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.171986Z","title":"For the 3D bounding box information, each object is rep- resented by its center coordinates, spatial dimensions (size), and orientation expressed as a rotation quaternion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.171986Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:9563f8b6261a977b451aa57f1b22ab4c5bad99a2e69d3ae4610f90b6b4158ecd","observation_id":"b027e5a3-9197-4b17-93b2-27c3c38441ef","resolution":{"observed_at":"2026-08-03T20:38:58.171986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.262429Z","title":"All inputs are processed with the officialQwen2.5-VLprocessor, which supports dy- namic image resolutions up to 262,144 pixels (512×512)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.262429Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:9083bf2e0a5a9495c974f0724c7e562b8806b7a5a3fe170736b96c0c976fe3d5","observation_id":"d6e8e8b5-5ad3-4d78-8169-69fca60a2b03","resolution":{"observed_at":"2026-08-03T20:38:58.262429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.358583Z","title":"- Use the format <obj>...</obj> to describe your mapping between textual entities and object IDs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.358583Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:86f0d4af2acd410d1220180d6eda69f1d8475db8b7d08448f3883135d5e991d1","observation_id":"41a9de49-fc95-4dfc-8e96-9391fe0f4693","resolution":{"observed_at":"2026-08-03T20:38:58.358583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.429529Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.429529Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:d18dc1a577f3062d588f3b9861d6f684d7014135edf3fb3103b99a4406637643","observation_id":"bb5c9776-80e7-4524-8b8f-cb623da6ca9e","resolution":{"observed_at":"2026-08-03T20:38:58.429529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.579422Z","title":"Your output format should strictly follow: <obj> Object mapping: - entity_1 object {id_a} ({caption_a}) - entity_2 object {id_b} </obj> <reasoning>","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.579422Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:3c48d976f03190770c9d1684105dd95d25f9e073c8d37f9e35e921c41f180525","observation_id":"5a1117f2-1d56-48f4-9935-77abe67ff869","resolution":{"observed_at":"2026-08-03T20:38:58.579422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T16:57:56.523159Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2511.19119."}