{"as_of":"2026-08-18T02:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff5a1917bf9666b7136ba53fd175b655819448682b1e0f4c75991b53b8ac34ec","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:22:03.380823Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T14:16:39.649823Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:57.806668Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.04911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04911","snapshot_observed_at":"2026-07-04T16:39:57.806668Z","title":"SpatialPrompting: Keyframe-driven zero-shot spatial reasoning with off-the-shelf multimodal large language models","venue":null,"work_id":"5701d426-564e-4799-b682-d30525be28d2","year":2025},"citing_paper":{"arxiv_id":"2605.09218","last_updated":"2026-05-09T23:35:27Z","snapshot_observed_at":"2026-08-17T00:37:04.530223Z","submitted_at":"2026-05-09T23:35:27Z","title":"Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T02:09:09.684786Z"},"links":{"cited_paper":"/paper/2505.04911","citing_paper":"/paper/2605.09218"},"observation_digest":"sha256:85c783702e95df39a82f3fe520aa3aaa7394dc7001ff00d194faedf9449340ff","observation_id":"8e256f1d-9d5c-47c7-a611-d24fdaf9da67","resolution":{"observed_at":"2026-05-12T02:11:15.844978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.04911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04911","snapshot_observed_at":"2026-07-04T16:39:57.806668Z","title":"SpatialPrompting: Keyframe-driven zero-shot spatial reasoning with off-the-shelf multimodal large language models","venue":null,"work_id":"5701d426-564e-4799-b682-d30525be28d2","year":2025},"citing_paper":{"arxiv_id":"2605.18209","last_updated":"2026-05-18T10:54:55Z","snapshot_observed_at":"2026-08-15T00:04:55.931335Z","submitted_at":"2026-05-18T10:54:55Z","title":"SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T11:06:29.022994Z"},"links":{"cited_paper":"/paper/2505.04911","citing_paper":"/paper/2605.18209"},"observation_digest":"sha256:39951be5287c1fa704b51b93bab9f919a81ac8d25d5ba2882ea15a015fc42580","observation_id":"cbafe699-c661-4036-a0bf-7b6d2b5e497a","resolution":{"observed_at":"2026-05-20T11:08:13.503564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.04911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04911","snapshot_observed_at":"2026-07-04T16:39:57.806668Z","title":"SpatialPrompting: Keyframe-driven zero-shot spatial reasoning with off-the-shelf multimodal large language models","venue":null,"work_id":"5701d426-564e-4799-b682-d30525be28d2","year":2025},"citing_paper":{"arxiv_id":"2606.11683","last_updated":"2026-06-10T05:52:14Z","snapshot_observed_at":"2026-08-17T03:39:46.869507Z","submitted_at":"2026-06-10T05:52:14Z","title":"Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T10:41:41.697216Z"},"links":{"cited_paper":"/paper/2505.04911","citing_paper":"/paper/2606.11683"},"observation_digest":"sha256:91e0248a146c7081c605563e228a75968871cea5c055284d2f01daca3aa739a4","observation_id":"cffbfe24-0b3a-4e70-ac24-9e6f7f0ccbae","resolution":{"observed_at":"2026-07-03T08:57:47.457896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.04911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04911","snapshot_observed_at":"2026-07-04T16:39:57.806668Z","title":"SpatialPrompting: Keyframe-driven zero-shot spatial reasoning with off-the-shelf multimodal large language models","venue":null,"work_id":"5701d426-564e-4799-b682-d30525be28d2","year":2025},"citing_paper":{"arxiv_id":"2606.24649","last_updated":"2026-06-25T01:22:24Z","snapshot_observed_at":"2026-08-14T06:19:42.001910Z","submitted_at":"2026-06-23T14:44:04Z","title":"Agentic Collaborative Cognition for Zero-Shot 3D Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T00:22:06.082183Z"},"links":{"cited_paper":"/paper/2505.04911","citing_paper":"/paper/2606.24649"},"observation_digest":"sha256:95009224c88e65cb9be03c147048b3f29ce20240d91c0c73d64049b1091c9f15","observation_id":"e4675a4d-f28b-497f-9265-d25caba2b4a3","resolution":{"observed_at":"2026-07-04T16:39:57.808440Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.04911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04911","snapshot_observed_at":"2026-07-04T16:39:57.806668Z","title":"SpatialPrompting: Keyframe-driven zero-shot spatial reasoning with off-the-shelf multimodal large language models","venue":null,"work_id":"5701d426-564e-4799-b682-d30525be28d2","year":2025},"citing_paper":{"arxiv_id":"2606.24649","last_updated":"2026-06-25T01:22:24Z","snapshot_observed_at":"2026-08-14T06:19:42.001910Z","submitted_at":"2026-06-23T14:44:04Z","title":"Agentic Collaborative Cognition for Zero-Shot 3D Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T05:37:41.407624Z"},"links":{"cited_paper":"/paper/2505.04911","citing_paper":"/paper/2606.24649"},"observation_digest":"sha256:208e660bbd9cd356316786b28f585a16b5e1b3ce107e0f287a677d9e6169ce52","observation_id":"b2aa3805-169c-484a-9519-0475390ff47f","resolution":{"observed_at":"2026-07-04T12:59:52.650682Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.04911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04911","snapshot_observed_at":"2026-07-04T16:39:57.806668Z","title":"SpatialPrompting: Keyframe-driven zero-shot spatial reasoning with off-the-shelf multimodal large language models","venue":null,"work_id":"5701d426-564e-4799-b682-d30525be28d2","year":2025},"citing_paper":{"arxiv_id":"2607.00881","last_updated":"2026-07-01T12:45:12Z","snapshot_observed_at":"2026-08-14T20:35:18.801176Z","submitted_at":"2026-07-01T12:45:12Z","title":"OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-02T14:16:39.649823Z"},"links":{"cited_paper":"/paper/2505.04911","citing_paper":"/paper/2607.00881"},"observation_digest":"sha256:2dc1f229803e30223cfce081b31281383a972184bb9474a89541781af78c7071","observation_id":"ffce045f-5314-4807-ace6-774b901ddb76","resolution":{"observed_at":"2026-07-02T14:17:02.457657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.04911/citation-record","integrity":"/paper/2505.04911/integrity","json":"/paper/2505.04911/citation-record.json","paper":"/paper/2505.04911"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.302882Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"fd3179b4-33f2-455b-aae3-f28384c97180","year":2020},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.135735Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:cc27342ec84266d3e1b28fe9ac55443a3dfdc78f6692e39d506418175b3ce587","observation_id":"e86eb903-a87a-4e2f-9bf5-fc7b6fbca0c8","resolution":{"observed_at":"2026-08-15T23:22:04.307473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.289143Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"959ee2e3-fafe-43ee-98f6-253478c3a31e","year":2022},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.140661Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:52e94a82d799b7a7440da4fe8e9a836068d27470f44d17b8d3b286ede3823926","observation_id":"1d12989b-4334-4396-9791-e2829238a99f","resolution":{"observed_at":"2026-08-15T23:22:04.293839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.145122Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.145122Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:b2825ad85734c4fa52aa442cef5085b72b406d8965ff0d5e652a0b4556cde392","observation_id":"9605b7ab-546f-4a40-87e2-f74e0f8f9b1d","resolution":{"observed_at":"2026-08-15T23:22:03.145122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.265872Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"9670ed37-c9a4-4de3-b37a-40208c3e166b","year":2020},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.149341Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:9589c7784b44cfab329cd7a693d9c3062506642f54e61abff49ab3661aa6e381","observation_id":"12bd605f-b8da-4fb9-8a85-6ae7a8c52104","resolution":{"observed_at":"2026-08-15T23:22:04.270591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.154205Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.154205Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:e632e80f8b5d1e90736bea00baed0b78a82aaabaf6786af30c48b6e5d711b5ab","observation_id":"c77c582b-ceee-4e72-acfd-2c9c91dd2bb9","resolution":{"observed_at":"2026-08-15T23:22:03.154205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.243231Z","title":"End-to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":"1ad12670-7ce5-487f-a56f-55891470aab2","year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.158388Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:d6402f63e3a9758373667ab14f890d11de6841071d5b5f49289c92c3fc625717","observation_id":"a3a7b681-8ca4-4306-b2c5-817da5cf11a2","resolution":{"observed_at":"2026-08-15T23:22:04.248135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.229388Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understand- ing reasoning and planning","venue":null,"work_id":"2d663fbd-7261-474a-b4b0-8f1ee99a9463","year":null},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.162684Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:af7a3546b2f399b0419dade8efcb7cf7d61967e5d28d60b08b869ec3009898a2","observation_id":"62a696d9-2606-4d80-8f36-054def1b838e","resolution":{"observed_at":"2026-08-15T23:22:04.234010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.166781Z","title":"V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.166781Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:d060677740f0a20633e89bac13f2a5776fea285f573bf2fe4a2eae1094b4ee5c","observation_id":"19477877-9569-4c18-9160-a0cba3708f80","resolution":{"observed_at":"2026-08-15T23:22:03.166781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.206116Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":"5ef8cc65-8618-4e71-a9dc-72bbadff7c52","year":2021},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.171354Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:3c8d5c08e66900aa304ea99ff071b16137f2eb9090855b2b7d73d3bb6bfd86b6","observation_id":"ddab9ca1-522b-407d-be4f-3b801bf96576","resolution":{"observed_at":"2026-08-15T23:22:04.210852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00937","last_updated":"2023-12-01T21:34:10Z","snapshot_observed_at":"2026-08-16T14:38:20.403984Z","submitted_at":"2023-12-01T21:34:10Z","title":"Zero-Shot Video Question Answering with Procedural Programs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00937","snapshot_observed_at":"2026-08-15T23:22:03.175282Z","title":"Zero-shot video question answering with pro- cedural programs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.175282Z"},"links":{"cited_paper":"/paper/2312.00937","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:afe8f775b090bbceb7570714cdccc3c90b0c819795d3bdd56ab5070ba93377d8","observation_id":"bb8a2e0d-e198-4779-91a4-10508fb01ecb","resolution":{"observed_at":"2026-08-15T23:22:03.175282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.192208Z","title":"Chang, Manolis Savva, Maciej Hal- ber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":"5bfcce8d-b77d-40f7-918b-daae7df9fca0","year":2017},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.179532Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:c5f0c33320e6a9d586923521830d7ac9fe7c7ae6e32ad2b8a0ad7d5ee6cfc396","observation_id":"e62622ba-bc4b-46ce-8b0e-a6f2555e6e67","resolution":{"observed_at":"2026-08-15T23:22:04.196609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.178292Z","title":"Bundlefusion: Real-time globally consistent 3d reconstruction using on-the-fly surface reintegration","venue":null,"work_id":"60e476c1-abdc-4b9c-9530-065776c1d5a0","year":2017},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.183532Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:afbcd886f44eb49f5ef71bd2aaadb4bc3d5a7dcfe0134c1d93d5bd00116e3a95","observation_id":"97757f96-34c9-402a-b4fa-55bc56daca0e","resolution":{"observed_at":"2026-08-15T23:22:04.182664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.164746Z","title":"Lan- guage to map: Topological map generation from natural lan- guage path instructions","venue":null,"work_id":"6030f9d2-64f3-46c7-8c9d-af7b100b7030","year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.187554Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:722b9e176c8441c96175a61ef100b6a3a046e90bec526c5a0ba5089a301dda41","observation_id":"73d615a7-3f14-4ce8-9fae-f1fe4c60a5d1","resolution":{"observed_at":"2026-08-15T23:22:04.169169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-17T15:42:36.096154Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-15T23:22:03.191900Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.191900Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:1c01f434250f23c3b4037fc3b9d893f2942c83dc6294331d747f68448e79cda6","observation_id":"6ab4f79a-5cf5-4133-b3a8-8ed308676a1d","resolution":{"observed_at":"2026-08-15T23:22:03.191900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.151181Z","title":"Gemini 2.0","venue":null,"work_id":"4c0831db-e157-451b-a52b-55b23bc9488f","year":null},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.196198Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:bb27ac7c07794807db5fa9bd037a8aa18735b714c13ed911aac972d69723dfef","observation_id":"2c85059b-8684-45bd-bf00-4b842fe50835","resolution":{"observed_at":"2026-08-15T23:22:04.155379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.123257Z","title":"3d-llm: Inject- ing the 3d world into large language models","venue":null,"work_id":"b57b9648-f178-4c77-a04e-9a9ba7de31ac","year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.204752Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:411eb9d1be25e5c4e031495340e6a397bb45fc470dfb13d2f1c201df9c8cbbd5","observation_id":"ea930b38-9c25-4aa5-b206-aa8d476712b7","resolution":{"observed_at":"2026-08-15T23:22:04.127711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.209045Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.209045Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:d6747f908671e3c73adb9a0eb38af689d0131f70183b079f1f0639b394191651","observation_id":"6c524b60-e4dc-4b7c-9069-91dc333d6502","resolution":{"observed_at":"2026-08-15T23:22:03.209045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.099198Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"88a02a49-3fc0-4e2e-8f19-ac1fa23ea889","year":null},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.213504Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:4a7ee853ad531fe9ac0005f670ecbe0f01054b8512877910032b785e3c45c991","observation_id":"bc4bb9a6-c3aa-46c9-8ffe-59e94d7d12ea","resolution":{"observed_at":"2026-08-15T23:22:04.103954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.083679Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"e5a64c82-71b2-415d-a647-aea7c2e4c22c","year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.218020Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:3e34269798d51f7a4f71c3cf8c8989972b5ed5119a86632823c2455e1af86f0e","observation_id":"42dea5ca-3c0f-4f88-bcd5-4a9a421e304e","resolution":{"observed_at":"2026-08-15T23:22:04.089392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.069258Z","title":"Multi- view transformer for 3d visual grounding","venue":null,"work_id":"fe496761-0c8f-45c2-85cf-84f6d13cdd17","year":2022},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.222848Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:db97aa55c059cbe865c9f1f9c4d8dae6698ebcc5e85a4433994cdee777f9c04b","observation_id":"08f25081-872c-45dc-8d72-7b56624a3114","resolution":{"observed_at":"2026-08-15T23:22:04.074082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.054583Z","title":"More: Multi-order relation mining for dense captioning in 3d scenes","venue":null,"work_id":"d73be2ab-2980-462d-ae12-bb58e261a9ca","year":2022},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.227014Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:54a043579ba6552c737877c7ac609e94c67f0a9a3c4bb1bff47ebe1bace57ddf","observation_id":"feba9d65-0368-403c-9c7d-88c1af251926","resolution":{"observed_at":"2026-08-15T23:22:04.059085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.040680Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":"5be50ff7-61c5-4a79-8532-657c15b9ce49","year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.231008Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:1d25e99597a29dbe3887f36b2b8ff0a46a861c2da36d84cbe1f31c65b650df22","observation_id":"5fc57cdc-e54a-4e75-9c31-5352eecc6956","resolution":{"observed_at":"2026-08-15T23:22:04.045298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.026277Z","title":"Context-aware alignment and mutual masking for 3d- language pre-training","venue":null,"work_id":"8cf62d70-71f0-4521-809d-046bd2993024","year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.234828Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:5415e48da8810b3352d47e71e13e858c852a968dab4214082d441d57414f56df","observation_id":"409bcd8b-76b4-459e-a068-4c1804712b8d","resolution":{"observed_at":"2026-08-15T23:22:04.031214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.011443Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"ce55aa19-d089-45a9-a6ef-f5552933f0f6","year":2022},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.238906Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:0d3fa192b520dce6e3cdc748d4957a239de34b650c8ba7ee047d7ec9bd93b472","observation_id":"5873b649-ecec-4ba3-b20b-2261d623c629","resolution":{"observed_at":"2026-08-15T23:22:04.016161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20365","last_updated":"2024-10-04T21:57:23Z","snapshot_observed_at":"2026-08-18T00:11:13.276547Z","submitted_at":"2024-09-30T15:04:14Z","title":"VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20365","snapshot_observed_at":"2026-08-15T23:22:03.243306Z","title":"Videoin- sta: Zero-shot long video understanding via informa- tive spatial-temporal reasoning with llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.243306Z"},"links":{"cited_paper":"/paper/2409.20365","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:3f3880de8072e3333573d1c58b0d3631bda1d4b36cecb17ca42539068f1b4a4b","observation_id":"22f3ec89-007b-4aff-a790-82c9e75bbebb","resolution":{"observed_at":"2026-08-15T23:22:03.243306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-15T23:22:03.247560Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.247560Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:e0cb175ca9c1fee4970bc44bf57431e151f60bb5f8d5657d8a0f8a66c53b9e8e","observation_id":"2e386186-e9eb-44c0-be87-a92f0d04684e","resolution":{"observed_at":"2026-08-15T23:22:03.247560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-15T23:22:03.251882Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.251882Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:09bd9010e20adf2355197a48f393ac0f8dbbbecd3b3e78b6c4b118021a0d4df4","observation_id":"6210f3c7-3150-4d1c-8a14-250ccb5f87f9","resolution":{"observed_at":"2026-08-15T23:22:03.251882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-15T23:22:03.256603Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.256603Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:445864fa11b37c08c79501410679b1d867b1bd1a2effaac67fcaf2326c55b7dc","observation_id":"ecff8102-9088-4f9f-9f71-53aed34d39fa","resolution":{"observed_at":"2026-08-15T23:22:03.256603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.996961Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"18f361b5-239b-4b14-913a-880d41f8def3","year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.261081Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:967097d3b267d7ee64130094ca89ac67233b517fee6de1db67431e09c8bcf393","observation_id":"d79439f8-c82d-4088-9bde-eab93ec71203","resolution":{"observed_at":"2026-08-15T23:22:04.001310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06573","last_updated":"2023-10-19T23:45:30Z","snapshot_observed_at":"2026-08-16T15:48:57.108651Z","submitted_at":"2023-03-12T05:08:16Z","title":"Large Language Models Know Your Contextual Search Intent: A Prompting Framework for Conversational Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06573","snapshot_observed_at":"2026-08-15T23:22:03.264822Z","title":"Large language models know your contextual search intent: A prompting framework for conversational search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.264822Z"},"links":{"cited_paper":"/paper/2303.06573","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:d3186753efc4a243d724a79de07ee1afa65a74b185b6570b8674d5c6c23b5797","observation_id":"a9d9fd3d-cb6b-4465-8f5a-79d7cdf080b5","resolution":{"observed_at":"2026-08-15T23:22:03.264822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.269541Z","title":"Morevqa: Exploring modular reason- ing models for video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.269541Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:e32de38d04544251bbd02a9244ae38dd002c581f3c542948dec91939c09d3a10","observation_id":"bbb705d2-7184-44fc-ad5d-4e7927e915e2","resolution":{"observed_at":"2026-08-15T23:22:03.269541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.975885Z","title":null,"venue":null,"work_id":"d3a1a22e-5acc-4830-9856-a59f632aa782","year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.273740Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:d16f6328424d8c5c11f8ba26b3642e1a19b036654e9484b082801564aaa67ef3","observation_id":"977261d6-c621-4116-9ad3-86628a6ccff0","resolution":{"observed_at":"2026-08-15T23:22:03.979809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.962172Z","title":"Clip-guided vision-language pre-training for question answering in 3d scenes","venue":null,"work_id":"71c50d68-8369-4764-9532-733ed311bac6","year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.277716Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:b5b9601bd39aa9556f60bd4826c342cfa94da6e5fdfaf5de3664cbc0f85c2c31","observation_id":"838691c0-94e7-48c6-b3d8-a0537adfce99","resolution":{"observed_at":"2026-08-15T23:22:03.966685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.282100Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.282100Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:3b260c38c304c65eaefbacbb215416f1638ec0a12efb04b3bbec1e36f9120b76","observation_id":"83064e19-086e-483f-937f-3acc166af40d","resolution":{"observed_at":"2026-08-15T23:22:03.282100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.939394Z","title":"Traveler: A multi-lmm agent frame- work for video question-answering","venue":null,"work_id":"e6d8aa45-2971-4987-9499-3d7eb84c9897","year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.286034Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:791ab41e93e10b3c92946b8f1d34cdd63456f59a4a98afb1b03d04e4497c839c","observation_id":"117e1819-8a16-454e-b764-f39d5d31578e","resolution":{"observed_at":"2026-08-15T23:22:03.943681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.926004Z","title":"Droid-slam: Deep visual slam for monocular, stereo, and rgb-d cameras","venue":null,"work_id":"cddffd13-334d-4936-ada3-bb1064ec4adc","year":2021},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.290745Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:cd53174671e02d9a3e424eebd74a957b0c1accdfba1ed7a30475088f0ac42148","observation_id":"617918b5-632b-4f33-b8ac-2610ed8fa4ec","resolution":{"observed_at":"2026-08-15T23:22:03.930471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.912547Z","title":"Four ways to improve verbo-visual fusion for dense 3d visual grounding","venue":null,"work_id":"21adbfbb-5cb3-4f55-a609-6020f1663632","year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.295087Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:bf7daa01f11367863f419ba36a2cd277bde3bd88015088116bd6ddf2756a839c","observation_id":"058ab9a4-c8b9-4231-a66f-c261116658f5","resolution":{"observed_at":"2026-08-15T23:22:03.916949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.899171Z","title":"Vamos: Versatile action models for video understanding","venue":null,"work_id":"807e4222-437e-46ae-bb84-13f4b3182a49","year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.299492Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:3dd3f47d75815bbd784644e6d2007feba7f135ef799fdc3218919562d91866e3","observation_id":"11f386b9-62d8-44ef-b37e-3e39a81c415f","resolution":{"observed_at":"2026-08-15T23:22:03.903477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.884875Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"da2182e4-62af-4ac5-927a-aebac1c36b4f","year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.304088Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:9f294f42cc4fbfa00b65d1a514a9e0ad3304579b9831d300f5562116dee93bd1","observation_id":"3dec7b14-3bf8-4c59-a6e4-ea69e32e4772","resolution":{"observed_at":"2026-08-15T23:22:03.889114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.871117Z","title":"Language models with im- age descriptors are strong few-shot video-language learners","venue":null,"work_id":"bca13791-341d-4d5b-b09d-f3390ac7c205","year":2022},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.308641Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:2eecff57bb70de07002a4d8ad377d34d45358784f3acdb5e206288a64308e20c","observation_id":"73ba2d20-d31d-4ac9-b98f-ffd17c52e0f2","resolution":{"observed_at":"2026-08-15T23:22:03.875883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13363","last_updated":"2023-07-25T09:33:25Z","snapshot_observed_at":"2026-08-16T15:13:30.804357Z","submitted_at":"2023-07-25T09:33:25Z","title":"3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13363","snapshot_observed_at":"2026-08-15T23:22:03.313320Z","title":"3drp-net: 3d relative position-aware network for 3d visual grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.313320Z"},"links":{"cited_paper":"/paper/2307.13363","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:96fd2e7541ba26a8e0d2ffa8f6d643ad8535f77492d896cb4b08287d3ab1ef0b","observation_id":"1e267989-021d-45ee-acc4-cd5c5fb3e726","resolution":{"observed_at":"2026-08-15T23:22:03.313320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.857391Z","title":"Distill- ing coarse-to-fine semantic matching knowledge for weakly supervised 3d visual grounding","venue":null,"work_id":"d0d10239-2837-4054-b82f-0aa598bfbfde","year":null},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.317838Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:f1815b53730a6160a79a7419688b124c09c6014ee95f32e8d95c377e0660e28f","observation_id":"e35fece7-918a-49a2-a437-e9dea1860898","resolution":{"observed_at":"2026-08-15T23:22:03.861754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-16T15:07:56.298993Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-15T23:22:03.322405Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.322405Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:6850ab460bbac18504aff3d2a3e3063ad8e798e678556171a040854a4b55b877","observation_id":"9be380f3-06e8-44da-92d1-7c819c976757","resolution":{"observed_at":"2026-08-15T23:22:03.322405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-17T21:35:27.995630Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-15T23:22:03.327442Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.327442Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:fb87187cca145c5e6e86344a06d3145cc6e22852dd071981b839c6b19c1dc2b5","observation_id":"57f36b66-8254-4401-8b8b-d408b660de53","resolution":{"observed_at":"2026-08-15T23:22:03.327442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-17T00:14:01.413100Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-15T23:22:03.332050Z","title":"Emergent abilities of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.332050Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:36cf4f4ffd51073c6bc8e8362251bb0ef16294a1181a27f4da3e890327ea6d5f","observation_id":"bdc57e75-91e2-4629-951f-215073b6f9c0","resolution":{"observed_at":"2026-08-15T23:22:03.332050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.337025Z","title":"Retrieval-based video language model for efficient long video question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.337025Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:3d2118dcd54ed6167286d93be6aa9aa46f9581778fd87b6f31addf45e59e3cd3","observation_id":"f7c67614-691b-4381-b798-a71f74fdb12e","resolution":{"observed_at":"2026-08-15T23:22:03.337025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.842313Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"68b979fa-e81d-41b1-83cc-21f7eeb73b90","year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.341891Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:1445314053e12a9497ce4e984eda8ef5ff590887b01fd01a97fb76c19dbb8991","observation_id":"a0477564-9838-4399-9a69-280a98f48bce","resolution":{"observed_at":"2026-08-15T23:22:03.846832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.827355Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"ee85ea4f-3519-44b8-9c6f-8469bb410a06","year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.346055Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:fd82c72318b2267eca870dd6b02f17262960ab95051733313f5d90490e74a245","observation_id":"cd0b139d-0cd1-4d05-b8a0-31aff332231e","resolution":{"observed_at":"2026-08-15T23:22:03.832157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.810579Z","title":"X-trans2cap: Cross-modal knowledge transfer using transformer for 3d dense caption- ing","venue":null,"work_id":"93604119-6a5f-4100-983d-0462f17d7022","year":2022},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.350124Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:6e2a5ca797ea029cf1e80817758ca7ec70a208e9221515bcf5b75963fc46f7f5","observation_id":"a80e4e70-9be1-4353-ae75-2bd9952b0c13","resolution":{"observed_at":"2026-08-15T23:22:03.816395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.796139Z","title":"3dgraphllm: Combin- ing semantic graphs and large language models for 3d scene understanding, 2024","venue":null,"work_id":"45e4027f-b96f-4a54-9e67-d423988a414f","year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.354228Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:b6aac60a0608b030ba0127f8e6d732c44a1941cd3a9781a6ed0eae92ba5dfe44","observation_id":"5026e5e9-11f5-4cbb-aea8-2b920f8e913a","resolution":{"observed_at":"2026-08-15T23:22:03.801083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17235","last_updated":"2024-10-10T05:17:00Z","snapshot_observed_at":"2026-08-16T14:31:04.705062Z","submitted_at":"2023-12-28T18:58:01Z","title":"A Simple LLM Framework for Long-Range Video Question-Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17235","snapshot_observed_at":"2026-08-15T23:22:03.358265Z","title":"A sim- ple llm framework for long-range video question-answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.358265Z"},"links":{"cited_paper":"/paper/2312.17235","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:b5fa3e06b7a304e662c8141bc307858433ed97e5f08f19b68353a647be8a4121","observation_id":"b4df0afd-5be2-4674-9677-a4a40005770a","resolution":{"observed_at":"2026-08-15T23:22:03.358265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-15T23:22:03.362685Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.362685Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:181d565b7a67be3cbc82e32676b86b064ebadbf2bc6c371df75a856d01dc8ab5","observation_id":"411d878c-4c64-4dfa-9de8-1318d557804d","resolution":{"observed_at":"2026-08-15T23:22:03.362685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.780934Z","title":"Multi3drefer: Grounding text description to multiple 3d ob- jects","venue":null,"work_id":"ac6bdf9f-a8f9-49b1-a4a8-e36a5ddd891f","year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.367022Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:fb3963b83b28530bafa8459e340b806d38f272fde507a00eee66d8481ca861d5","observation_id":"60b24c58-b124-4ebe-914c-b2bf96d06de6","resolution":{"observed_at":"2026-08-15T23:22:03.786738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.371148Z","title":"3dvg- transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.371148Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:208a18cf55be35bccc1a6d03b619247ef616635b2435685b9ca9dc2f88cd4094","observation_id":"fc122c2b-4a4e-443a-98a1-d9ac1e2b8279","resolution":{"observed_at":"2026-08-15T23:22:03.371148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-16T06:33:23.438365Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01292","snapshot_observed_at":"2026-08-15T23:22:03.376214Z","title":"Lscenellm: Enhancing large 3d scene understand- ing using adaptive visual preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.376214Z"},"links":{"cited_paper":"/paper/2412.01292","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:633262ac5d7f0f2dfe882c8f8f3507514a43b27f576dd8e39fb2ebb5cf9a0d52","observation_id":"7e8b58bb-e232-48c0-9cc4-1cc51e9b19ae","resolution":{"observed_at":"2026-08-15T23:22:03.376214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:03.754178Z","title":"Is,” “Can,","venue":null,"work_id":"609124d2-0080-4448-b995-3d5844a1a1f1","year":2023},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.380823Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:8bcb9bf9a5163e0021b4c89231945e1108bcddb1b269f1f85b31aa70c85fe126","observation_id":"b11c3423-8cde-4b5f-a60b-8b72dcd0781d","resolution":{"observed_at":"2026-08-15T23:22:03.760691Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:22:04.137296Z","title":null,"venue":null,"work_id":"d395c93d-1dc7-4469-891e-a9ba37e33d65","year":2025},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.200342Z"},"links":{"citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:7b442b5599c08f03177aa4fb6cbcb7e1ef034ff92516cb929ca51f133705716f","observation_id":"b5082d10-da5c-4036-998f-6a28e8f99f7a","resolution":{"observed_at":"2026-08-15T23:22:04.141936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 6 inbound Pith citation observations for arXiv:2505.04911."}