{"as_of":"2026-08-19T11:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09fc3b47c0c30a9915e836afa5d9e3dd6886b9190644067fdc7b8786b3df898a","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:40:27.818667Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:42:12.968388Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00788","snapshot_observed_at":"2026-08-03T18:42:12.968388Z","title":"Spatialllm: A compound 3d-informed design towards spatially-intelligent large multimodal models.arXiv preprint arXiv:2505.00788, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04069","last_updated":"2026-06-01T16:57:23Z","snapshot_observed_at":"2026-08-15T03:31:37.338569Z","submitted_at":"2025-12-03T18:50:04Z","title":"SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:42:12.968388Z"},"links":{"cited_paper":"/paper/2505.00788","citing_paper":"/paper/2512.04069"},"observation_digest":"sha256:e8fb2a62aca65d27a7cfddfb904b01e2698cb9f18fbdf31130ad94c6a7dd7fab","observation_id":"2eeb54c1-f742-4702-aacc-667cb7965203","resolution":{"observed_at":"2026-08-03T18:42:12.968388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00788/citation-record","integrity":"/paper/2505.00788/integrity","json":"/paper/2505.00788/citation-record.json","paper":"/paper/2505.00788"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T04:40:27.528694Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.528694Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:12f8b6399689608471fa7274af0f5837162c99681bd77c43f57f8935d4195b26","observation_id":"406a59fe-1e26-4614-8284-1220506dbdf7","resolution":{"observed_at":"2026-08-16T04:40:27.528694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.710452Z","title":"SpaceLLaV A.https://huggingface","venue":null,"work_id":"9d4b04dd-1b22-4e1c-96fe-edcd0e924099","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.533093Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:2c0de25effde5d3ed87fcb6084b7de2530404fe1a8cdbc3075e9aa91d6114a43","observation_id":"3899654e-51cf-4047-8147-8fc65620184d","resolution":{"observed_at":"2026-08-16T04:40:28.715270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.537060Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.537060Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:0796ea8efb3ce3c210ebdc5bffa15ed0813c66628fff46666fa39f4856806605","observation_id":"ef159a4d-37d4-4506-bfd3-d6e4a9577b20","resolution":{"observed_at":"2026-08-16T04:40:27.537060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.686903Z","title":"Claude 3.5 Sonnet.https : / / www","venue":null,"work_id":"f1970b31-ec9a-49b2-9706-4dfe56fe6979","year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.540724Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:9399be221614fe2ebd1395bf8ebac73e477b3254cc1e03fe8df1d1f27d037963","observation_id":"54101c4c-4803-4e16-8d9f-cd5527539fa6","resolution":{"observed_at":"2026-08-16T04:40:28.691472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.672087Z","title":"Apollo syntheic dataset, 2019","venue":null,"work_id":"df5d5ae5-87ea-4f49-9047-9594c87e482f","year":2019},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.544404Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:88ca4fccc83d9dc29ba486df3c7b753c6727dcbfb907395b06f758549269d18d","observation_id":"d08d78bf-58cd-48f3-a510-6f425e17e097","resolution":{"observed_at":"2026-08-16T04:40:28.676342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.658790Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"f3f4c095-7ac1-48ef-8d45-9e6800551767","year":2022},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.548786Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:5ff1fa3dd744169d869606aef479baadb7367f1b3037f7e049c2b6104aae43a6","observation_id":"1c09667c-7bfd-433e-beed-de79b75fe683","resolution":{"observed_at":"2026-08-16T04:40:28.662827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-16T04:40:27.553190Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.553190Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:82b513834a1d678da278368c1330435d90b57a1f1182b2c9557561632a2c822a","observation_id":"b680ca9b-60bc-408e-b398-2ded5eba2dc2","resolution":{"observed_at":"2026-08-16T04:40:27.553190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-16T04:40:27.557935Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.557935Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:016226496a5537620ef45bf4802e3d16b4a69513c4fe986164eae497e78f98a5","observation_id":"210bf3bf-22e8-47c5-928b-c18b4892d11b","resolution":{"observed_at":"2026-08-16T04:40:27.557935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-16T04:40:27.563585Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data.arXiv preprint arXiv:2111.08897, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.563585Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:911f1f321a5a0cf0a75b321b7a71d88b73b76f90267c701a393c0c54577c032f","observation_id":"014d3939-6660-4473-93c9-d6dac68e29ea","resolution":{"observed_at":"2026-08-16T04:40:27.563585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-16T04:40:27.568854Z","title":"Zoedepth: Zero-shot trans- fer by combining relative and metric depth.arXiv preprint arXiv:2302.12288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.568854Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:2b0741f5cd8fd8d37097dc4c4766f869cdbd814e8e3241753763bfd812b9e40e","observation_id":"2379b6d3-b0e9-4702-8586-5485bee21225","resolution":{"observed_at":"2026-08-16T04:40:27.568854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.644139Z","title":"Omni3D: A large benchmark and model for 3D object detection in the wild","venue":null,"work_id":"fd206eff-0796-4d27-8174-f841bc1dc66d","year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.573588Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:223f1c65ec988319285dd56a64e225bf7b0f69efe44a367db9bfab6b88007aca","observation_id":"bdcc0a7c-ab19-42be-8fca-2fcc0b0824dc","resolution":{"observed_at":"2026-08-16T04:40:28.649771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.630409Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":"f6a9eeda-8858-4621-9cfe-8c3c0d551c17","year":2020},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.577671Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:87336062a9f4130282432a2e08f9567f6bc7e3873420634601447a495431a56c","observation_id":"f7518ae4-2fea-4820-9626-77596264aef2","resolution":{"observed_at":"2026-08-16T04:40:28.634820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.616551Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"5f39970a-b605-4e99-97e4-8c82349bca4b","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.581845Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:7e3d8317097bb2a8dc1a85eef05f722a55d4b3540725a2d83bedd16306e6ced5","observation_id":"b3b2ee18-f9ae-4442-b275-15616a4374b7","resolution":{"observed_at":"2026-08-16T04:40:28.621016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.586160Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.586160Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:053ffedeb65fc382ba4b9c5e90fc6478f24529d13d597510c4fb064744452bcc","observation_id":"6613005b-fd73-4555-b321-9c286ba2a0c4","resolution":{"observed_at":"2026-08-16T04:40:27.586160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.593504Z","title":"Vitamin: Designing scalable vision models in the vision-language era","venue":null,"work_id":"dbc5f2b0-1095-434e-8ba8-8c9e22f58ea8","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.590245Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:41e1ef467b3787aa183b5190b8b02e56e79bec5ac50db0ba5224a6ad87ae559e","observation_id":"bb75f2f4-66a5-4a0d-b871-a3b9d668f78a","resolution":{"observed_at":"2026-08-16T04:40:28.598273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-16T13:46:36.421633Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-16T04:40:27.594324Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.594324Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:d4d708dd362b3f71f961c2339f302be9b26eab3509865f2a34790f62fc385a48","observation_id":"ee237961-8d51-49cb-87d3-00b205a249fb","resolution":{"observed_at":"2026-08-16T04:40:27.594324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.579661Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"cb826255-54e0-4f39-b6d1-92f8c32cb1bb","year":2009},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.598798Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:c558c90348bda63b801013e5ace1f9a61e11fb86d9e816311867389198f1b89f","observation_id":"c7428130-25d9-401f-b0f8-ff71c63dfd4e","resolution":{"observed_at":"2026-08-16T04:40:28.584277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T04:40:27.602876Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.602876Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:e525b3fdf79d4d793e69c14e1611f39f234940b60e67e3fd558fd3322790562a","observation_id":"e2fe4363-1272-494e-bdbc-866bceb42454","resolution":{"observed_at":"2026-08-16T04:40:27.602876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.567400Z","title":"Prob- ing the 3d awareness of visual foundation models","venue":null,"work_id":"d4afe88b-52b6-471e-91c1-6b87eec30298","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.607343Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:2b576721833946a91a9b84336ffe30ae00cac3a61d0e2477f11c7731d93a8e76","observation_id":"8f4a9e3c-3739-4cf3-b85d-a0bcc6ded7c3","resolution":{"observed_at":"2026-08-16T04:40:28.571158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14108","last_updated":"2023-10-20T17:01:44Z","snapshot_observed_at":"2026-08-19T08:52:33.418663Z","submitted_at":"2023-04-27T11:37:18Z","title":"DataComp: In search of the next generation of multimodal datasets","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14108","snapshot_observed_at":"2026-08-16T04:40:27.611469Z","title":"Dat- acomp: In search of the next generation of multimodal datasets.arXiv preprint arXiv:2304.14108, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.611469Z"},"links":{"cited_paper":"/paper/2304.14108","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:da0b12eb9acc6f3914629220b4faf4caa1364e20717e9b9099fac437d82ce988","observation_id":"01858a9a-0c1a-4c10-9b5b-b5316d65ceee","resolution":{"observed_at":"2026-08-16T04:40:27.611469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.553792Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":"12a81517-0c0c-4070-a7a9-85102f86ed73","year":2012},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.615737Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:6ab02c5d3f0f0ccb3736bdfe6b3595817102a3f5e1c9f4487416b0e059b54c2a","observation_id":"bf252cec-806e-40cb-bddd-14c085680d2c","resolution":{"observed_at":"2026-08-16T04:40:28.558228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.619809Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.619809Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:2c2173cc3fd8a4211b8ffeac4971844119d68ac8437d51a6bd57af31545bde5d","observation_id":"963710cf-9f38-43ac-9697-a4faa7d1eb9a","resolution":{"observed_at":"2026-08-16T04:40:27.619809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.531316Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"15afee93-aa25-4da5-9c5f-8fd429d5dbe5","year":2022},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.624025Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:67b51ef2c3556394cd763de8f42af54268578df24e38a4794bd3f38d20ff7856","observation_id":"5853c801-4a09-4244-a610-be3722600d4d","resolution":{"observed_at":"2026-08-16T04:40:28.535650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-16T04:40:27.628147Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.628147Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:9b523bc550c8589b4570b3554fdef633121aa0e1f2be7a558fd3e35fb7d4e0b8","observation_id":"0bb241a8-9b5a-49e6-a74c-b4964909fd04","resolution":{"observed_at":"2026-08-16T04:40:27.628147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.632345Z","title":"Open- clip, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.632345Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:c2914ce044ebb310f45564f5b6978fbf3397bb1de5e3419233857c01dea619a5","observation_id":"ab3e944d-9ffc-41be-8881-0afa42753c6a","resolution":{"observed_at":"2026-08-16T04:40:27.632345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.636714Z","title":"Novum: Neural object volumes for robust object classification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.636714Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:d31df88e2f8154faf85dbe321da2acb96cd013543e45e9b3fa4f121dfccb4e5c","observation_id":"efad3a13-2355-4f59-857a-bcf21ed9e00d","resolution":{"observed_at":"2026-08-16T04:40:27.636714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.641122Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.641122Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:9519f8044662d067a88758a1a31dd1897d6780b3a9ee2c31f7d2eb1326e92b2d","observation_id":"0a18a1e3-b8c5-4f12-919f-d9372cfeb9b4","resolution":{"observed_at":"2026-08-16T04:40:27.641122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T04:40:27.645314Z","title":"Mistral 7b.arXiv preprint arXiv:2310.06825, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.645314Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:c5db5d9e0a0ed41ae04602ba5626e895e496ebffb5131163d54491d400d181f7","observation_id":"8b70a587-e6b4-442f-a52b-039d3219ebb4","resolution":{"observed_at":"2026-08-16T04:40:27.645314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.492354Z","title":"Perspective fields for single image cam- era calibration","venue":null,"work_id":"ab481b11-f21e-4393-a0f8-d4c4e12e8726","year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.650512Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:658d47bd4472ee90e905bde5112912eb7acbc9f75cdf87cbf2641b053edb2b27","observation_id":"23def1e4-6e16-456d-a272-19374143cbe0","resolution":{"observed_at":"2026-08-16T04:40:28.496761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-16T04:40:27.654030Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.654030Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:2b4f57e587cc09da61a1ea2c63f2c17176e6b24a8fbdf4df42d6fec62c8f1134","observation_id":"0f29b4b2-cd60-4d8a-bccf-fe8980c20c1c","resolution":{"observed_at":"2026-08-16T04:40:27.654030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.478353Z","title":"Segment any- thing","venue":null,"work_id":"489fb219-1f68-4129-8705-d7915d53d196","year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.657739Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:67be436984815cc155c0ca8718a7bbb8ad0eeadb6e530e292f56139ae9d0333f","observation_id":"d6ad7280-ab4e-4084-8836-82d3c4087e82","resolution":{"observed_at":"2026-08-16T04:40:28.482808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.464050Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123:32–73, 2017","venue":null,"work_id":"1469a149-35e4-4e12-a560-24e1482ca1d9","year":2017},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.661340Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:852c6ee9e4d66d82883cea453d4f97f17c3c270f0c78bafa9b1af79bf59cf421","observation_id":"e8503dba-ab6d-41a7-ba90-27a7802de402","resolution":{"observed_at":"2026-08-16T04:40:28.468752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.451385Z","title":null,"venue":null,"work_id":"008aa06a-4f3d-4fc0-ad07-3b8da5ac585c","year":1956},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.664986Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:ad8078bec7a586edc552e1157a364304b4b5c23660e12c0a08687b90f4c5956f","observation_id":"6133f4d5-e8dc-43b8-b982-5d7bc1ba9234","resolution":{"observed_at":"2026-08-16T04:40:28.455596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T04:40:27.668620Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.668620Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:e9d1e79b30c5c148996d0e61dbdf41e849e1a7b3bd17d522b2b1ee2c0a57b2ee","observation_id":"ec3d869b-35a5-4bf8-a173-9680cbc1cfd0","resolution":{"observed_at":"2026-08-16T04:40:27.668620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.672593Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.672593Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:813bbb1be6de73b7a9f1b89fcfc7f3092849b6c70b96d6433a73e8e134196965","observation_id":"da067013-52b3-4923-b835-b331d5dff1cf","resolution":{"observed_at":"2026-08-16T04:40:27.672593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.676116Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.676116Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:5ab1a443baf953b1ec03faaa5597f45625383b8e02995516673183cc4cc460ea","observation_id":"6a9eeaed-3940-4f5e-bf21-6cac2194feff","resolution":{"observed_at":"2026-08-16T04:40:27.676116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-08-16T13:43:37.667967Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-16T04:40:27.679528Z","title":"What if we recaption billions of web images with llama-3?arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.679528Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:8276ca0614cfd04597b5dc799a511fcb07a902481d26bbad1d932ca279d4fd19","observation_id":"e191db48-ad61-4223-9dab-3e802c457a8f","resolution":{"observed_at":"2026-08-16T04:40:27.679528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.420221Z","title":"Learning customized visual models with retrieval-augmented knowledge","venue":null,"work_id":"9e851753-a52c-4ae9-ba3d-6b136e4591b2","year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.683992Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:b8dd616610758f27f303310a39c75b0cce15ce194548b8ecd7ca3e7811cc8a7c","observation_id":"2d8537d9-59b3-4597-bf88-eb1310a983ab","resolution":{"observed_at":"2026-08-16T04:40:28.424103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.407350Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"8139e63f-4867-4eab-9c04-a43b301fe808","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.688146Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:3a5e1a0aa863a70ec01cef8279a757cc5d663f59a6894937767e0b1f913cafe2","observation_id":"b5370f09-d4d9-4e65-823c-dd477f4ebdd9","resolution":{"observed_at":"2026-08-16T04:40:28.411147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.692491Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.692491Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:386b7a55fd902ff973eb418b4519f744643d519cc4065fbc20a9abab3bf35dbb","observation_id":"8563a318-bdce-4f59-94e2-8c66228b8f8b","resolution":{"observed_at":"2026-08-16T04:40:27.692491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.385223Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":"3644e9fe-6f86-4da1-99f0-8eb894ced432","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.696559Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:7d925ec300869ebd0af47d646b26ae01c63469401f053077d6243ba13475d2d0","observation_id":"9078385e-9047-431d-88a5-8539b76bdac5","resolution":{"observed_at":"2026-08-16T04:40:28.389689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-16T04:40:27.701110Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.701110Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:110430c84e5470705c2f0cf769d5b80406c427de041e68a05c75f7062a5a9efe","observation_id":"2d40ee3a-6590-4210-971b-7cb5e430e012","resolution":{"observed_at":"2026-08-16T04:40:27.701110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-16T04:40:27.706213Z","title":"Deepseek-vl: towards real-world vision- language understanding.arXiv preprint arXiv:2403.05525,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.706213Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:247cd75b168c2f68597d5f1f0682742c08dce33a5375a8ef9830bfb81bb36f45","observation_id":"1b4f0ab1-d640-46cc-b582-d973fb3af87f","resolution":{"observed_at":"2026-08-16T04:40:27.706213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.710906Z","title":"Robust category-level 6d pose estimation with coarse-to-fine rendering of neural features","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.710906Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:26b962882bdeaec4bacaf7ced6521267cfa6a6677128cb74fedeb920909f8410","observation_id":"9d41879e-6ea7-45c5-9dd6-5fb92975967a","resolution":{"observed_at":"2026-08-16T04:40:27.710906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.363074Z","title":"Imagenet3d: Towards general-purpose object-level 3d understanding","venue":null,"work_id":"7ef7e6fa-8f47-4cbe-80df-448816352008","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.715210Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:5bc6d3bec5e6fe42534353b1492df71dc93b3bfafa2b55734070ce4a873ae99c","observation_id":"cb3e3658-1c82-496c-8a94-595420f171ad","resolution":{"observed_at":"2026-08-16T04:40:28.367631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-16T04:40:27.719431Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training.arXiv preprint arXiv:2403.09611, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.719431Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:9a36b0a49ca9694196e21ecba9aaa0e709d4066459058d5b33b75ea3199897e6","observation_id":"ee39a5d8-b409-4f20-afb8-66877bafd94d","resolution":{"observed_at":"2026-08-16T04:40:27.719431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.349292Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"c0a1ea46-bd6b-4f62-b3e8-263a77100fd2","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.723958Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:2fa1603d2649289fac65565698b2281b22b829bb8e306d43525a2a92953df032","observation_id":"a0f212ba-c183-4ba0-ac22-e03927a53aff","resolution":{"observed_at":"2026-08-16T04:40:28.353857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.335991Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"85647d46-7ed8-445c-bfa9-e35605884cee","year":2021},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.728221Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:d2e5003de9a9dabed06b6a363939f1673c216f3e82154a03c22611f8ed97e1fc","observation_id":"46c97bf3-ed26-462e-8532-8f29b56a2c81","resolution":{"observed_at":"2026-08-16T04:40:28.340434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13246","last_updated":"2024-10-10T22:22:52Z","snapshot_observed_at":"2026-08-16T13:41:35.302169Z","submitted_at":"2024-06-19T06:15:26Z","title":"GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13246","snapshot_observed_at":"2026-08-16T04:40:27.732388Z","title":"Gsr-bench: A benchmark for grounded spatial reasoning evaluation via multimodal llms.arXiv preprint arXiv:2406.13246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.732388Z"},"links":{"cited_paper":"/paper/2406.13246","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:becf162ba7e6969652336512061ac4d434cd403ae02bf20bf8b54d011bc64b50","observation_id":"ab98a02a-21ff-4a25-aa69-358024560e93","resolution":{"observed_at":"2026-08-16T04:40:27.732388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.737271Z","title":"Susskind","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.737271Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:92efd716e11e1013a13240b37883377858a06698c36fde21a7058b96a8adbda3","observation_id":"5ce633a1-7150-4fe4-b5d2-0c05685ba58f","resolution":{"observed_at":"2026-08-16T04:40:27.737271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.742087Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.742087Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:18723a6c2f055011b6648c8fce846bdef9e1b842bba8f17b1ebdfc9f513c13dd","observation_id":"0480b152-9d4f-456f-8a1f-4cf1911f0bd2","resolution":{"observed_at":"2026-08-16T04:40:27.742087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.746271Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in Neural In- formation Processing Systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.746271Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:bffad7bfeb2be9505fc046bdf92f4686ec4560fe1dd8b679711fb80829db2754","observation_id":"006893b9-ae58-480a-858a-34eae99b0e66","resolution":{"observed_at":"2026-08-16T04:40:27.746271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.750251Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.750251Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:5e397e141e7a4a67953704d709d9430e17c0251ef3f00ffbb6b896280efc2e3c","observation_id":"d9eed4e5-c451-414b-9f1c-d369abc0d3cf","resolution":{"observed_at":"2026-08-16T04:40:27.750251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.288560Z","title":"Sun rgb-d: A rgb-d scene understanding benchmark suite","venue":null,"work_id":"68fc3605-5ff8-47b2-877e-79712d869788","year":2015},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.754431Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:da5140e8d04c5329cd67e52aed891a4625588e9b713142709f73b469a00f1e64","observation_id":"38d7f83c-8884-48a2-a43a-5028083c44e9","resolution":{"observed_at":"2026-08-16T04:40:28.292913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.274903Z","title":"Core knowl- edge.Developmental science, 10(1):89–96, 2007","venue":null,"work_id":"8c32706c-cb2a-4b9f-af40-0ecb154f8dec","year":2007},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.758501Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:38e13fb063a0d27889209703190a426c530e17094204d2aa7e219a1ae0817eea","observation_id":"5079e0ca-85ec-40d6-8dd8-fc7220e45669","resolution":{"observed_at":"2026-08-16T04:40:28.279345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.261719Z","title":"Revisiting unreasonable effectiveness of data in deep learning era","venue":null,"work_id":"d6741fd6-4a8e-4d7c-93ff-1084932a1151","year":2017},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.762558Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:ba3ae86accd9ae4940e2800ecf8609b6f38c2727e820c58207f3002da12bf4e1","observation_id":"2d34e57a-31d7-4600-b65c-438238908d63","resolution":{"observed_at":"2026-08-16T04:40:28.266026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T04:40:27.766525Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.766525Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:8c37fe8c269a0b9520cd986aeac2b835a3b61a6a4b620b61b8203398da23aa5c","observation_id":"136a0093-736c-4ee3-81e0-c392bb18cacf","resolution":{"observed_at":"2026-08-16T04:40:27.766525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-16T04:40:27.770707Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms.arXiv preprint arXiv:2406.16860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.770707Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:933f2574bd16284b4ae2148738f620064f69cef0b42b49bb8042a1767e1410f5","observation_id":"7432001d-b856-4980-8200-07a6a7a57b7b","resolution":{"observed_at":"2026-08-16T04:40:27.770707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T04:40:27.775308Z","title":"Llama 2: Open foundation and fine- tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.775308Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:97eb7dfc0bc61b086d0c3d78444f399e2e28405706628e730cd3398572db3df5","observation_id":"58112f68-ab1b-4fd0-9de8-9a674ab0493b","resolution":{"observed_at":"2026-08-16T04:40:27.775308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.247713Z","title":"3d-aware visual question answering about parts, poses and occlusions.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"3118ff8f-eaf1-4266-91cd-80554954491e","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.779103Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:0c5d43db1758ac02c36a86bd2b6bbc272232b3bd7a8b324584bb2b1d46b1c152","observation_id":"1cb36f74-af69-48b2-b64b-007267717ddc","resolution":{"observed_at":"2026-08-16T04:40:28.252560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00622","last_updated":"2025-04-23T04:53:40Z","snapshot_observed_at":"2026-08-16T13:47:04.311021Z","submitted_at":"2024-06-02T05:51:15Z","title":"Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00622","snapshot_observed_at":"2026-08-16T04:40:27.782481Z","title":"Compositional 4d dynamic scenes understanding with physics priors for video question answering.arXiv preprint arXiv:2406.00622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.782481Z"},"links":{"cited_paper":"/paper/2406.00622","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:fc29022ae6328bda79d99d646d2b39f19a7856cc6057bfcc68df8a49203cba5f","observation_id":"87ad28bf-6065-4e22-a3aa-3ad93f02c52b","resolution":{"observed_at":"2026-08-16T04:40:27.782481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.786283Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.786283Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:f2752b9b51a015d3918421c46eabebc28ba8ee947dfd62212011f09f2b431fea","observation_id":"9413468e-6207-41cb-a66c-0ba8a4f1ed2b","resolution":{"observed_at":"2026-08-16T04:40:27.786283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.789631Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.789631Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:99ab9b387fa6f247db40a6b8f1b707a12d95fb7e9b2b98c446e70740df111438","observation_id":"5bcdd412-64c8-4b6c-bae0-b479654111c3","resolution":{"observed_at":"2026-08-16T04:40:27.789631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08359","last_updated":"2022-11-29T01:51:28Z","snapshot_observed_at":"2026-08-16T17:34:20.104698Z","submitted_at":"2021-12-15T18:59:59Z","title":"3D Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08359","snapshot_observed_at":"2026-08-16T04:40:27.793012Z","title":"3d question answering.arXiv preprint arXiv:2112.08359,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.793012Z"},"links":{"cited_paper":"/paper/2112.08359","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:5c2e6de0687c3c733bdae52a3c8a69c25131cbfafc0397b7e47166aae31ebee0","observation_id":"641aa501-4832-4c54-a095-8c145200b324","resolution":{"observed_at":"2026-08-16T04:40:27.793012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-16T04:40:27.796715Z","title":"Coca: Contrastive captioners are image-text foundation models.arXiv preprint arXiv:2205.01917, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.796715Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:005e807d2f52aae58e8befa6c3dae39042b849ad5bedec3ddf02aa54951d8034","observation_id":"0a28dadf-2403-4a41-b966-8c54e4654bec","resolution":{"observed_at":"2026-08-16T04:40:27.796715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03514","last_updated":"2023-06-09T15:21:06Z","snapshot_observed_at":"2026-08-16T15:26:15.090405Z","submitted_at":"2023-06-06T09:00:10Z","title":"Recognize Anything: A Strong Image Tagging Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03514","snapshot_observed_at":"2026-08-16T04:40:27.800978Z","title":"Recognize anything: A strong image tagging model.arXiv preprint arXiv:2306.03514,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.800978Z"},"links":{"cited_paper":"/paper/2306.03514","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:4899def098b6160c14069afc06f0e991375016acea3724d38de7d849d341a572","observation_id":"c0976f13-42b8-4a8e-b0c9-79e2abede03f","resolution":{"observed_at":"2026-08-16T04:40:27.800978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.219310Z","title":"Recognize anything: A strong image tagging model","venue":null,"work_id":"15cf70d8-6430-47b2-8764-2feb049a5321","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.805680Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:42a0a8c944dde33548e3b5ebc2b9031f856024e52c515bb7494beccffce76b01","observation_id":"05828b61-7e53-4419-969c-22fdbc6382e6","resolution":{"observed_at":"2026-08-16T04:40:28.222985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.206010Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":"f686e783-2e6a-4a4f-ac0a-f1c2cb9d3e44","year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.809925Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:cfc725d5c6b05be22ac9d7d1e717134d785ac641716662d3a776926a6c9f17f2","observation_id":"c6ea85e2-6324-4c84-89cb-3e5cc5a09a3b","resolution":{"observed_at":"2026-08-16T04:40:28.210551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-16T04:40:27.814069Z","title":"ibot: Image bert pre-training with online tokenizer.arXiv preprint arXiv:2111.07832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.814069Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:745ad12eda77b8c793e726af3cd1204036635f96b7c9ec25af4dcf4f3b189679","observation_id":"3a2932da-f0a4-413f-a27c-6f50635ac041","resolution":{"observed_at":"2026-08-16T04:40:27.814069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.190654Z","title":"yes” as the answer and 120 questions have “no","venue":null,"work_id":"21c82853-550f-4fee-8f4c-eaa78d915323","year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.818667Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:eeb98f789ab9c2e86f1525a3c21b879df5ae1508ecec2e3b9a3c2145145051d6","observation_id":"40f19090-a735-4d0d-a78f-2b57a9580da8","resolution":{"observed_at":"2026-08-16T04:40:28.195914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T15:30:38.997513Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2505.00788."}