{"as_of":"2026-08-13T20:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a891c370be3c2b0c31e0e2f6b6bf1cdbd783dac48350586de9f48a203b075848","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:33:29.808181Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10864/citation-record","integrity":"/paper/2608.10864/integrity","json":"/paper/2608.10864/citation-record.json","paper":"/paper/2608.10864"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-12T15:33:27.118241Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction.arXiv preprint arXiv:2505.20279, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.118241Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:cd0863d6ac845ddc26a0e0339672b480e71ef9fb61803f1eda42cf9494f5710a","observation_id":"54a1a48e-541c-4a26-99a9-ac63c5153957","resolution":{"observed_at":"2026-08-12T15:33:27.118241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.168523Z","title":"3drs: Mllms need 3d-aware representation supervision for scene understanding.Advances in Neural Information Processing Systems, 38: 67961–67988, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.168523Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:a537618229a59ad948f9a4e688b13739a1cd31ef334e060f4674e656a767118a","observation_id":"1f84e78f-dfcc-4e6e-8447-694e34bbad57","resolution":{"observed_at":"2026-08-12T15:33:27.168523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.208043Z","title":"CUP Archive, 1967","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.208043Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:30563d10b86e33027748507b4337d8980515912b951c7b1a5ba7f838310ab1da","observation_id":"72786601-5a8c-4972-bbd3-73db14d1f467","resolution":{"observed_at":"2026-08-12T15:33:27.208043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.952237Z","title":"Henry Holt and Co., Inc., New York, NY , USA, 1982","venue":null,"work_id":"3828e70f-f52a-404f-bc98-e6afc8455f0d","year":1982},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.258250Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:520c1665550f495e9db2305866f6e8fe8174f89f469f310ed5cc7db7e83ba687","observation_id":"bb9cd8f1-1932-4808-9c04-adda660b79d2","resolution":{"observed_at":"2026-08-12T15:33:32.032179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.296641Z","title":"Number 6","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.296641Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:7c99c656d369bdc3b9db902e42e600fd8e7dad6426e58549893cbf66f05aaa30","observation_id":"8b75e6f2-0426-4b6a-847d-ff22eaf69d19","resolution":{"observed_at":"2026-08-12T15:33:27.296641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.334241Z","title":"Separate visual pathways for perception and action","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.334241Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:b3a673573be6f4638d9386600e21d95687b7ca1b55e1b61418ae7c62e8b4230c","observation_id":"9c1485a0-d1ed-4f5d-898d-49463389cea6","resolution":{"observed_at":"2026-08-12T15:33:27.334241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.374416Z","title":"Mental rotation of three-dimensional objects.Science, 171(3972):701–703, 1971","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.374416Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:dca0fbc44f2a1171fff52b7b4a0c4b77292c86d6b320af923b42f16bc73bc799","observation_id":"c70e74d4-ee1f-4bb0-a477-e732b8540558","resolution":{"observed_at":"2026-08-12T15:33:27.374416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.403655Z","title":"Oxford university press, 1978","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.403655Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:86be6d35a2aef2f603f96426fa5dedf4ec535f2c6206f999b75797b9a365c515","observation_id":"53fa584c-0db6-46e2-a28b-fd03061b08d9","resolution":{"observed_at":"2026-08-12T15:33:27.403655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.434416Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.434416Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:96d9c164907cd1b465a3f9807170b49d7b11ec6618e22ac8c3799367a050b0be","observation_id":"3d47e3f0-36cc-4b90-b178-965802fae45f","resolution":{"observed_at":"2026-08-12T15:33:27.434416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-12T15:33:27.467684Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.467684Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:7d584f592f3a67fd40fbf57db53645080f594a6abd8a396d93e822d6b4e66cf5","observation_id":"04ee055b-8d94-4616-9a27-fa3eac91f6a3","resolution":{"observed_at":"2026-08-12T15:33:27.467684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-12T15:33:27.488894Z","title":"Palm-e: An embodied multimodal language model.arXiv preprint arXiv:2303.03378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.488894Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:c9fe421065928eb7fd393d82d6273d0028a3b04db594c251679b9c427d222462","observation_id":"c274fcc8-ac9b-4312-b3d0-4d118e2a2623","resolution":{"observed_at":"2026-08-12T15:33:27.488894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.513243Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.513243Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:60cce8958d8bd83e4e04a2e6b031b8ee05dc24e0601897477750446246370deb","observation_id":"f4020c15-82c7-4b85-b0ef-3ff96bf5ab12","resolution":{"observed_at":"2026-08-12T15:33:27.513243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.536117Z","title":"Are vlms ready for autonomous driving? an empirical study from the reliability, data and metric perspectives","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.536117Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:835404f2d075237ec5cbdf23056c7406b79f27a11b6225ed38429a132d79b4bf","observation_id":"ecd75291-ac67-40ae-9e16-39afc05ac79f","resolution":{"observed_at":"2026-08-12T15:33:27.536117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-12T15:33:27.559154Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.559154Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:80478587c62b9563351429a8f2e1e012951d6755825101545b4d29cf8ce70940","observation_id":"0f5fb8ed-eb7f-4d78-a561-d48b5f067980","resolution":{"observed_at":"2026-08-12T15:33:27.559154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-12T15:33:27.597794Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.597794Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:307403c121a1eadd408dbe66ed51eefcb32fe1aaeee54a93d68c6bd1186d6a5c","observation_id":"205a6793-af32-450d-9f26-0bdfd8316df2","resolution":{"observed_at":"2026-08-12T15:33:27.597794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.858125Z","title":"LLaV A- video: Video instruction tuning with synthetic data.Transactions on Machine Learning Research, 2025","venue":null,"work_id":"c6144cef-ec72-4fae-82c8-7e6efd13d047","year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.627853Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:c017891e96925bc74c7d8a165375ac2276803fcd5d4dc40ad3cb923d9281645d","observation_id":"61b7547e-1d9b-4a8b-9164-36bb4225850c","resolution":{"observed_at":"2026-08-12T15:33:31.861793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.848964Z","title":"Probing the 3d awareness of visual foundation models","venue":null,"work_id":"524325b0-7dd8-447c-a07c-efea5154c318","year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.662301Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:b179df9748a5367b0fd973b1d9f906b96ad5f6fe9e6ec72407ecd4658f723d27","observation_id":"7bb53d38-73a0-4035-a903-7194cffba8ed","resolution":{"observed_at":"2026-08-12T15:33:31.851699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.693368Z","title":"Sti- bench: Are mllms ready for precise spatial-temporal world understanding? InProceedings of the IEEE/CVF International Conference on Computer Vision, pages 5622–5632, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.693368Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:08420b13d957c0f646e394d542b9d64dd279421ce73eb1267123570f40292337","observation_id":"5cf0e01c-42fd-495e-a90d-a30d3d2c7c98","resolution":{"observed_at":"2026-08-12T15:33:27.693368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.750364Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.750364Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:6b26ac526be72bb4606dbeebbe8dfa64cc095657607c2bd0102abea9f09adc68","observation_id":"87d6ce1f-049d-4151-902c-6f4b92e319bd","resolution":{"observed_at":"2026-08-12T15:33:27.750364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.802712Z","title":"Vlm4d: Towards spatiotem- poral awareness in vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.802712Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:1a5a3779ccfef75c13207d03331b5b230ce6437e1d35974b7be6a7bb8f291a5e","observation_id":"ccddb12c-aba2-4058-990e-f3875f62cebe","resolution":{"observed_at":"2026-08-12T15:33:27.802712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.915456Z","title":"Cambrian-s: Towards spatial supersensing in video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.915456Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:5e23c22d1e18b21be1dcd5715d79a36ac022a63c1c307ab8388cb1f0b84dc721","observation_id":"4a06d401-c430-4d9c-bbd9-3f0656262306","resolution":{"observed_at":"2026-08-12T15:33:27.915456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11581","last_updated":"2025-05-16T16:28:34Z","snapshot_observed_at":"2026-08-13T13:19:29.532878Z","submitted_at":"2025-05-16T16:28:34Z","title":"Questioning Representational Optimism in Deep Learning: The Fractured Entangled Representation Hypothesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11581","snapshot_observed_at":"2026-08-12T15:33:27.973683Z","title":"Questioning representational optimism in deep learning: The fractured entangled representation hypothesis.arXiv preprint arXiv:2505.11581, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.973683Z"},"links":{"cited_paper":"/paper/2505.11581","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:33f404bf0556342a9bf6e6d1c95da9b3d95634b70939f86d609e46cd1c164550","observation_id":"beac19f4-b222-40b6-9e7e-69cf97e0fcbe","resolution":{"observed_at":"2026-08-12T15:33:27.973683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.004225Z","title":"Learning from videos for 3d world: Enhancing mllms with 3d vision geometry priors.arXiv preprint arXiv:2505.24625, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.004225Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:1201c8e42027e60102afc1ffec8cb8b2d77f1c8a288ab5767e766115bc68ea68","observation_id":"4647a97b-0e1f-4c31-bcbd-a85f98f5f94e","resolution":{"observed_at":"2026-08-12T15:33:28.004225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T15:33:28.057213Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.057213Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:072a25b490893a943347c65933bd2c17382544c3b6924b5222fd2fead31be8d9","observation_id":"f434eff9-3b11-4021-8934-ecd778e162be","resolution":{"observed_at":"2026-08-12T15:33:28.057213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.772158Z","title":"Unsupervised natural experience rapidly alters invariant object representation in visual cortex.science, 321(5895):1502–1507, 2008","venue":null,"work_id":"954ee1e9-3887-4626-bb8f-1b2126a56e46","year":2008},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.107936Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:7bf75cf18c1682f76319fb697e52ce327ba5aad6953e4f14f8bf380d401991aa","observation_id":"c976a4dc-f4a9-40f3-b939-dd1c9a60943b","resolution":{"observed_at":"2026-08-12T15:33:31.803965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.611370Z","title":"Slow feature analysis: Unsupervised learning of invariances.Neural computation, 14(4):715–770, 2002","venue":null,"work_id":"46f7d12a-bb4c-400d-9f79-e29214ac4684","year":2002},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.143957Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:4561a3f87493973b31a2502f2b385ecf24a042bc78e22389e0ae6bef59efe417","observation_id":"a77fa326-3b6b-490e-bc6b-4cf2003d5c93","resolution":{"observed_at":"2026-08-12T15:33:31.688307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.182390Z","title":"The tolman-eichenbaum machine: unifying space and relational memory through generalization in the hippocampal formation.Cell, 183(5):1249– 1263, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.182390Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:7865591a0369d2ea6c39e116f9cd448d7697ddb3c17aa45db0d72e035e445968","observation_id":"f1a1f640-c5ea-4332-b960-e17a12b4f2f1","resolution":{"observed_at":"2026-08-12T15:33:28.182390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.553367Z","title":"Psychology of spatial cognition.Wiley Interdisciplinary Reviews: Cognitive Science, 3(6):565–580, 2012","venue":null,"work_id":"baaf7bd6-d0b9-442c-8aae-84aefaff08f1","year":2012},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.212915Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:70502b29c13917f30090d8aca15f579c9e184ce52a1ab172672b704a7b0a8c0a","observation_id":"0b40abdd-a5db-4460-8a8c-2ef393025aae","resolution":{"observed_at":"2026-08-12T15:33:31.556519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-12T15:33:28.247419Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.247419Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:6abe9ef537bccc528dc28955c8fc2f6cdf971f77945796e2a3a0bb8bd9c08cdc","observation_id":"a6faf50b-53c7-4948-b050-b6ca50e69b8f","resolution":{"observed_at":"2026-08-12T15:33:28.247419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-12T15:33:28.289469Z","title":"Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, AJ Ostrow, Akila Welihinda, Alan Hayes, Alec Radford, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.289469Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:73e8302f2a9f4b056056149456fb3197ceee14b4091ed92a3f0d15d641360d6f","observation_id":"67da9146-8180-461b-920c-a09a20989136","resolution":{"observed_at":"2026-08-12T15:33:28.289469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23765","last_updated":"2025-07-17T03:46:15Z","snapshot_observed_at":"2026-08-11T10:07:56.752381Z","submitted_at":"2025-03-31T06:30:35Z","title":"STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding?","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23765","snapshot_observed_at":"2026-08-12T15:33:28.317477Z","title":"Sti- bench: Are mllms ready for precise spatial-temporal world understanding?arXiv preprint arXiv:2503.23765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.317477Z"},"links":{"cited_paper":"/paper/2503.23765","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:67d39490759c3ec9d2fe2e07d0121c61b55a81f7b90d5cd919c28aa1add31f91","observation_id":"7c938b5e-59a1-4a40-bc81-2a4b0f23cbd7","resolution":{"observed_at":"2026-08-12T15:33:28.317477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02095","snapshot_observed_at":"2026-08-12T15:33:28.342219Z","title":"Vlm4d: Towards spatiotemporal awareness in vision language models.arXiv preprint arXiv:2508.02095, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.342219Z"},"links":{"cited_paper":"/paper/2508.02095","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:2e42bf14e4ee95810b8cc7ca3a0801098dd5b234fb74d4bfbfca0c749b9a4834","observation_id":"d9ce87d5-a09d-4627-9a8c-8812128504eb","resolution":{"observed_at":"2026-08-12T15:33:28.342219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-12T15:33:28.364382Z","title":"Learning transferable visual models from natural language supervision.arXiv preprint arXiv:2103.00020, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.364382Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:cdb5c356b07c124d274a261cc2f2524ff352ffb3c70bcb8450ba1506996a5d59","observation_id":"6ccf82cd-9f78-4f08-9861-33308bddca74","resolution":{"observed_at":"2026-08-12T15:33:28.364382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-12T15:33:28.381618Z","title":"Sigmoid loss for language image pre-training.arXiv preprint arXiv:2303.15343, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.381618Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:85b6a1b3816bf1f72f6bc0243d1333c57431c9932f37422d8ac1dd6243ddda03","observation_id":"1c083e24-1267-4b2f-94ec-a3fe365ffef1","resolution":{"observed_at":"2026-08-12T15:33:28.381618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-12T15:33:28.399065Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.arXiv preprint arXiv:2406.16860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.399065Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:68aaf4daa2a75e25818db72ed59cea2abfa96f4834a65500524e96a27f85f19c","observation_id":"8e3a871a-0a6a-473f-a70b-2be1a1d4fa0f","resolution":{"observed_at":"2026-08-12T15:33:28.399065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.460314Z","title":"O’Sullivan, Fang Cao, Tahoura Nedaee, Kamyar Rajabalifardi, Fei-Fei Li, Ehsan Adeli, and Euan Ashley","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.460314Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:238931e53b96d71794275270b3c6f24c3d9a3215d927334cb2fb90dbc249d652","observation_id":"96ab4e6c-53d2-426a-abc4-f0e554584a1f","resolution":{"observed_at":"2026-08-12T15:33:28.460314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.508799Z","title":"From flatland to space: Teaching vision-language models to perceive and reason in 3d.arXiv preprint arXiv:2503.22976, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.508799Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:eb7e5d757bef972f2355ba554a1ff9cbdd85d4b40037366c4dda920844e0fea6","observation_id":"f65e9dfb-4032-429b-9eef-45796e4626c8","resolution":{"observed_at":"2026-08-12T15:33:28.508799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.562622Z","title":"Visual spatial tuning.arXiv preprint arXiv:2511.05491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.562622Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:cdb0871f2d3377178ee4c82ff4e46f38509e02d36d900fdf86e2af8954218a5e","observation_id":"ebcc31ef-8308-4671-a011-7d8922eaf6e2","resolution":{"observed_at":"2026-08-12T15:33:28.562622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04670","last_updated":"2025-11-06T18:55:17Z","snapshot_observed_at":"2026-07-06T22:35:07.844255Z","submitted_at":"2025-11-06T18:55:17Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04670","snapshot_observed_at":"2026-08-12T15:33:28.585047Z","title":"Cambrian-s: Towards spatial supersensing in video.arXiv preprint arXiv:2511.04670, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.585047Z"},"links":{"cited_paper":"/paper/2511.04670","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:7a982d36ffe6e1a079b3de48d2080b883e7e3cfdad7195434bc82a759d1624dc","observation_id":"06b1887d-f586-4ca0-8901-29e9cdbf6dd2","resolution":{"observed_at":"2026-08-12T15:33:28.585047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.614240Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.614240Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:73d1526c11361a3aab4ec87de3c5a11dbf4bdfeaafcf88b4ca46abd48410c7df","observation_id":"da5f7c1d-cf31-4b45-84aa-571d67dcbbf6","resolution":{"observed_at":"2026-08-12T15:33:28.614240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.538818Z","title":"Continuous 3d perception model with persistent state","venue":null,"work_id":"9c506f1c-1b7d-4720-a680-faba2b5bf0c1","year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.641131Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:0a6ce5494639146a6aefe6fbe3988917c8486994155e24e53445555d6b258744","observation_id":"10bccea0-33e6-4810-9190-2e9cd6e583d6","resolution":{"observed_at":"2026-08-12T15:33:31.541921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.27437","last_updated":"2026-05-02T17:42:29Z","snapshot_observed_at":"2026-08-13T10:32:18.542608Z","submitted_at":"2026-03-28T22:49:40Z","title":"SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.27437","snapshot_observed_at":"2026-08-12T15:33:28.651082Z","title":"Spatialstack: Layered geometry-language fusion for 3d vlm spatial reasoning.arXiv preprint arXiv:2603.27437, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.651082Z"},"links":{"cited_paper":"/paper/2603.27437","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:f8c4afec9c8fa3c0a2ca70b46ce29dd39e947e8806794465a59bfed0465bf3a2","observation_id":"084fcc2b-0416-453a-88f8-c2da350228e7","resolution":{"observed_at":"2026-08-12T15:33:28.651082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.682876Z","title":"G2vlm: Geometry grounded vision language model with unified 3d reconstruction and spatial reasoning.arXiv preprint arXiv:2511.21688, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.682876Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:ae716daf165accfcfe4bd66c349cae62c5bbbb7aa5cea5635a4a7faf38236114","observation_id":"bb3b1a12-f7d2-46a3-a3ef-2d507a968d3b","resolution":{"observed_at":"2026-08-12T15:33:28.682876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.731186Z","title":"Think with 3d: Geometric imagination grounded spatial reasoning from limited views.arXiv preprint arXiv:2510.18632, 2026","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.731186Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:9be33880e6209291d6ec2c4757b0089928133120abba1c0c34d1ca63c2fd7588","observation_id":"a6476444-98df-496a-8dec-752400d760ba","resolution":{"observed_at":"2026-08-12T15:33:28.731186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04476","last_updated":"2026-05-12T10:07:13Z","snapshot_observed_at":"2026-08-11T01:23:00.247206Z","submitted_at":"2026-02-04T12:04:02Z","title":"Vision-aligned Latent Reasoning for Multi-modal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04476","snapshot_observed_at":"2026-08-12T15:33:28.783675Z","title":"Vision-aligned latent reasoning for multi-modal large language model.arXiv preprint arXiv:2602.04476, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.783675Z"},"links":{"cited_paper":"/paper/2602.04476","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:aaaa4039cc8e5ed0c2eab357f577be491c56238f2e1b06f25e5657803c97b4c1","observation_id":"a7c3b56b-2384-4993-af06-ca9fde4930fb","resolution":{"observed_at":"2026-08-12T15:33:28.783675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.487385Z","title":"Cambridge University Press, 2001","venue":null,"work_id":"d1024fa9-b23a-4fa8-a456-63e219189457","year":2001},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.816106Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:1accac1080058874b092644a74ffc99c7a4a1455fefef700a2e42b99a2800535","observation_id":"420ee94e-dab1-4a97-b330-7b95dfc9d6f4","resolution":{"observed_at":"2026-08-12T15:33:31.508886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.837244Z","title":"Cambridge University Press, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.837244Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:8da60272ea698f1b2707c97ec7f7b61f02a47b7581a95d00275884c1dac26b95","observation_id":"a1e511ba-3ad4-4ca0-be74-f96a6923cdf0","resolution":{"observed_at":"2026-08-12T15:33:28.837244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.847346Z","title":"Relational knowledge distillation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.847346Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:7783867f34d40abc86438b764f8322fcf2da8433a02a6fef1cc5c8738684dabf","observation_id":"58daaab1-74dc-4075-be49-655b718d8179","resolution":{"observed_at":"2026-08-12T15:33:28.847346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-13T10:44:26.934833Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-12T15:33:28.881926Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.881926Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:becd07f17a34a0dc7bfa3a8b48d92983fac60840fa931143b79da9302a1ee318","observation_id":"c5c2a94d-f3f4-41d6-824f-99fc63b9abef","resolution":{"observed_at":"2026-08-12T15:33:28.881926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-08-11T19:32:15.215968Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13181","snapshot_observed_at":"2026-08-12T15:33:28.893432Z","title":"Perception encoder: The best visual embeddings are not at the output of the network.arXiv preprint arXiv:2504.13181, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.893432Z"},"links":{"cited_paper":"/paper/2504.13181","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:5625e1c39676a7870b08e0c4c28423579431f2713bfebde26841e5831e67b5de","observation_id":"ceadf3e1-0473-4f8c-8652-8cbde385cbba","resolution":{"observed_at":"2026-08-12T15:33:28.893432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.414097Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"708c88e2-b2cd-440f-ba63-18d970bd8ff5","year":2017},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.897760Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:feda5d2bbea7f88397d134ac2150bf5fb1c776b3dd441c4d6dc242e9d5528284","observation_id":"b7f2d45a-2f0f-4047-ba08-e8d01fcba513","resolution":{"observed_at":"2026-08-12T15:33:31.442289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.346633Z","title":"Videorepa: Learning physics for video generation through relational alignment with foundation models.Advances in Neural Information Processing Systems, 38:122647– 122676, 2026","venue":null,"work_id":"6d01e691-60f2-478e-838a-c546dd9a17f1","year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.927333Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:057c1ec6b0d6cd64ca0d809dcdab4640ef90aab23fea1b96bbcf8dbc4708cd70","observation_id":"7d9ab556-828c-43a9-95f8-2f452d8dee24","resolution":{"observed_at":"2026-08-12T15:33:31.383300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.228517Z","title":"Moalign: Motion-centric representation alignment for video diffusion models","venue":null,"work_id":"87638d88-5539-4190-af90-e5d087628131","year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.983429Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:b9922417db40ec27ab8118ab8d75c64b017580033b2bec7e1d4bf74c556c4630","observation_id":"ae99a4e1-13d8-4c11-97b7-8dc38ff6acaa","resolution":{"observed_at":"2026-08-12T15:33:31.272471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.131651Z","title":"Lever- aging vision-language models for improving domain generalization in image classification","venue":null,"work_id":"e9873790-a4dd-4bae-a91f-8ba095154d2a","year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.047125Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:2be152aa3548a33760b7f0b59c953e5938d81b0512f1c24d7c19a4a289e7b73b","observation_id":"34256c33-f0dd-4f2e-83d0-80391481943f","resolution":{"observed_at":"2026-08-12T15:33:31.153761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T15:33:29.100129Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.100129Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:8a6ed8266140ad8193ae8bde9b662632b1bb8dd33a99a40ec047f2946e0b265f","observation_id":"b33995ff-cbda-4283-84df-d2ae3fc1b135","resolution":{"observed_at":"2026-08-12T15:33:29.100129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11417","last_updated":"2023-08-22T13:02:23Z","snapshot_observed_at":"2026-08-13T10:29:44.880731Z","submitted_at":"2023-08-22T13:02:23Z","title":"ScanNet++: A High-Fidelity Dataset of 3D Indoor Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11417","snapshot_observed_at":"2026-08-12T15:33:29.148328Z","title":"Scannet++: A high-fidelity dataset of 3d indoor scenes.arXiv preprint arXiv:2308.11417, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.148328Z"},"links":{"cited_paper":"/paper/2308.11417","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:7a0d4218f2d22dc1a9250a710b32308414aa6865902efc19fff540d470993bbb","observation_id":"be2c11c2-5218-40a3-9139-f67c19d73469","resolution":{"observed_at":"2026-08-12T15:33:29.148328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-12T15:33:29.171413Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data.arXiv preprint arXiv:2111.08897, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.171413Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:89370da1b1a1e50378eee1d0ff084010f3e58001294b3179d2a1a8301d2a5ae9","observation_id":"b9bca34a-8a20-46eb-b56e-c75c6970ab98","resolution":{"observed_at":"2026-08-12T15:33:29.171413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:29.175284Z","title":"Scaling spatial intelligence with multimodal foundation models.arXiv preprint arXiv:2511.13719, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.175284Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:4ba9485ea5834f5a34cd278a5a0dda1b9bf80da83e5fb106c937ad87f08bde0d","observation_id":"8a819d40-0fd1-4343-a531-38dee812edd0","resolution":{"observed_at":"2026-08-12T15:33:29.175284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T15:33:29.181722Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.181722Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:01c2e5da08231b037d967d530f947ee785bceeba64d1042f1fa63ec4baf0f5fe","observation_id":"f08d0c3c-1a81-4e3a-8b09-b52449f00a60","resolution":{"observed_at":"2026-08-12T15:33:29.181722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-13T00:05:34.358839Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-12T15:33:29.184264Z","title":"Grounded 3d-llm with referent tokens.arXiv preprint arXiv:2405.10370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.184264Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:20e58e46b1471915d6fbebd382b5d7ca592c4b5bc17c10b5242f00d3e7a9349a","observation_id":"7d3efa8d-16ba-4abc-a9bd-0e210dd59505","resolution":{"observed_at":"2026-08-12T15:33:29.184264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11442","last_updated":"2024-07-24T07:31:37Z","snapshot_observed_at":"2026-08-13T00:04:26.905756Z","submitted_at":"2024-05-19T04:35:05Z","title":"Unifying 3D Vision-Language Understanding via Promptable Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11442","snapshot_observed_at":"2026-08-12T15:33:29.188680Z","title":"Unifying 3d vision-language understanding via promptable queries.arXiv preprint arXiv:2405.11442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.188680Z"},"links":{"cited_paper":"/paper/2405.11442","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:b07916ff71092eb9a3d108d9f2565c1abdf53e79c68f9c950bac1945b95009fe","observation_id":"d48dd1ca-9762-44c5-a86c-d64e53f01c20","resolution":{"observed_at":"2026-08-12T15:33:29.188680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-13T05:03:16.391892Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-12T15:33:29.215429Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers.arXiv preprint arXiv:2312.08168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.215429Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:13f224a671245419b57b31a81cdfb97a7f492e580d24a8f172ae65487c467ff9","observation_id":"80814b0b-2ab0-46c3-a529-d5a44720240d","resolution":{"observed_at":"2026-08-12T15:33:29.215429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00513","last_updated":"2025-06-16T13:53:34Z","snapshot_observed_at":"2026-08-07T17:37:13.030352Z","submitted_at":"2025-03-01T14:38:42Z","title":"Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00513","snapshot_observed_at":"2026-08-12T15:33:29.277581Z","title":"Inst3d-lmm: Instance-aware 3d scene understanding with multi-modal instruction tuning.arXiv preprint arXiv:2503.00513, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.277581Z"},"links":{"cited_paper":"/paper/2503.00513","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:6a2c59c93a1aaf4f9f32e85550b4eac77f00c8c531df8d8427c58d1c2593fba1","observation_id":"8f0e4626-515e-4a87-82c9-1358dc631503","resolution":{"observed_at":"2026-08-12T15:33:29.277581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-12T01:26:20.728055Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01163","snapshot_observed_at":"2026-08-12T15:33:29.320043Z","title":"3d-llava: Towards generalist 3d lmms with omni superpoint transformer.arXiv preprint arXiv:2501.01163, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.320043Z"},"links":{"cited_paper":"/paper/2501.01163","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:784467f60580322fc106284d8ce7e6d0d5735b82bfcb7222128c33bacc404817","observation_id":"08779163-fc63-47d5-92c3-8e12b46253ba","resolution":{"observed_at":"2026-08-12T15:33:29.320043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-12T22:36:38.589325Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-12T15:33:29.367094Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv preprint arXiv:2409.18125, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.367094Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:16fff589b4f6373bfad56369f85d596783d845bb4a074e3a69141d670fd038a9","observation_id":"3a337eac-a6ff-4da2-9b54-bef0828e8066","resolution":{"observed_at":"2026-08-12T15:33:29.367094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00493","last_updated":"2025-03-27T10:30:42Z","snapshot_observed_at":"2026-08-12T23:13:45.948951Z","submitted_at":"2024-11-30T14:28:53Z","title":"Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00493","snapshot_observed_at":"2026-08-12T15:33:29.383190Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding.arXiv preprint arXiv:2412.00493, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.383190Z"},"links":{"cited_paper":"/paper/2412.00493","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:64280f088e3a07f391f747199812c41b42640da685377c6ed779df5e03ee3319","observation_id":"a34fcf9c-3f7f-4b4b-b317-abf2803f0958","resolution":{"observed_at":"2026-08-12T15:33:29.383190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01901","last_updated":"2025-04-02T16:59:55Z","snapshot_observed_at":"2026-08-07T16:14:03.001458Z","submitted_at":"2025-04-02T16:59:55Z","title":"Ross3D: Reconstructive Visual Instruction Tuning with 3D-Awareness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01901","snapshot_observed_at":"2026-08-12T15:33:29.389249Z","title":"Ross3d: Reconstructive visual instruction tuning with 3d-awareness.arXiv preprint arXiv:2504.01901, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.389249Z"},"links":{"cited_paper":"/paper/2504.01901","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:f38432cc5a744a99e8d45d9b7818b10de81aa4c9759ce245737b0f7cd3d7870b","observation_id":"42c428b8-ffda-4025-99c0-b416bcb1efcc","resolution":{"observed_at":"2026-08-12T15:33:29.389249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.08830","last_updated":"2020-11-11T09:33:31Z","snapshot_observed_at":"2026-07-06T08:45:31.167221Z","submitted_at":"2019-12-18T19:00:49Z","title":"ScanRefer: 3D Object Localization in RGB-D Scans using Natural Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.08830","snapshot_observed_at":"2026-08-12T15:33:29.392263Z","title":"Chang, and Matthias Nießner","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.392263Z"},"links":{"cited_paper":"/paper/1912.08830","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:70a8ea0314f9076146425cfc870a932067c8257554682098909d6ac8a3e29e38","observation_id":"5a57a09e-1a22-4cf4-aabe-9ef8fe282024","resolution":{"observed_at":"2026-08-12T15:33:29.392263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05251","last_updated":"2023-09-11T06:03:39Z","snapshot_observed_at":"2026-08-13T10:16:54.744546Z","submitted_at":"2023-09-11T06:03:39Z","title":"Multi3DRefer: Grounding Text Description to Multiple 3D Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05251","snapshot_observed_at":"2026-08-12T15:33:29.395853Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.395853Z"},"links":{"cited_paper":"/paper/2309.05251","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:6ba6ef01d7974cdf799784bbaed88a24d926c1a9c3561af044d864314e3ff618","observation_id":"59ee0b39-5d19-4f57-8997-2578b3ce65f0","resolution":{"observed_at":"2026-08-12T15:33:29.395853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.02206","last_updated":"2020-12-03T19:00:05Z","snapshot_observed_at":"2026-07-06T10:20:30.345301Z","submitted_at":"2020-12-03T19:00:05Z","title":"Scan2Cap: Context-aware Dense Captioning in RGB-D Scans","version":1},"cited_work":{"arxiv_id":"2012.02206","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.02206","snapshot_observed_at":"2026-08-12T15:33:29.969465Z","title":"Scan2Cap: Context-aware Dense Captioning in RGB-D Scans","venue":"cs.CV","work_id":"6a676092-a676-4db4-a0bc-ad1c57c7a3f0","year":2020},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.399144Z"},"links":{"cited_paper":"/paper/2012.02206","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:939f87313937fb00b74e438b4482fc1db677be34a3a5a300e5b6c1c1619d2d45","observation_id":"8ebeea71-6527-44ba-a6a1-93d19a00a5f6","resolution":{"observed_at":"2026-08-12T15:33:29.990241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10482","last_updated":"2022-05-07T21:55:42Z","snapshot_observed_at":"2026-08-13T17:12:08.238039Z","submitted_at":"2021-12-20T12:30:55Z","title":"ScanQA: 3D Question Answering for Spatial Scene Understanding","version":3},"cited_work":{"arxiv_id":"2112.10482","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10482","snapshot_observed_at":"2026-08-12T15:33:29.912941Z","title":"ScanQA: 3D Question Answering for Spatial Scene Understanding","venue":"cs.CV","work_id":"810487a0-f85e-4d22-8af4-1a643713f0fe","year":2021},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.425799Z"},"links":{"cited_paper":"/paper/2112.10482","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:af81d6fc75f8d9adfc2f5ef44e06581b70903d1742d43ba22babd1208e623a73","observation_id":"8636b1ed-3519-4725-a936-864a867a45f7","resolution":{"observed_at":"2026-08-12T15:33:29.939265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-13T14:05:27.706416Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-12T15:33:29.481703Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.481703Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:152c296bc7c615aafbf0d818abbc3d46828c53fc582789915acff75ce31f00f4","observation_id":"32cd7efc-d531-4675-b0dc-53185f7009b0","resolution":{"observed_at":"2026-08-12T15:33:29.481703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03105","last_updated":"2023-04-12T09:22:53Z","snapshot_observed_at":"2026-08-13T14:11:03.699375Z","submitted_at":"2022-10-06T17:55:09Z","title":"Mask3D: Mask Transformer for 3D Semantic Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03105","snapshot_observed_at":"2026-08-12T15:33:29.538485Z","title":"What is the length of the longest dimension . . . of the <object>. . . ?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.538485Z"},"links":{"cited_paper":"/paper/2210.03105","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:c1036b71cd426ef7a020db41bd781e99325decd4f155acead63f13ba130a6470","observation_id":"42ce05c5-32e2-4ad2-9e09-cdabc4cfc9f1","resolution":{"observed_at":"2026-08-12T15:33:29.538485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.113374Z","title":null,"venue":null,"work_id":"4f2989eb-7f32-46ff-8034-d2c84e330149","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.598617Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:fd5ba9115bac3d3fb88dac3fcfe18fc22dd225b9079a5f75ecca75cbd46af945","observation_id":"f6c8680a-2431-4bca-ac4a-f9586d1bbc40","resolution":{"observed_at":"2026-08-12T15:33:31.122134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.022698Z","title":null,"venue":null,"work_id":"7b74119c-c3e6-495a-8b35-0bf6cecca4a2","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.662827Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:8f521e90aeed79d266981f6940e9e7ff8fa2e5059c8941cc428f578f776fd9da","observation_id":"d4b87380-ad14-4e41-9610-156e596fdc85","resolution":{"observed_at":"2026-08-12T15:33:31.075624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.862000Z","title":null,"venue":null,"work_id":"df7231dc-707e-460e-ba31-377aea783a2d","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.699550Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:0329f85428e07ac967aed2d263e1880a472acad2f9c6e0dbfbd99fa4438ac0d9","observation_id":"282e49fa-6365-421a-adb5-a8656ab047ed","resolution":{"observed_at":"2026-08-12T15:33:30.938959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.821197Z","title":null,"venue":null,"work_id":"67b810ad-92e7-4ade-8f5b-9287d84a9470","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.734512Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:146adf727b048114337117c7e8d776fafa277f0ef2c6f61de19f7b8d8818a5ad","observation_id":"16b01bc7-69f0-4b7c-8490-4910cfaabd85","resolution":{"observed_at":"2026-08-12T15:33:30.824082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.812483Z","title":"We retain only patches that contain at least one valid-depth pixel; let V ⊆ {1,","venue":null,"work_id":"4e00af71-3939-48fb-9c72-ab45ef5bf75b","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.739770Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:0822002a9ecec5be3f907d088cb438251f31bbc9672422bed48a49eefc10715b","observation_id":"7b4a6676-c5b5-4cf8-a6a7-226466578864","resolution":{"observed_at":"2026-08-12T15:33:30.815753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.776219Z","title":null,"venue":null,"work_id":"49ee01b3-80c3-435f-a113-a2dcf02b4f7b","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.742791Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:f32b952d7eac0c376bb0f4885ca3f2fad034d1e5b22d5e73e01bb89cece5fea2","observation_id":"cc25501e-7ad7-4c4b-a7c8-1fa287ff6a73","resolution":{"observed_at":"2026-08-12T15:33:30.807455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.675329Z","title":null,"venue":null,"work_id":"45f243e7-d4e9-4036-a7d7-3e094da0bcb4","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.745742Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:f3e125b9a188c90ec0f0c11863b6a237f19f936ea658331f509f2d0a8cadadef","observation_id":"34ded46c-8425-4293-aec7-003f99db8477","resolution":{"observed_at":"2026-08-12T15:33:30.730339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.597297Z","title":"Dist., Room Size, Rel","venue":null,"work_id":"21d24a5d-363f-4f20-86e7-a364f23311b5","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.749409Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:bbb784dfcdb9c7af5faf6a76b17daf1e18fa6bd8083eacec2753f9a8713a8dd0","observation_id":"79576ef0-f845-47b8-ae6a-14427c427d17","resolution":{"observed_at":"2026-08-12T15:33:30.611920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.526462Z","title":"Feature. Dist","venue":null,"work_id":"277abcb5-9385-4642-9746-6a4e244a43f8","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.808181Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:0b3ccaa752d97a8e6c42845da0ec4040fd158eda544fa3ea1372f86348001113","observation_id":"6aed1b9d-374a-4b8b-8a21-a7fb85a65085","resolution":{"observed_at":"2026-08-12T15:33:30.561614Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T19:45:57.674731Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2608.10864."}