{"as_of":"2026-08-16T03:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af9c2c5def350e57cd2e20a0b93997df71d904782f94e72b161fc501f8b8a09a","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:08:10.299262Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01899/citation-record","integrity":"/paper/2608.01899/integrity","json":"/paper/2608.01899/citation-record.json","paper":"/paper/2608.01899"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:09.994202Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:09.994202Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:6a20acf9a75696c91396543741bcf29a7dd50b516855ccdc5b3fc398a2d0799e","observation_id":"b8848310-dcb0-4718-9285-b4e2314cce9c","resolution":{"observed_at":"2026-08-15T15:08:09.994202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:09.998452Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:09.998452Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:397cb1530aef6d2169ba8a86bf5ee8044984378a3b3a119a2d7bc536c01063e5","observation_id":"6f62e481-92ce-444e-944b-4e8c5553c78b","resolution":{"observed_at":"2026-08-15T15:08:09.998452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.002778Z","title":"IEEE transactions on pattern analysis and machine intelligence , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.002778Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:77df111753e01cebb85a57eca1bfa118285b592b4b579c7054391f2548994e49","observation_id":"e62aa995-b48d-44d8-863f-fee87493cd0a","resolution":{"observed_at":"2026-08-15T15:08:10.002778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.007021Z","title":"arXiv preprint arXiv:2503.01773 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.007021Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:a154808aa0b32164a52b3bd1472b3f136f36a44ab26a4f85eca9e93bc3097451","observation_id":"0db17a0d-c4ab-4d8c-882d-16631c3bbf13","resolution":{"observed_at":"2026-08-15T15:08:10.007021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.011077Z","title":"arXiv preprint arXiv:2503.17349 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.011077Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:95cbf3b66c66b2e8beca9afe3ef3c4cffbbefa16bc96a51ded74431aa0bd41ee","observation_id":"3155d4cd-15a0-4ee0-b01d-d95d3c24b4f5","resolution":{"observed_at":"2026-08-15T15:08:10.011077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.014809Z","title":"arXiv preprint arXiv:2509.18905 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.014809Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:d67122bb86314989299ae2160838dc50441810bfe2f3da450a0fe6b6e245f581","observation_id":"773a7ea6-a1a1-455f-95f3-027f0ee76c11","resolution":{"observed_at":"2026-08-15T15:08:10.014809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.09332","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:11.532468Z","title":"arXiv preprint arXiv:2509.09332 , year=","venue":null,"work_id":"301039f5-0d54-4e6a-9128-8ed7d7cc7670","year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.018527Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:812208ea35017e217ba814687140f97b795e8137dc5f1fc8f44877f26a5e48e9","observation_id":"1244430b-6002-4e75-a6b4-b9a56f73e0ba","resolution":{"observed_at":"2026-08-15T15:08:11.541670Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.022372Z","title":"arXiv preprint arXiv:2506.01946 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.022372Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:8b9c1c7f0df06788f2291d92f5ff857b6ac67bf2b705e1f13bfc680d42849f12","observation_id":"38fe9fd8-b4f3-4faa-9345-022aca713ce9","resolution":{"observed_at":"2026-08-15T15:08:10.022372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.026194Z","title":"arXiv preprint arXiv:2506.04308 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.026194Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:5a18b1308c8c9ae686898d80d1431a928d2d633c17c18fab93e434fb868539d0","observation_id":"3e4aff90-dad5-4416-b2f4-c9d8184cacdd","resolution":{"observed_at":"2026-08-15T15:08:10.026194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.029967Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.029967Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:e0f2a5254bfdb7b14596c38ef197117e9e7ed29fe2675d3fc82342800b4f1c84","observation_id":"e2f449e7-3da7-4c1c-b817-317100323fa0","resolution":{"observed_at":"2026-08-15T15:08:10.029967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.033848Z","title":"arXiv preprint arXiv:2510.13800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.033848Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:3c107ed866ede8ab59c72f5912bdb22a702c4721c0f367fd7d515030069c16e8","observation_id":"3e339f89-744a-4ad4-b61f-fd3cf427ceb1","resolution":{"observed_at":"2026-08-15T15:08:10.033848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.037808Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.037808Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:8f8a8e95d6768f56ebb0a6709593e274587bf853f909626a9065c1f74003e7ca","observation_id":"34013dd4-eb19-40aa-aac2-9ca0c4ae3d88","resolution":{"observed_at":"2026-08-15T15:08:10.037808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.041514Z","title":"arXiv preprint arXiv:2505.12448 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.041514Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:d25bad326087bbbe29ed31eaf38457e2773686682ceff06ff48b25288e9d1f55","observation_id":"5f047b01-a2f6-4fee-b446-6a8a3089d695","resolution":{"observed_at":"2026-08-15T15:08:10.041514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-15T15:08:10.044667Z","title":"arXiv preprint arXiv:2501.15830 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.044667Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:ff51296728be40115d8154acfea420636bc0dd37b2cf03a7d882062b822a42e4","observation_id":"cfbe3632-8440-452b-bec6-eadbb9a5a180","resolution":{"observed_at":"2026-08-15T15:08:10.044667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.048406Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.048406Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:0148a1b618a03a817d87fdfe0afc0193fad5b2a61ee7c85b42df79d7cfacb040","observation_id":"f950af22-c19e-4641-964b-a6bad81814a1","resolution":{"observed_at":"2026-08-15T15:08:10.048406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-15T15:08:10.052392Z","title":"arXiv preprint arXiv:2505.20279 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.052392Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:b6f1833e81b44cddd560a840fa8d824293d7d670533725681b803cda0c0c57a1","observation_id":"24210930-bfa1-4daa-ad6d-a4f5423e8fcc","resolution":{"observed_at":"2026-08-15T15:08:10.052392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.056496Z","title":"arXiv preprint arXiv:2505.24625 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.056496Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:89b51a70f08bba04e80c2c6af4d15aae819a75121aa5d82593626327c6c07a2c","observation_id":"e0f52b50-6e78-4608-b6ce-0fa06998de0a","resolution":{"observed_at":"2026-08-15T15:08:10.056496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-08-15T23:37:18.723910Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23747","snapshot_observed_at":"2026-08-15T15:08:10.060200Z","title":"arXiv preprint arXiv:2505.23747 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.060200Z"},"links":{"cited_paper":"/paper/2505.23747","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:9c7ca31dde5a0fa479004ba35e3e0b4737c8735f11105af0ecedbdecefe7505f","observation_id":"a999f830-30c9-4849-941a-0d633ea2419f","resolution":{"observed_at":"2026-08-15T15:08:10.060200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.063880Z","title":"arXiv preprint arXiv:2510.13375 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.063880Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:52c754ffa20822ea861f208dca49eeac7925c0bff479b9f81dae58d6cb56b8f5","observation_id":"335fa677-d79d-4fe3-9c1c-36bfb7967581","resolution":{"observed_at":"2026-08-15T15:08:10.063880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.067422Z","title":"arXiv preprint arXiv:2509.25413 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.067422Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:a480d4b4a87003031fb2b05189506eca35419be24bcf856d829e28f5033d4204","observation_id":"81dfeac8-49f2-44c0-9a32-225ba20cccf7","resolution":{"observed_at":"2026-08-15T15:08:10.067422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04670","last_updated":"2025-11-06T18:55:17Z","snapshot_observed_at":"2026-07-06T22:35:07.844255Z","submitted_at":"2025-11-06T18:55:17Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04670","snapshot_observed_at":"2026-08-15T15:08:10.070923Z","title":"arXiv preprint arXiv:2511.04670 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.070923Z"},"links":{"cited_paper":"/paper/2511.04670","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:f7ed4aa65c38f518a160fdde448a93051f8af985eab50d35b2603c693ce240bc","observation_id":"929f4769-f1ee-4734-b302-2cf289500171","resolution":{"observed_at":"2026-08-15T15:08:10.070923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02073","last_updated":"2025-04-21T12:09:08Z","snapshot_observed_at":"2026-08-02T06:32:26.688405Z","submitted_at":"2024-10-02T22:42:20Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02073","snapshot_observed_at":"2026-08-15T15:08:10.074520Z","title":"arXiv preprint arXiv:2410.02073 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.074520Z"},"links":{"cited_paper":"/paper/2410.02073","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:42b9f55df4de86aec616c52e4d725fc1196fff42eca294671c6043209b90773a","observation_id":"d9b4a329-1382-4eff-a447-0bd6d489075b","resolution":{"observed_at":"2026-08-15T15:08:10.074520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.078255Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.078255Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:e3fffffd2107871895279ba0dd51f881f1afc23e95e757fea8ea5a5d3fa408ec","observation_id":"92017cab-6a06-4fdf-975b-4476c640dd4f","resolution":{"observed_at":"2026-08-15T15:08:10.078255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.082156Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.082156Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:433b80925eb9f185caa1704486e8ed226ec7b5b3aa06476fd291b4da43dc11e5","observation_id":"f020c111-2719-4b60-a421-b5466240724e","resolution":{"observed_at":"2026-08-15T15:08:10.082156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.085693Z","title":"2025 IEEE International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.085693Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:88c312d92b57597d8250e6a2998c1f9610e2e641df7ead426a8c621dd8831fdb","observation_id":"fae56157-e09c-46e3-a597-0934b0b9ade6","resolution":{"observed_at":"2026-08-15T15:08:10.085693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.090072Z","title":"arXiv preprint arXiv:2511.05491 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.090072Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:c1d7fe13058aaa566934233d03bd61392907e84744b45f560905109dbaacf72c","observation_id":"25be8de6-2c5d-4fae-8189-9e946d0e4e43","resolution":{"observed_at":"2026-08-15T15:08:10.090072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.093794Z","title":"arXiv preprint arXiv:2511.13719 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.093794Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:84092f3b48c0737dfd24feab74d56469bdc10452b79f3883976a9beaff38c594","observation_id":"4978c184-5cfb-43da-8e50-576c13c3bb7f","resolution":{"observed_at":"2026-08-15T15:08:10.093794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-15T04:55:15.159462Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T15:08:10.098045Z","title":"arXiv preprint arXiv:2406.09246 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.098045Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:8406726b7e6c1ac96a1a5c96bbaddeed6b75dd64a583cbe4ffd7eb19239a069f","observation_id":"33f88e37-dfaa-4b87-b331-0bee34a0b124","resolution":{"observed_at":"2026-08-15T15:08:10.098045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T15:08:10.102107Z","title":"CoRR, abs/2410.24164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.102107Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:0226a6c074ed7e6711cfa4e24b2ca9062721eee714512d2ad9cd1cf40b469b8f","observation_id":"52e51b28-043c-48f3-b668-4fd39d6a13b8","resolution":{"observed_at":"2026-08-15T15:08:10.102107Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-15T15:08:10.106096Z","title":"arXiv preprint arXiv:2504.16054 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.106096Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:4af59e30d21bc0a641e4ce1c283de2e45548fd0b47b7c2794441e7a2301549b8","observation_id":"c7877a9f-6149-4cf2-a13c-15229f3b6ec7","resolution":{"observed_at":"2026-08-15T15:08:10.106096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-15T15:08:10.110198Z","title":"arXiv preprint arXiv:2503.14734 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.110198Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:561a3b1f8e04c6897c58610493682e41417c1d58727d625f2a20121e5e55e63b","observation_id":"9a74ffe6-be85-4d75-93c7-31f500e6c3f1","resolution":{"observed_at":"2026-08-15T15:08:10.110198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-14T14:47:44.698063Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-08-15T15:08:10.115509Z","title":"arXiv preprint arXiv:2505.21906 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.115509Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:7f5ca3ea84b9decb4a72d8774d45c93fa20f0643de45d7cdb50efb8038d2a0ea","observation_id":"7182c33b-5725-4bcf-a650-ddc8ef32db45","resolution":{"observed_at":"2026-08-15T15:08:10.115509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.119439Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.119439Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:fb0e69f4162750afa817f5acb47341cb5bfa8b9a586de359a80b80f474b39d23","observation_id":"f00df1b7-6bd7-4984-bada-03c0ecdbad78","resolution":{"observed_at":"2026-08-15T15:08:10.119439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-08-15T23:16:19.228206Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-15T15:08:10.122723Z","title":"arXiv preprint arXiv:2511.10647 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.122723Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:f46fef3c0dbfec0b3bdbaa9589589d4f6d136107e82905699f03cad4a7a6b12a","observation_id":"5d4ba3d4-208c-4c33-b0dc-1a591bf7f3dc","resolution":{"observed_at":"2026-08-15T15:08:10.122723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.126229Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.126229Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:941c66d2f07211be7c7d95e106b7b02c9a70e1a4ec4cca7cc62b934a800f24bc","observation_id":"76472e7d-95ca-4762-85ee-032562b1cfff","resolution":{"observed_at":"2026-08-15T15:08:10.126229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.129455Z","title":"arXiv preprint arXiv:2510.13054 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.129455Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:f873e76a8299aba64b384120f190c8d6a1b4b1da0ec8a6ff285fef31b9885d6f","observation_id":"004c95d5-15d1-4e36-97e1-9c5c5c9319ca","resolution":{"observed_at":"2026-08-15T15:08:10.129455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-15T15:08:10.132964Z","title":"arXiv preprint arXiv:2502.19645 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.132964Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:32f8379880d235d39591e5612237daa7d9b1d1c6d003191485b0bf741a429cfe","observation_id":"d0971804-4448-4522-8f26-f03a8c6f2937","resolution":{"observed_at":"2026-08-15T15:08:10.132964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:11.937155Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"d845d984-46a3-4ede-ac4b-9b1e7e0d4980","year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.136567Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:0d03e10b160aa4d3b4e495059474a4991a49774fb4ee5cd2132b395858856caa","observation_id":"3693f6d4-daa7-4dc8-b3e2-2ba944310fb6","resolution":{"observed_at":"2026-08-15T15:08:11.940877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.139878Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.139878Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:97a1c0ed2f18b245918e28d6fed90515d0fd563bdb469a1b1b43833a175e4f85","observation_id":"d0a7176f-7016-4010-8273-648b330d6392","resolution":{"observed_at":"2026-08-15T15:08:10.139878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.143408Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.143408Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:0db5adfcabcce1d80bf9e7dcfb79991768459c3f2d7b35d7a15e69e2d2abdf64","observation_id":"383aa0f8-3988-4f04-bd1e-e965e6b4c36e","resolution":{"observed_at":"2026-08-15T15:08:10.143408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.146948Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.146948Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:036db1937bef40a6a4ddc17382175c163a253d41d16b0ab1444a883555bef005","observation_id":"a49079e5-35d1-4bf5-8624-5341038c98fe","resolution":{"observed_at":"2026-08-15T15:08:10.146948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-08-16T03:39:21.994462Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-15T15:08:10.151163Z","title":"arXiv preprint arXiv:2501.13826 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.151163Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:42a09db8f852f83aef74951cd7c5d31a5338c91caba2be62059ceb3e21314113","observation_id":"06e5e7e9-ab29-454e-9fd2-728c23d8783f","resolution":{"observed_at":"2026-08-15T15:08:10.151163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.154858Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.154858Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:4aede392f4a6e276165b8a55e01005d959d9ada770f186f306beadec027dc959","observation_id":"9fda7044-ab8f-41f5-b434-b7431ef78512","resolution":{"observed_at":"2026-08-15T15:08:10.154858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-15T15:08:10.158321Z","title":"arXiv preprint arXiv:2505.06111 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.158321Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:6f196db8b965fc59843410fd72cb3e1eca5274930016fa50b50164da1d6c7037","observation_id":"86c022b2-abff-4f3c-96bc-b3ec76b18060","resolution":{"observed_at":"2026-08-15T15:08:10.158321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-08-13T11:17:54.365190Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-15T15:08:10.161892Z","title":"arXiv preprint arXiv:2506.01844 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.161892Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:65bf88b0e200e7eeb8b339f2d2cbc7d21c75b3bbac36655771995ba36610b13d","observation_id":"efa3b36c-893b-4835-a838-3ae598fb5470","resolution":{"observed_at":"2026-08-15T15:08:10.161892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.165360Z","title":"arXiv preprint arXiv:2508.18269 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.165360Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:f84e2f66d6a91bc9d4fc52cb64335aa5a3d65f9cb3846dd0ee961e14ade1a8c5","observation_id":"82f7e42a-beb1-4f3c-9716-fd1472c7d891","resolution":{"observed_at":"2026-08-15T15:08:10.165360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-15T15:08:10.169529Z","title":"arXiv preprint arXiv:2503.15558 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.169529Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:5a7f26ecd16659702be04d4361b65b2c6f7885c5cd514da288a242d0b99c6e99","observation_id":"073605da-fa7d-4423-9bc0-590f142dbc87","resolution":{"observed_at":"2026-08-15T15:08:10.169529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T15:08:10.173432Z","title":"5-vl technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.173432Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:94c4cd561bafb9fc69ca2e813a90e672ffcd972e82a69a8c1f3d098dfbd9adab","observation_id":"32085fe6-0ef5-4750-930a-518898088f9d","resolution":{"observed_at":"2026-08-15T15:08:10.173432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.176743Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.176743Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:aaccc11e800d3850a16966a28b13929ffccb1283ca9f9ee3e14f5fd779218047","observation_id":"5d0ea939-7a64-4072-9dc8-aaf2c4727e86","resolution":{"observed_at":"2026-08-15T15:08:10.176743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-15T15:08:10.180305Z","title":"arXiv preprint arXiv:2508.18265 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.180305Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:286eef40b6c1dc5ad50af064f50965ba1fec05308095d55ff5bd02265cf97f1c","observation_id":"6081fc44-87e2-4eed-a87b-3473cc8adba3","resolution":{"observed_at":"2026-08-15T15:08:10.180305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.184135Z","title":"LLaVA-NeXT: A Strong Zero-shot Video Understanding Model , url=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.184135Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:05ebc8a51ba0949a26528a3025991024f1d24048daa2bc1f9d08ce48bda6659c","observation_id":"242df485-fd2b-4be4-81eb-7d97fb2e1940","resolution":{"observed_at":"2026-08-15T15:08:10.184135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.187614Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.187614Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:e5c8ca764e83e5b01a65f50c07c988a49c74398a8fb3ffd7b0aded83af3d2fb2","observation_id":"989e9969-7e7c-4081-9049-498ef2b9efb1","resolution":{"observed_at":"2026-08-15T15:08:10.187614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-15T15:08:10.191584Z","title":"arXiv preprint arXiv:2505.07062 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.191584Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:7b3396c4bedc0f170f9983aaaf60bf4d0d98dab5bd549f45c197b41165ad412b","observation_id":"782bbbab-77f7-4c03-a458-bf49910d53c5","resolution":{"observed_at":"2026-08-15T15:08:10.191584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-15T15:08:10.195853Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.195853Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:25ac4d8d12d48158971f8ce747d31b8c764f3ee8fbc2003dbe0f84c8a4d6bbc6","observation_id":"28dad9aa-0c89-4f2d-bb70-bd1bdd1007ab","resolution":{"observed_at":"2026-08-15T15:08:10.195853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-08-13T19:00:10.952463Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16518","snapshot_observed_at":"2026-08-15T15:08:10.200174Z","title":"arXiv preprint arXiv:2511.16518 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.200174Z"},"links":{"cited_paper":"/paper/2511.16518","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:74edf681a2c06028830bb6114b3c5bebd0e4e5a5705f0590b7823dc38e177c57","observation_id":"e37a52df-66ab-499a-93fe-2c4c00a5651c","resolution":{"observed_at":"2026-08-15T15:08:10.200174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.204796Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.204796Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:60c84da22fa72401e7756fab476cca8b04d93be2eb85e935d9ad3c19521e2f85","observation_id":"81b17312-3105-4e6f-a28b-c51687e73922","resolution":{"observed_at":"2026-08-15T15:08:10.204796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.208183Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.208183Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:1f6303c75aa7300d246c2eca7b83c3a341b37642ca3038ace7618996a40c5d4b","observation_id":"e072c118-4f45-4919-af2d-8716e6292995","resolution":{"observed_at":"2026-08-15T15:08:10.208183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.211361Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.211361Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:c59b7cfd6375dab62a17bbb1c77fd7aa335a6e91e023c8105dd96701da3620da","observation_id":"6721cb0d-8e0d-434c-ac64-2fc0cdbbf464","resolution":{"observed_at":"2026-08-15T15:08:10.211361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.214609Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.214609Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:67a60439ab85f4c7a6b86a504472dfee732e7cd3057185b72053470c7d2bfe24","observation_id":"0b7e0b1b-2c81-489c-9cc7-fb096fb74d41","resolution":{"observed_at":"2026-08-15T15:08:10.214609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-15T15:08:10.218090Z","title":"arXiv preprint arXiv:2111.08897 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.218090Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:0686edfdc56a247a8cdd1fe77d58c6f68b18cd6c5e7d4f46f8e821d3eeb0c436","observation_id":"45ba04f5-5a83-40c6-9ae9-93ddeadf835f","resolution":{"observed_at":"2026-08-15T15:08:10.218090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.221464Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.221464Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:5fb651f935acadfc500df19a8f29a97827a25e6bb012721d8c030cc833f4e44c","observation_id":"b63cb3c8-5df9-40c9-b0ad-ca7cd23ad943","resolution":{"observed_at":"2026-08-15T15:08:10.221464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.224769Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.224769Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:c2f91713411738b9f1aa82404a042c7e8802aaae2185a130e8b4b53add8f3984","observation_id":"39bf2a94-bfbe-4563-bbf9-516092352eac","resolution":{"observed_at":"2026-08-15T15:08:10.224769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.228209Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.228209Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:b18d7c19c7ca195d779cbb98c5363e520df1ab4b88cd4c80b3daf060ec1298d2","observation_id":"f25691ba-d002-4b08-b370-48ffeaa1d0cc","resolution":{"observed_at":"2026-08-15T15:08:10.228209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.10773","last_updated":"2020-01-29T12:13:20Z","snapshot_observed_at":"2026-07-06T08:53:28.193420Z","submitted_at":"2020-01-29T12:13:20Z","title":"Virtual KITTI 2","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.10773","snapshot_observed_at":"2026-08-15T15:08:10.232197Z","title":"arXiv preprint arXiv:2001.10773 , year=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.232197Z"},"links":{"cited_paper":"/paper/2001.10773","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:cd559410df796e6a82b3b07eeda335bb812fe63d17e8a7d061df709fcf3b8114","observation_id":"2b2607a5-c18a-45a8-a910-c61efb6508ac","resolution":{"observed_at":"2026-08-15T15:08:10.232197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-13T14:05:27.706416Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-15T15:08:10.235780Z","title":"arXiv preprint arXiv:2210.07474 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.235780Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:416b11c036aef53a92888d619323aa37f95ae4321611d38837b81dcbe948490a","observation_id":"1c97c294-4d7f-4147-b2f8-df8ad2e07620","resolution":{"observed_at":"2026-08-15T15:08:10.235780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.239710Z","title":"proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.239710Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:076c2a94294a041f09832b870f43c5efb76878778761191d7d049e29b52e2940","observation_id":"4dd5da3b-bee4-41f6-9735-66bf3dabc150","resolution":{"observed_at":"2026-08-15T15:08:10.239710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.242927Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.242927Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:6825b451156df9c271dd237648d52741ec979c6475be7459a4f34a05b7024ec6","observation_id":"b11e7624-cf49-4813-8575-fd2ee1887efa","resolution":{"observed_at":"2026-08-15T15:08:10.242927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.246223Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.246223Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:a168bfe8db6f3f5fa3bb2769baaf9f93aa5b759be13a159f8f4eb0b4449d82b3","observation_id":"767ad612-a545-47d4-b4c1-ec951e3eafdd","resolution":{"observed_at":"2026-08-15T15:08:10.246223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:11.821764Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"5f5c033e-1386-4f0c-9e8c-f9ef4b2e2f7c","year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.249673Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:aa4e467e4f893cef6a800bf73756655367c68dc7c99c215d096c0623e12291ea","observation_id":"433131b0-99ba-4a91-bf5f-cf0eeba3d844","resolution":{"observed_at":"2026-08-15T15:08:11.825372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.252980Z","title":"The international journal of robotics research , volume=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.252980Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:4a2cc165b1e5beadb0a9a0cc37cfcf7710aeff02a4eea46bc0b73df1d9b0ce64","observation_id":"5c4b15ae-f0af-4320-a5bf-a57c4b1eb904","resolution":{"observed_at":"2026-08-15T15:08:10.252980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.256437Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.256437Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:9e4f2adc2bbc559d3b488a23799f90052f06eab9bbc97b24b65ddc3a5da7c3ec","observation_id":"502c1cb8-27c7-4b61-9345-9ae5154a4e49","resolution":{"observed_at":"2026-08-15T15:08:10.256437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T15:08:10.260290Z","title":"arXiv preprint arXiv:2410.21276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.260290Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:d3e092a3d9a711bb9349692a6d50ece2f6b533e834ca53f6e12d76e4d625798d","observation_id":"3d1a9da0-79e6-43c9-bdb6-66e5e438e00a","resolution":{"observed_at":"2026-08-15T15:08:10.260290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:11.799017Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"5fce7d60-c6f1-424a-b2bc-d6a933d21c6c","year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.263361Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:f7af889ae5fd77eca7674b74671e113b9b68d9d4b194818dd97c458d7c2cab46","observation_id":"03b360a9-2ceb-418e-81d8-bf2f27c60d57","resolution":{"observed_at":"2026-08-15T15:08:11.802754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:11.788060Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"04756107-9982-465a-b36c-2c4226ded735","year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.267499Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:dd265c3057c7be3a39ca9391cf8d5a4d2ba0ae9ea215f50db12b6e49418e761d","observation_id":"7b36932b-0625-4e4b-91b5-50ae042171d8","resolution":{"observed_at":"2026-08-15T15:08:11.791941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:11.777611Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":"3c82d605-60c2-44f8-b765-44734d18f6df","year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.271044Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:2ddca46812e37a74438f5d36f09c81a775cee4e20da2d6965eff24e7e268e0e3","observation_id":"7b776672-c1e3-4c52-9f86-ff88c6b9befe","resolution":{"observed_at":"2026-08-15T15:08:11.781165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:11.766520Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"7939b850-53cc-4914-b16a-bb49e80b4bad","year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.286451Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:addd6ba91314c16e8fa4134c382503afa267cbd99ac69f68e905ea008cab81b7","observation_id":"6a23ec32-603d-4c59-b7b7-070b9206706b","resolution":{"observed_at":"2026-08-15T15:08:11.770220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.290790Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.290790Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:16cce175ab47f61b7e5930a65f007e49456a0635fb153b4548b469b8e017ca62","observation_id":"64c875bf-ea2f-40e5-b7c3-77e3ad16fc07","resolution":{"observed_at":"2026-08-15T15:08:10.290790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:11.748926Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"3561b4c5-a3aa-4a8b-9075-52e12d3a279a","year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.295112Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:b29f9a475d5d74be0a8accf82911b3ff5f3c4049fa87a08cf3d27858ffe56892","observation_id":"47d221e8-4b8a-404b-a578-206db2051555","resolution":{"observed_at":"2026-08-15T15:08:11.753395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:08:10.299262Z","title":"arXiv preprint arXiv:2512.08889 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.299262Z"},"links":{"citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:55e6969d3d43878160d84c9a6d9adee0aa36d5bc89d0349050e7e597e9cec016","observation_id":"32449b10-0cda-41e4-b507-e6c0d2b2ca1b","resolution":{"observed_at":"2026-08-15T15:08:10.299262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T03:40:04.489951Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2608.01899."}