{"as_of":"2026-08-10T00:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c04d73355c7acd663f3c4d9ec5fdf10d148eddcb19e73f836d52c0a68c389f3b","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T02:49:59.483783Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14228/citation-record","integrity":"/paper/2607.14228/integrity","json":"/paper/2607.14228/citation-record.json","paper":"/paper/2607.14228"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:52.981552Z","title":"Cognitive maps in rats and men.Psychological review, 55(4):189, 1948","venue":null,"work_id":null,"year":1948},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:52.981552Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b23b39476f92d33ac28b3ed4c7f357d3e14fedc57cb77d8f6536ea4a3e287749","observation_id":"abc15ddd-c321-47e8-a778-8c6473bffc0e","resolution":{"observed_at":"2026-08-02T02:49:52.981552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.049361Z","title":"Psychology press, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.049361Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:56b90cee762310d3d64c19717ff157d4429acfe7f8a0405fd527750a1bf27f74","observation_id":"4d34e24c-9b29-48a1-87bb-6ff6ca5504cb","resolution":{"observed_at":"2026-08-02T02:49:53.049361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.124576Z","title":"Mental rotation of three-dimensional objects.Science, 171(3972):701–703, 1971","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.124576Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:47ee5d15a9dca46fdea9de029d22d5f599e438714a0aa82497a632ee3e7890f3","observation_id":"c50de181-4e2f-4eda-babe-0fa32b484600","resolution":{"observed_at":"2026-08-02T02:49:53.124576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.215235Z","title":"Routledge, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.215235Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:3874c06d7bfe5da7449db9f1298be5317a2d770e5a11cc91744087910ee7eaba","observation_id":"5cf72d12-03ea-45f0-a3a9-3c12cc85a67c","resolution":{"observed_at":"2026-08-02T02:49:53.215235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.305240Z","title":"Allocentric and egocentric spatial representations: Definitions, distinctions, and interconnections","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.305240Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b56c07f202bf3ecc0a12bf68bdb80f4567ece18eafb4907c7933a52995b36a0e","observation_id":"4a2946a3-ddf0-4e1f-b706-039ad811336c","resolution":{"observed_at":"2026-08-02T02:49:53.305240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.392665Z","title":"Structure-from-motion revisited","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.392665Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:2d8c744aba24470faff37a33d5b868856a8227702f2d51947cc7c7b708bc04e6","observation_id":"aebe0e12-5b96-4c55-a0c7-8b732084eae4","resolution":{"observed_at":"2026-08-02T02:49:53.392665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.515355Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.515355Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:7c80c248ceb073dc0f1f499d8ffb681180e1d7a5b24a3736caf6662a903a7893","observation_id":"6f1f561b-de63-4b9e-8af4-cd2ed30d1c09","resolution":{"observed_at":"2026-08-02T02:49:53.515355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.604225Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.604225Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:49cccd5a39de2fd2ad2d9ab5876d2806c148ecc020c52c4876788b2c7869bba3","observation_id":"c089dfc0-b922-47c0-88c4-1ae40947a7c7","resolution":{"observed_at":"2026-08-02T02:49:53.604225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.689989Z","title":"Efficiently reconstructing dynamic scenes one d4rt at a time.arXiv preprint arXiv:2512.08924, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.689989Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:bdc3fe8aafc78dd61bab093ce6dd6cff4d39aed9774601e98a7b072d84bd71a2","observation_id":"9801fa88-3373-4ad5-aa04-b99a89395f2e","resolution":{"observed_at":"2026-08-02T02:49:53.689989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.781220Z","title":"IndyPublish.com, 1709","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.781220Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:00f9a2d1a6eb151eb9f9ab5d5d3e5fc7902afd5d3561365bfaa81dd95c4723ce","observation_id":"bff512d8-de4d-4ac6-bc4f-3a0c5a79ef2d","resolution":{"observed_at":"2026-08-02T02:49:53.781220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.866266Z","title":"Movement-produced stimulation in the development of visually guided behavior.Journal of comparative and physiological psychology, 56(5):872, 1963","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.866266Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:95f0d067f38b2eacf5a936ef372059426cce140421f175afeb368c1f08ec6132","observation_id":"69632af4-7365-4b31-903d-d0608a64732f","resolution":{"observed_at":"2026-08-02T02:49:53.866266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.952244Z","title":"Dover Publications, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.952244Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:7aa990b0a49a2baf462bf855f7ef9f95887e9e98494624512d4d6d0fca1f299c","observation_id":"56980e35-3452-4591-ae6d-19b8515908e2","resolution":{"observed_at":"2026-08-02T02:49:53.952244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:54.011355Z","title":"Probing the 3D awareness of visual foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.011355Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:bcc125f1f6c6ee67871c08d9ce3aacfa783ed017e3bf5d929c410d4dc213dc44","observation_id":"0ee60687-7eb5-44e5-87fd-57dcd074851b","resolution":{"observed_at":"2026-08-02T02:49:54.011355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:54.099584Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.099584Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:ae1b6443f9b942a055d399b82147e20b7be100bf1b7216c40b0d95d62b96ea80","observation_id":"716dd49a-403e-4f69-a629-b9404d70075f","resolution":{"observed_at":"2026-08-02T02:49:54.099584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:54.216540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.216540Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:d6ff109a19532d9719810d29a529d9588198ef84c84997493e8d408dff3604bd","observation_id":"c110b14d-c84c-4992-b867-e25a2f25dec0","resolution":{"observed_at":"2026-08-02T02:49:54.216540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:54.318110Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.318110Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:5a87f3838c9f3bb83b8317c09fda6e5d215aea0f1367666bebe994e32afc0764","observation_id":"c46e67e7-d231-4ecd-a6c4-6edd5d5e9b3d","resolution":{"observed_at":"2026-08-02T02:49:54.318110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:54.384049Z","title":"Nomad: Goal masked diffusion policies for navigation and exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.384049Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:5f9fae34e7c62027ce5f6ec82d2b1cfb9a22a970a4fb7b9c508e01bd4579d93b","observation_id":"06e67f82-a6df-43cb-90d6-f000dd7f573f","resolution":{"observed_at":"2026-08-02T02:49:54.384049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11812","last_updated":"2024-08-21T17:57:51Z","snapshot_observed_at":"2026-08-03T05:45:43.939088Z","submitted_at":"2024-08-21T17:57:51Z","title":"Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11812","snapshot_observed_at":"2026-08-02T02:49:54.476331Z","title":"Scaling cross- embodied learning: One policy for manipulation, navigation, locomotion and aviation.arXiv preprint arXiv:2408.11812, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.476331Z"},"links":{"cited_paper":"/paper/2408.11812","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:128f37abe2fec49f26b096f46bcfc78d7ad7eea7f2bc0460f914f725f388e6ec","observation_id":"9adbfae2-0075-4fa5-9f5f-951ba7a449a8","resolution":{"observed_at":"2026-08-02T02:49:54.476331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25937","last_updated":"2026-06-15T19:34:05Z","snapshot_observed_at":"2026-07-13T17:55:05.093630Z","submitted_at":"2026-03-26T22:04:49Z","title":"Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25937","snapshot_observed_at":"2026-08-02T02:49:54.572749Z","title":"Can vision founda- tion models navigate? zero-shot real-world evaluation and lessons learned.arXiv preprint arXiv:2603.25937, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.572749Z"},"links":{"cited_paper":"/paper/2603.25937","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:d2d3bd893fb50da017b836506097f0e51176feccb949b09d545ca47331523c3c","observation_id":"cf8919a2-38cd-4aeb-93ff-c49775824eab","resolution":{"observed_at":"2026-08-02T02:49:54.572749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:54.686992Z","title":"Navigation world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.686992Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b508f0f30631d7e5dce3f62154c24e179ce5329416606f6262abf0a0c10aa6ef","observation_id":"0bb7320a-0447-44c3-8fb7-4adbbf2b4f92","resolution":{"observed_at":"2026-08-02T02:49:54.686992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14482","last_updated":"2026-06-11T10:07:56Z","snapshot_observed_at":"2026-08-06T07:23:27.418432Z","submitted_at":"2026-03-15T17:02:40Z","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14482","snapshot_observed_at":"2026-08-02T02:49:54.804262Z","title":"V-JEPA 2.1: Unlocking dense features in video self-supervised learning.arXiv preprint arXiv:2603.14482, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.804262Z"},"links":{"cited_paper":"/paper/2603.14482","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:bd3c5c7e04b4af0890a38781c61858ccb5e1d224f5e536b94aed81e654ee05ce","observation_id":"905e69c5-6daf-496b-97a4-eaab25bba187","resolution":{"observed_at":"2026-08-02T02:49:54.804262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19458","last_updated":"2025-02-19T05:16:27Z","snapshot_observed_at":"2026-08-04T07:54:56.431304Z","submitted_at":"2024-11-29T04:02:11Z","title":"Multiview Equivariance Improves 3D Correspondence Understanding with Minimal Feature Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19458","snapshot_observed_at":"2026-08-02T02:49:54.935447Z","title":"Multiview equivariance improves 3D correspondence understanding with minimal feature finetuning.arXiv preprint arXiv:2411.19458, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.935447Z"},"links":{"cited_paper":"/paper/2411.19458","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:aaea5b08d684e375fe1eb6370e4dbe740503066978e8bf0e214825ee9f14ffb4","observation_id":"527f767b-c365-4942-8bdf-2c944d854ef2","resolution":{"observed_at":"2026-08-02T02:49:54.935447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-08-07T13:01:28.667448Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-08-02T02:49:55.065331Z","title":"Deep ViT features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.065331Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:728da2d7e76c661f99bd6fc392b0abe2478b13249a85a6953ecdcd29b7038ed7","observation_id":"97913c0c-7a46-4454-8f37-adad8f4aa698","resolution":{"observed_at":"2026-08-02T02:49:55.065331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.160484Z","title":"How much 3d do video foundation models encode?arXiv preprint arXiv:2512.19949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.160484Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:03537cfbd0f2bfd998121e3d0e2d44bf6a73d8e984312f2aaf7d0eb69528bd63","observation_id":"436b372f-a22c-47b2-8ac7-242871704021","resolution":{"observed_at":"2026-08-02T02:49:55.160484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.258462Z","title":"Lexicon3D: Probing visual foundation models for complex 3D scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.258462Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:0849e11f02db756992885fdd9327492d41b5fdcaf4281aeef148c558bdd8d375","observation_id":"c33fe453-0ab4-418d-a067-95dc4e4309e2","resolution":{"observed_at":"2026-08-02T02:49:55.258462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00987","last_updated":"2023-06-01T17:59:57Z","snapshot_observed_at":"2026-07-06T15:36:45.014921Z","submitted_at":"2023-06-01T17:59:57Z","title":"StyleGAN knows Normal, Depth, Albedo, and More","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00987","snapshot_observed_at":"2026-08-02T02:49:55.355388Z","title":"Bhattad, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.355388Z"},"links":{"cited_paper":"/paper/2306.00987","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:3a0d356b4b052cd6bf3fa503817b2951f7811d50ba6c0f64de80687969817ec1","observation_id":"eeaf119c-bcfc-420a-a1ed-f43da3a5c3db","resolution":{"observed_at":"2026-08-02T02:49:55.355388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05720","last_updated":"2023-11-04T19:22:35Z","snapshot_observed_at":"2026-08-02T13:34:52.246639Z","submitted_at":"2023-06-09T07:34:34Z","title":"Beyond Surface Statistics: Scene Representations in a Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05720","snapshot_observed_at":"2026-08-02T02:49:55.448225Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.448225Z"},"links":{"cited_paper":"/paper/2306.05720","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:fceb12a324dbac387140373c810168cf2de232c23ba9ee7d6d138ce03762ef1c","observation_id":"f8cb63e4-e76e-4f21-8b0e-6d6f1beb3a89","resolution":{"observed_at":"2026-08-02T02:49:55.448225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.570997Z","title":"Campos, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.570997Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:00ec75d6945ff5441e5b39593a6acf072346c640696ad6e11964c72795fabc62","observation_id":"bacba978-6287-46ce-86d4-d7e488b9d4a7","resolution":{"observed_at":"2026-08-02T02:49:55.570997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.638240Z","title":"Rust: Latent neural scene representations from unposed imagery","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.638240Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:e064548a1c41529e56e278def513dedfe4a08fc0656773821ffca0c1535d9ae7","observation_id":"029de8cc-ef3c-47f1-974f-94a46e1acf5c","resolution":{"observed_at":"2026-08-02T02:49:55.638240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.716510Z","title":"True self-supervised novel view synthesis is transferable.arXiv preprint arXiv:2510.13063, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.716510Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:768eb4e489bd4aacb360f43883a1f3a998d05257b2bff77d2f45e153402ddd96","observation_id":"72687d56-268b-4d3a-a8d1-f9c3a9b3078c","resolution":{"observed_at":"2026-08-02T02:49:55.716510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.806542Z","title":"Primary visual cortex straightens natural video trajectories.Nature communications, 12(1):5982, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.806542Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b9ba7bfab4aac0efe3bfa0b435a1f85d650c252516ed7308179c949e4e1768de","observation_id":"6a7f768b-2608-4e6b-9d5c-c1fb394f5c19","resolution":{"observed_at":"2026-08-02T02:49:55.806542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19312","last_updated":"2026-06-03T18:50:40Z","snapshot_observed_at":"2026-08-06T05:42:53.129146Z","submitted_at":"2026-03-13T19:48:14Z","title":"LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.19312","snapshot_observed_at":"2026-08-02T02:49:55.870956Z","title":"LeWorld- Model: Stable end-to-end joint-embedding predictive architecture from pixels.arXiv preprint arXiv:2603.19312, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.870956Z"},"links":{"cited_paper":"/paper/2603.19312","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:2b586635952ba2af84844ab6abb0168e228d66a9925a5fd2e4ce6c05b5952fb3","observation_id":"517bff1d-2a43-439b-abc4-02ebf34b8d08","resolution":{"observed_at":"2026-08-02T02:49:55.870956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.933754Z","title":"Sorscher, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.933754Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:36371ecdadaf8463859f78fae23346f32bd7c3631afe14645fd96fc086b180d6","observation_id":"4e26114e-7e7e-4114-8726-a6e1c60672a7","resolution":{"observed_at":"2026-08-02T02:49:55.933754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.984214Z","title":"Dorrell and J","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.984214Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b08c52dbfb1b5619eac296dbd0861e122a3925e06f8fc0667ea109e49d48752e","observation_id":"38c0bcb6-da57-4c76-b9b3-3eca2023ff80","resolution":{"observed_at":"2026-08-02T02:49:55.984214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.037020Z","title":"Gnm: A general navigation model to drive any robot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.037020Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:593dea6b6a040f961f90dca24f3d6493dbc02b21d090b6e2ad9e017300e79e6b","observation_id":"7a7ac742-71a8-4e4c-946b-d4649f289da3","resolution":{"observed_at":"2026-08-02T02:49:56.037020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-02T02:49:56.083126Z","title":"Vint: A foundation model for visual navigation.arXiv preprint arXiv:2306.14846, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.083126Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:39d32832f124a1ea81ce22e941ee4d74611578ee800fe646de11468b6ea39f7f","observation_id":"5a79a019-96fe-4527-a696-b9995511514e","resolution":{"observed_at":"2026-08-02T02:49:56.083126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.155175Z","title":"Prior does matter: Visual navigation via denoising diffusion bridge models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.155175Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:591b8752e7cb99bf80a2aa344c89de0deaa66aef1c48978e0498e15f8d0b2bf5","observation_id":"1f6c77c8-b31c-47a2-9d6a-09bd4647a054","resolution":{"observed_at":"2026-08-02T02:49:56.155175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.241144Z","title":"Navmorph: A self-evolving world model for vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.241144Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:55444481a897bd65bfcb76a11030653886d5eefc56bb176cddbecfc10dda0996","observation_id":"4d0196cc-37aa-42f9-9fc4-6bc9337c24f6","resolution":{"observed_at":"2026-08-02T02:49:56.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.341371Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.341371Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:696e9a6e53bf1da65e398deac743248d04a97903d19ef6b1fdef2d182e55f7a6","observation_id":"3fcb7345-4b99-498f-88a3-085a995326c3","resolution":{"observed_at":"2026-08-02T02:49:56.341371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.454674Z","title":"On the continuity of rotation representations in neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.454674Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:45dc1b1e24ab470ff72a97f1db53d8222c997929583e546e00190bec12fb5499","observation_id":"aa71d981-1bf6-49ea-8a24-9e1c027e651e","resolution":{"observed_at":"2026-08-02T02:49:56.454674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.516350Z","title":"Self-supervised video pretraining yields robust and more human-aligned visual representations.Advances in Neural Information Processing Systems, 36:65743–65765, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.516350Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:28c9ba50a628cca09fbae6dfc47709783cf261985edfc4dc4a3998c0a5f50e49","observation_id":"e42c3677-62e8-4b9a-bef8-8b4e16305ec9","resolution":{"observed_at":"2026-08-02T02:49:56.516350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.564938Z","title":"Learning predictable and robust neural representations by straightening image sequences.Advances in Neural Information Processing Systems, 37:40316–40335, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.564938Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:19f23e15e568bb75c53ef710c7704ed78669348a69397a5e2d523976c6e82812","observation_id":"d27bbe7e-07ed-422a-a21d-09d129d744e5","resolution":{"observed_at":"2026-08-02T02:49:56.564938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.636786Z","title":"Chirality in action: Time-aware video represen- tation learning by latent straightening.Advances in Neural Information Processing Systems, 38:92695–92726, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.636786Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:143589edb8b494b467e1f7aa432e84d5e0c12c3f11cdb2b373867c42588e0eab","observation_id":"23f875ec-66c3-4b6a-81c2-efd334e60abd","resolution":{"observed_at":"2026-08-02T02:49:56.636786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.744669Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.744669Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:0fad710169e476adbbbcb11fd8466bed28e65e5e8884560fe6a9c594fdcb7a71","observation_id":"e99781bd-c9e8-455b-9f1e-2a18051fe855","resolution":{"observed_at":"2026-08-02T02:49:56.744669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-02T02:49:56.808587Z","title":"ARKitScenes: A diverse real- world dataset for 3D indoor scene understanding using mobile RGB-D data.arXiv preprint arXiv:2111.08897, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.808587Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:9c48fff2bb5d8f596540c6a8a2cb2bfb76250dd6d18de6b1daf75a1109fd6ac1","observation_id":"0b459d38-1fcd-4282-8e8b-bfb8eee4339c","resolution":{"observed_at":"2026-08-02T02:49:56.808587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.893180Z","title":"A benchmark for the evaluation of rgb-d slam systems","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.893180Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:d911611ab61dd8c15f79b2c3872e45d584de30ce3afbb58268dc60a2c51921a2","observation_id":"2668e327-5819-453e-9656-8e7e1cc4ab4b","resolution":{"observed_at":"2026-08-02T02:49:56.893180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.973347Z","title":"Learning to navigate the energy landscape","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.973347Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:ee9fc3eb96e2dea9435709a748f05058096a0467cd94f668bd2e218092039b8b","observation_id":"a1201391-512e-476f-a256-5a017b6a88f4","resolution":{"observed_at":"2026-08-02T02:49:56.973347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.050629Z","title":"Scene coordinate regression forests for camera relocalization in rgb-d images","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.050629Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:ec2763bf4fa3836c688a478a089c9203ff06af3b8f98a1c03ea877d51ed33fcf","observation_id":"fb4af697-c1a8-44bf-98c7-2fce3ff0f392","resolution":{"observed_at":"2026-08-02T02:49:57.050629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-02T02:49:57.142226Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.142226Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:f2897681b9ca19c684b11b42ac35078d89c794d3d61572f1a62c1d66ab1572be","observation_id":"4e102c2d-4df4-4b50-af62-06b01aa7f961","resolution":{"observed_at":"2026-08-02T02:49:57.142226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.215197Z","title":"Dynamic reflections: Probing video representations with text alignment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.215197Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:a987a3737017cbc780b2ef79669dddf54123fcb5e4fb8a7bc78ce9658511f20d","observation_id":"d697c8ec-8b33-4776-8cb1-3892afa8949a","resolution":{"observed_at":"2026-08-02T02:49:57.215197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.292862Z","title":"Levina and P","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.292862Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:02f21bef60b406b55fcc17626d21eb42de889087a790c6f97e97b60a89a794eb","observation_id":"be26553a-3552-4c36-8aeb-f0c2812f48e5","resolution":{"observed_at":"2026-08-02T02:49:57.292862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.346388Z","title":"Facco, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.346388Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:9751a8b2edd03560da680f7faf726c421ec00ca987781c166183a8015766c59c","observation_id":"61f6e82c-d9c1-4c4a-86e9-fea2f4c3fc39","resolution":{"observed_at":"2026-08-02T02:49:57.346388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.421861Z","title":"Large vision models can solve mental rotation problems","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.421861Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:2885ed451a954f071f96f58e15fe63e27899fd53127a76bc1a90924af1a9b9e5","observation_id":"93c315d6-3ab2-457a-9df9-94a83504b5e2","resolution":{"observed_at":"2026-08-02T02:49:57.421861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.485784Z","title":"Metzer, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.485784Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:c190049067c2c73dfd45c61517ddeaef48c6e75efa1829285ddf68c9aebe987b","observation_id":"e042461d-e095-4ea4-a994-ae21a15e5b57","resolution":{"observed_at":"2026-08-02T02:49:57.485784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.576148Z","title":"Weinzaepfel, V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.576148Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:4428fed3c51806e01e5b5dfe4cb57244c78bc5c1a015e25afa67ff55d5983d7f","observation_id":"7927f8b3-1617-4758-aaac-7abd1360f4e7","resolution":{"observed_at":"2026-08-02T02:49:57.576148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T02:49:57.638611Z","title":"Oquab, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.638611Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:56b7fe7d58ea3d3cc6fc5b6e4c70c56ed93ff9338ec06a7a29a933960530d974","observation_id":"a8b9e026-77dd-4961-a767-d591b1edd188","resolution":{"observed_at":"2026-08-02T02:49:57.638611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-02T02:49:57.712413Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.712413Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:537baa211b97222bdb69af4ecd4d7b63872b40c8e5b3a44b233ff5f08c1d676d","observation_id":"0221beee-885b-43b2-8e17-3d49a8747b36","resolution":{"observed_at":"2026-08-02T02:49:57.712413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.797739Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.797739Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:026248c780029f0ff0fd600e9e1b88d768db14efd9eea43caee4d93be4bb715d","observation_id":"3b7e7e94-0001-4384-9083-90f7c5e08a68","resolution":{"observed_at":"2026-08-02T02:49:57.797739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.896652Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.896652Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:802bb5e01bf2ed1ba0904b398e6f063b29b9500828ee88c089ce6dd31469afef","observation_id":"1185ec8e-b3fa-4b5b-bfae-7e3ab7b21e97","resolution":{"observed_at":"2026-08-02T02:49:57.896652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-02T02:49:57.960918Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.960918Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:3d65cd872ce145e74353363321ff42e9466765825eaa59fc24dc49b728928fb4","observation_id":"97935cd4-b992-4791-9cd5-9d226813e03d","resolution":{"observed_at":"2026-08-02T02:49:57.960918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13181","snapshot_observed_at":"2026-08-02T02:49:58.043393Z","title":"Bolya, P.-Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.043393Z"},"links":{"cited_paper":"/paper/2504.13181","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:9c1b9fb5c5f531f062ded812664109fd89a00e4ee8365e03406fcc367db3000f","observation_id":"1c3ef910-2001-4736-9665-b815e1e8014c","resolution":{"observed_at":"2026-08-02T02:49:58.043393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15506","last_updated":"2025-01-03T15:39:16Z","snapshot_observed_at":"2026-07-06T18:04:42.102581Z","submitted_at":"2024-03-22T02:30:46Z","title":"Metric3Dv2: A Versatile Monocular Geometric Foundation Model for Zero-shot Metric Depth and Surface Normal Estimation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15506","snapshot_observed_at":"2026-08-02T02:49:58.124847Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.124847Z"},"links":{"cited_paper":"/paper/2404.15506","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:d2271ff286cfaa42a625834a02226218fb85dc99099b1c9cb801fe35313fc32a","observation_id":"fe9dc8d4-72ad-4aa5-bf33-44a4ff474d77","resolution":{"observed_at":"2026-08-02T02:49:58.124847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:58.202050Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.202050Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:febe7f344e6d284f7193df516299428955730efb9ce42f8e2998c38b2e4fd8d4","observation_id":"4683a1c2-baf3-4d2c-85d3-e502e54c0ed0","resolution":{"observed_at":"2026-08-02T02:49:58.202050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-02T02:49:58.302430Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.302430Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:74c233477193db38ef44fa9a7c5772905506e9d290f48f0ada705fefee3f7b81","observation_id":"91c88214-b949-40b7-bccd-d265512f1b95","resolution":{"observed_at":"2026-08-02T02:49:58.302430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-02T02:49:58.367929Z","title":"Latent consistency models: Synthesizing high-resolution images with few-step inference.arXiv preprint arXiv:2310.04378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.367929Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:7b9f946d43f479846c7b9b80513dccd4b1950436776fc6001c36dcd0daba30fa","observation_id":"ba0b34cf-bdfd-467f-8851-0cdfeb4a6764","resolution":{"observed_at":"2026-08-02T02:49:58.367929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:58.430922Z","title":"A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence.Advances in Neural Information Processing Systems, 36:45533–45547, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.430922Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:147505fdcf8c7c0374677ffc09362670623bb87893d0a99af0493599e74fb4fb","observation_id":"08e16a4a-2c95-4db6-aaa3-14fd56b6c285","resolution":{"observed_at":"2026-08-02T02:49:58.430922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-02T02:49:58.501052Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.501052Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:015302c41678402f42038a98266ed2318dc98018bdae856736aa3d42455a0be1","observation_id":"2b3f3b6a-c014-4870-8016-c62f21f9272d","resolution":{"observed_at":"2026-08-02T02:49:58.501052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:58.578183Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.578183Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:90fb59cd10114b8d448d14a3d0c05548517517f508986031e0bb1e90afb53ba5","observation_id":"d4ed38c1-cc13-4ce3-ae93-cac2fb767ecf","resolution":{"observed_at":"2026-08-02T02:49:58.578183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13684","last_updated":"2026-04-21T13:13:49Z","snapshot_observed_at":"2026-07-06T22:39:04.164003Z","submitted_at":"2025-12-15T18:59:48Z","title":"Recurrent Video Masked Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13684","snapshot_observed_at":"2026-08-02T02:49:58.651651Z","title":"Zoran, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.651651Z"},"links":{"cited_paper":"/paper/2512.13684","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:4e2a3202239b1fb22585f2e01775927d9f0ae369b6925ed62a6dbc8ba77bfedb","observation_id":"51feaf88-b823-4728-85a6-4e7dd96ffd06","resolution":{"observed_at":"2026-08-02T02:49:58.651651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15212","last_updated":"2025-07-09T16:58:07Z","snapshot_observed_at":"2026-08-06T10:25:48.518948Z","submitted_at":"2024-12-19T18:59:51Z","title":"Scaling 4D Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15212","snapshot_observed_at":"2026-08-02T02:49:58.712379Z","title":"Carreira, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.712379Z"},"links":{"cited_paper":"/paper/2412.15212","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:c0bfd20aadcac46425a6a5065406d63e806f67a5976e4fc43829e2f0a012272c","observation_id":"50b5a864-d3ae-4dc9-a564-937d49a0c200","resolution":{"observed_at":"2026-08-02T02:49:58.712379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-07T12:33:34.943380Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04085","snapshot_observed_at":"2026-08-02T02:49:58.824241Z","title":"Unique lives, shared world: Learning from single-life videos.arXiv preprint arXiv:2512.04085, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.824241Z"},"links":{"cited_paper":"/paper/2512.04085","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:cd05bcb516323f2ccbfb2c29d52eccc3ea54ce40f7f4edc75853eacb5e6603fd","observation_id":"78791446-e291-4a38-bbda-d49a52715330","resolution":{"observed_at":"2026-08-02T02:49:58.824241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:58.840176Z","title":"Federer.Geometric Measure Theory","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.840176Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:facba64248bbb2246214c5af96747703596a45203038709734d5a2937768ae25","observation_id":"db5def9b-f9f3-4d5d-ace9-e3671e274b2c","resolution":{"observed_at":"2026-08-02T02:49:58.840176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:58.905734Z","title":"Poincaré adapter","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.905734Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:f1570ddff44712cdc53da59ffafdd03eb78cb37903ab42cda4031bc3bb96571b","observation_id":"dbf5769f-0494-422a-91d5-2c34e6466393","resolution":{"observed_at":"2026-08-02T02:49:58.905734Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:59.072704Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:59.072704Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:13c8c8541506d5a8b830b715175fea162ce18ed13f055e98991e4923268e65a2","observation_id":"5aa69a4f-d736-426a-a0b2-af120773764d","resolution":{"observed_at":"2026-08-02T02:49:59.072704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:59.198448Z","title":"Proof.We address each claim sequentially:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:59.198448Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:1063849000cee637dd93e90ddfee81b6e677b813863892db8fb6428e674cadae","observation_id":"5eabfbd2-12cf-4033-9970-10decafa53de","resolution":{"observed_at":"2026-08-02T02:49:59.198448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:59.295400Z","title":"Thus, time t influences the visual observation solely through the trajectory C(t), making P:U → Ia well-defined mapping that assigns a unique, repeatable image to any specific pose","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:59.295400Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:d718fe4dfa42407914f1664739a4f54b447629b096fe8c392e85d450f52a0c63","observation_id":"c480148f-0e6e-4e91-bd26-a3700c3edb69","resolution":{"observed_at":"2026-08-02T02:49:59.295400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:59.387324Z","title":"The domain of valid poses U is an open subset of the Lie group SE(3), which is a smooth manifold of dimension 6","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:59.387324Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:2d56b8afbd5688fc40dc5d75020fff1fad86a84aa42846ebfa967e5ace198fb1","observation_id":"3490b16b-cb2e-48c3-8438-390f1ff3f40c","resolution":{"observed_at":"2026-08-02T02:49:59.387324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:59.483783Z","title":"move forward 1 meter","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:59.483783Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:77dbc6aa2648b629f7b80181f319faea613dd5335b49a2780c79e2a29ec6b5c5","observation_id":"7e6c24f8-5f94-411a-9715-e7f5b9ec8b7c","resolution":{"observed_at":"2026-08-02T02:49:59.483783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:48:16.739576Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":77,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2607.14228."}