{"as_of":"2026-08-08T12:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:945f029f83a8b5911d085efa12ede1ea04fd7ae78195dbb0420b1ccc989a8ed4","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:27:03.027229Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:36:12.563261Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T23:24:02.107669Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24521","snapshot_observed_at":"2026-08-07T11:36:12.563261Z","title":"Unigeo: Taming video diffusion for unified consistent geometry estimation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01933","last_updated":"2025-07-10T17:55:35Z","snapshot_observed_at":"2026-08-07T11:28:51.356748Z","submitted_at":"2025-06-02T17:53:09Z","title":"E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models","version":3},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:12.563261Z"},"links":{"cited_paper":"/paper/2505.24521","citing_paper":"/paper/2506.01933"},"observation_digest":"sha256:72c23c6d59b288859997844f3e5ddd9fe1102f8df61dadbec8b1395151858c57","observation_id":"f3739f67-2a25-466b-b5c5-67f26aa76fa4","resolution":{"observed_at":"2026-08-07T11:36:12.563261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24521","snapshot_observed_at":"2026-08-06T13:02:29.354458Z","title":"Unigeo: Taming video diffusion for unified consistent geometry estimation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-07T20:14:50.999165Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:29.354458Z"},"links":{"cited_paper":"/paper/2505.24521","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:a12d2c8c0c6f3e680ed1d82c6799932784d2dcf38718369b04785e923670e897","observation_id":"fe1a1cf9-3398-4ddc-81f5-970bdc4cbc73","resolution":{"observed_at":"2026-08-06T13:02:29.354458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"cited_work":{"arxiv_id":"2505.24521","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24521","snapshot_observed_at":"2026-06-29T23:24:02.107669Z","title":"arXiv preprint arXiv:2505.24521 , year=","venue":null,"work_id":"32c146c8-548d-452c-9c69-6b1e7979e9da","year":2025},"citing_paper":{"arxiv_id":"2605.00658","last_updated":"2026-05-01T13:40:56Z","snapshot_observed_at":"2026-07-06T23:14:01.852096Z","submitted_at":"2026-05-01T13:40:56Z","title":"UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-09T20:05:21.723724Z"},"links":{"cited_paper":"/paper/2505.24521","citing_paper":"/paper/2605.00658"},"observation_digest":"sha256:f5ccb16b8188805d3fd16c8eb1856dbea66b6b437799787d04d780c7025dd2ea","observation_id":"ce9fe1c0-5065-454d-bfcf-a87a9c895c12","resolution":{"observed_at":"2026-05-11T15:26:07.919990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"cited_work":{"arxiv_id":"2505.24521","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24521","snapshot_observed_at":"2026-06-29T23:24:02.107669Z","title":"arXiv preprint arXiv:2505.24521 , year=","venue":null,"work_id":"32c146c8-548d-452c-9c69-6b1e7979e9da","year":2025},"citing_paper":{"arxiv_id":"2605.25308","last_updated":"2026-05-25T00:13:15Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T00:13:15Z","title":"Stabilizing Streaming Video Geometry via Dynamic Feature Normalization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T23:15:20.254402Z"},"links":{"cited_paper":"/paper/2505.24521","citing_paper":"/paper/2605.25308"},"observation_digest":"sha256:cbefd69fae6cbb2ecdeff75c51f6bf8d14a52c121ebfaf3675520f6ef52a29f9","observation_id":"7b62898f-9f48-4c4a-ac3a-e5eb6238c359","resolution":{"observed_at":"2026-06-29T23:24:02.109500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24521/citation-record","integrity":"/paper/2505.24521/integrity","json":"/paper/2505.24521/citation-record.json","paper":"/paper/2505.24521"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:09.086445Z","title":"https://hailuoai.video, 2023","venue":null,"work_id":"052bc7d7-5c06-4c4c-a2d4-cc9dc2f0e598","year":2023},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:56.630524Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:de3e7f2eec2c89f1b47fc367fe1090c128e69a5482aba515fcced3b181d07960","observation_id":"75594885-1abd-46d1-afce-81c0d635fc93","resolution":{"observed_at":"2026-08-07T12:27:09.166458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:08.903158Z","title":"https://kling.kuaishou.com, 2023","venue":null,"work_id":"6ccbd8e0-060d-4bf2-8cf9-0f81e0ac41c1","year":2023},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:56.695333Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:ab1280a3d9fff192ff4bae84767d46a5cf896e2a176454bf7903851221a12fbe","observation_id":"8ee2dfb0-2bd5-431a-905e-d016eb7a81c5","resolution":{"observed_at":"2026-08-07T12:27:08.986517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:08.710454Z","title":"www.imagine.art, 2023","venue":null,"work_id":"8cee1098-5a4a-4bdd-aa5e-9c727ef0483f","year":2023},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:56.791958Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:af15afdddbe5ec7bafd29d55796f3312ef61b079ea773079ea18c5964b2d0916","observation_id":"cfe52baf-e0e9-4b0b-8b86-f993f66a4b93","resolution":{"observed_at":"2026-08-07T12:27:08.796552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:08.540603Z","title":"Rethinking induc- tive biases for surface normal estimation","venue":null,"work_id":"db40eeea-f7f4-4f40-b93a-77838e3eada6","year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:56.881486Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:22c770a779ca921db25d4f5ce603deb373f3e5e8ae5dc71561382dbdfd33c001","observation_id":"996a5d4a-2e97-47a4-8282-efc3cbd05930","resolution":{"observed_at":"2026-08-07T12:27:08.612920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:08.374473Z","title":"Es- timating and exploiting the aleatoric uncertainty in surface normal estimation","venue":null,"work_id":"2260a9a5-db4f-4e9d-a253-80fad22b1503","year":null},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:56.981218Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:acda3e1fb42bc4e8be2df9f9118a796dd39147428e7ea1632d5a84a054faffae","observation_id":"2e7a868c-a2af-45a8-9788-d218f33f80ce","resolution":{"observed_at":"2026-08-07T12:27:08.457117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T12:26:57.174478Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:57.174478Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:adee90965a3e511393e1a5e1d527624639b048e75b25ab96cbd8174044f67d36","observation_id":"1abbe0f1-7b19-4c3b-bd4e-b28a6580c3dc","resolution":{"observed_at":"2026-08-07T12:26:57.174478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:08.190106Z","title":"Video generation models as world simulators","venue":null,"work_id":"54bb4d59-2df1-4150-8efa-62a3e0a70701","year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:57.272101Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:638d47c704610ed0d89280e44fc781fb77193f391e2eb7e3480387b3ef611c8c","observation_id":"4508da34-1ead-4445-aead-3e35152b1b91","resolution":{"observed_at":"2026-08-07T12:27:08.287296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12375","last_updated":"2025-06-15T03:50:49Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:53:30Z","title":"Video Depth Anything: Consistent Depth Estimation for Super-Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12375","snapshot_observed_at":"2026-08-07T12:26:57.495990Z","title":"Video depth anything: Consistent depth estimation for super-long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:57.495990Z"},"links":{"cited_paper":"/paper/2501.12375","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:47be930881535e6823d18d8221a824841cd52aff7b2cbb068eddcbd2366b7adc","observation_id":"677d1a65-46d6-4a29-8c90-a851b74eb0e9","resolution":{"observed_at":"2026-08-07T12:26:57.495990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:08.043548Z","title":"Single- image depth perception in the wild","venue":null,"work_id":"aff35c67-3307-4d83-86f5-a06061e67584","year":2016},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:57.590645Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:86455a625eb6a88889efe7f763e583adafbe5d059c0eca9bfc87d79e8db9be26","observation_id":"83fc3904-0469-48f7-ba61-8de3ece49662","resolution":{"observed_at":"2026-08-07T12:27:08.103564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:07.915657Z","title":"Omnidata: A scalable pipeline for making multi- task mid-level vision datasets from 3d scans","venue":null,"work_id":"3fd776ab-9d70-4e39-b352-665a76b93014","year":2021},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:57.678589Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:68f76f255f6496020a243dcad911ef5d278a90bafc76693b699d5c97d9e291f4","observation_id":"3abfe880-7878-4bc0-9e19-0114ed11ecf8","resolution":{"observed_at":"2026-08-07T12:27:07.963895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:26:57.741086Z","title":"Predicting depth, surface nor- mals and semantic labels with a common multi-scale con- volutional architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:57.741086Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:0b52c1438fcc6a8e7dc02a2e7ecb5dd87601a3af31819d82b9cf60e2ca3f4bd5","observation_id":"beb48c00-2511-46c5-9190-8f223ab4f64a","resolution":{"observed_at":"2026-08-07T12:26:57.741086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:07.712871Z","title":"Depth map prediction from a single image using a multi-scale deep net- work","venue":null,"work_id":"17a7eb8b-f574-4fbc-b5b1-9e112711b01c","year":2014},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:57.863361Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:430c4e4deb2c09d5a1e1fbf5fc78e0546016df54a64325f9142c51bc76ca5b92","observation_id":"a8d30307-e835-47c0-b995-a735bd45c0be","resolution":{"observed_at":"2026-08-07T12:27:07.803462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12013","last_updated":"2024-03-18T17:50:41Z","snapshot_observed_at":"2026-08-06T16:36:03.755979Z","submitted_at":"2024-03-18T17:50:41Z","title":"GeoWizard: Unleashing the Diffusion Priors for 3D Geometry Estimation from a Single Image","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12013","snapshot_observed_at":"2026-08-07T12:26:57.962557Z","title":"Geowiz- ard: Unleashing the diffusion priors for 3d geometry estima- tion from a single image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:57.962557Z"},"links":{"cited_paper":"/paper/2403.12013","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:da9cb10de09572f049840b6b9d40e6854e680dadaedb7460a768734642d92fde","observation_id":"bb1dbe1f-919c-4726-b4bf-7478ac630314","resolution":{"observed_at":"2026-08-07T12:26:57.962557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:07.503924Z","title":"Geowiz- ard: Unleashing the diffusion priors for 3d geometry esti- mation from a single image","venue":null,"work_id":"b8f24a76-613a-4933-85a4-e718d105040d","year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:58.058841Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:adacc90816efc92ba25d9759be1ac0b79a08ff78fd95e66177de9c399608217a","observation_id":"06f15a31-a466-4b20-b035-94aadd9de0f8","resolution":{"observed_at":"2026-08-07T12:27:07.591274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:26:58.135340Z","title":"Fine-tuning image-conditional diffusion models is easier than you think","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:58.135340Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:bd7c19f372602ce350bde0dfd640afffc654d1be76f01bd9a13a6ca90b81ab29","observation_id":"8cc1afab-dcf2-4645-957d-2396430e50e3","resolution":{"observed_at":"2026-08-07T12:26:58.135340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:26:58.235834Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:58.235834Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:0619b55684d78dd00074bcf5dbe51eb537112c3f7ec97bda69c22beae5d48e83","observation_id":"be40d30e-011e-4e05-812b-22e14c5770a0","resolution":{"observed_at":"2026-08-07T12:26:58.235834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13788","last_updated":"2024-12-19T17:51:42Z","snapshot_observed_at":"2026-07-06T17:47:51.284226Z","submitted_at":"2024-03-20T17:51:53Z","title":"DepthFM: Fast Monocular Depth Estimation with Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13788","snapshot_observed_at":"2026-08-07T12:26:58.307160Z","title":"Depthfm: Fast monocular depth estimation with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:58.307160Z"},"links":{"cited_paper":"/paper/2403.13788","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:6922656ab6fac1fceaa70ab8895563dc9dc96f6004b6278528b88ff59c7b4427","observation_id":"3edd2f4b-b25a-442d-8c8c-464056f0ed6d","resolution":{"observed_at":"2026-08-07T12:26:58.307160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-07T12:26:58.364585Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:58.364585Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:fe47029c1c3aebd57d7958fce6913125b89d8c156995ea6bd009d9b435ccb9c3","observation_id":"c5d92bf9-086c-4519-a65e-37e130a9da12","resolution":{"observed_at":"2026-08-07T12:26:58.364585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:26:58.480794Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:58.480794Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:3170e1b6706bace50c8706ece84c00f1b4f30bf4f6c5e41d4c7abc12fa73464c","observation_id":"1a69be6a-9b38-4464-b956-6b38e1045c72","resolution":{"observed_at":"2026-08-07T12:26:58.480794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-07T12:26:58.545271Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:58.545271Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:8d4a1570071db1f3e8df4c0e4e81425ae9d81fed1b8614344a367b0cc2192e53","observation_id":"7e38e68a-400c-48a3-8647-9e77d84c351b","resolution":{"observed_at":"2026-08-07T12:26:58.545271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-07T23:17:31.541423Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-07T12:26:58.732233Z","title":"Depthcrafter: Generating consistent long depth sequences for open-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:58.732233Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:69d59af179372ef9cfb964a8eaa80cba30eceb6ee34b326be81d37002be984a7","observation_id":"a27ba6c1-40a2-4604-8824-31777593a2f6","resolution":{"observed_at":"2026-08-07T12:26:58.732233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09621","last_updated":"2025-04-30T17:59:59Z","snapshot_observed_at":"2026-08-08T02:38:16.418239Z","submitted_at":"2024-12-12T18:59:54Z","title":"Stereo4D: Learning How Things Move in 3D from Internet Stereo Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09621","snapshot_observed_at":"2026-08-07T12:26:58.828439Z","title":"Stereo4d: Learning how things move in 3d from internet stereo videos.arXiv preprint arXiv:2412.09621, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:58.828439Z"},"links":{"cited_paper":"/paper/2412.09621","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:b842a6a2463c8887b26219b9b96d208540eaf84a90102d031f5171267542dc0b","observation_id":"fe1099a5-5d77-48b2-8af0-b0fd96bf057c","resolution":{"observed_at":"2026-08-07T12:26:58.828439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:07.317836Z","title":"Repurpos- ing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":"1d660bc6-8740-48e8-9566-0fb99cc05628","year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:58.917792Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:50b59d3d4b362b3ada3a877e1b2a9912bfee721512d793591cc9d01513ff44d2","observation_id":"626022db-2620-49cf-873c-c4d0418419dd","resolution":{"observed_at":"2026-08-07T12:27:07.393136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:26:59.041823Z","title":"Repurpos- ing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:59.041823Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:93b40180cf31d0a97a89e16d78d561538be3014c7a61ef2163041d21eefd2429","observation_id":"a310457d-8b69-4ddc-a262-655acdf7cee0","resolution":{"observed_at":"2026-08-07T12:26:59.041823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T12:26:59.108981Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:59.108981Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:72b2ffdc2d22f5d1b5df8114ad86c9719b371cfc325b20428aecb492b1a7a8be","observation_id":"9fceaa84-ef54-46f2-bae6-c582b3ef60d1","resolution":{"observed_at":"2026-08-07T12:26:59.108981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:26:59.231086Z","title":"Ex- ploiting diffusion prior for generalizable dense prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:59.231086Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:f4b49234a446866d2f7d5717865c5197bd804d6be504390c79dbd5e77c9945e2","observation_id":"5c0dbbf6-098f-42e0-9421-79443181872f","resolution":{"observed_at":"2026-08-07T12:26:59.231086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:26:59.352299Z","title":"Depth and surface normal estimation from monocular images using regression on deep features and hi- erarchical crfs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:59.352299Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:ae474002addefd591cdbc5810210fa82af2f149befe2b1ff653aabf430d03080","observation_id":"94f1be05-ffb6-4cf2-ba7f-088fea4a1545","resolution":{"observed_at":"2026-08-07T12:26:59.352299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:07.045488Z","title":"Interiornet: Mega-scale multi- sensor photo-realistic indoor scenes dataset","venue":null,"work_id":"bbc2b41a-14f3-4bf4-9acd-d225bfb27fd7","year":2018},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:59.503614Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:bb00f0d2cb3db77f3bdc760ab34a9d60e09930611949c48dce52ebdb84655813","observation_id":"b189bfab-37b2-4fb7-993b-44ee6eefe3e5","resolution":{"observed_at":"2026-08-07T12:27:07.215461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:06.817689Z","title":"Matrixcity: A large-scale city dataset for city-scale neural rendering and beyond","venue":null,"work_id":"c66ec889-5afa-4d07-8fba-2c4d34bae511","year":2023},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:59.577326Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:506c24815aca4e82a33d18b03723a99c26628e357025d9a737e08840dfdf196d","observation_id":"20904369-a23c-4066-ab13-516b3543f515","resolution":{"observed_at":"2026-08-07T12:27:06.939813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:26:59.646713Z","title":"Prompting depth anything for 4k resolution accurate metric depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:59.646713Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:379adfde549fe6f9bd97a71cba1dcd90094cd89fc3813e411d908ce584c24493","observation_id":"e9d0d976-d7a2-479a-a41b-34d7533358cf","resolution":{"observed_at":"2026-08-07T12:26:59.646713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03079","last_updated":"2024-12-05T14:16:07Z","snapshot_observed_at":"2026-07-06T20:01:23.373458Z","submitted_at":"2024-12-04T07:09:59Z","title":"Align3R: Aligned Monocular Depth Estimation for Dynamic Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03079","snapshot_observed_at":"2026-08-07T12:26:59.761348Z","title":"Align3r: Aligned monocular depth estimation for dynamic videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:59.761348Z"},"links":{"cited_paper":"/paper/2412.03079","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:81c8fb2875a574e87069cb31f463c2d0485c4c135fc4ba0b7226c45aea2837ce","observation_id":"89992286-2acc-4123-ab4a-d45b5504462d","resolution":{"observed_at":"2026-08-07T12:26:59.761348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:26:59.834451Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:59.834451Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:57a0ed0604604665c77b5850dd0889af7c47d56fca27fbc2397c9161cfacc756","observation_id":"6b6de2e0-2114-4607-a6c0-086db26c1201","resolution":{"observed_at":"2026-08-07T12:26:59.834451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:26:59.909677Z","title":"Peebles and Saining Xie","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:59.909677Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:7e005bf53cedb29f18280cf7e7d7f55c1de7caaa4d26c5c21b7a3286d48a57ec","observation_id":"6d24a161-3f1a-4b52-98b5-3c460a4ea8ff","resolution":{"observed_at":"2026-08-07T12:26:59.909677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:06.581502Z","title":"Unidepth: Universal monocular metric depth estimation","venue":null,"work_id":"b188cf15-2d89-4591-b43b-a1c1db543a01","year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:00.009586Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:f399e9d3af0d3e9427560a404121c0cb68ad5abdb3cc6b9b9f2afd26173985a9","observation_id":"83fd48bf-ad09-4b91-872d-a6201fdfb432","resolution":{"observed_at":"2026-08-07T12:27:06.691043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-07T12:27:00.075661Z","title":"The 2017 davis challenge on video object segmentation.arXiv preprint arXiv:1704.00675, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:00.075661Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:588a84999e4b3b4cf47fcc234d1d15c137c980dd9d9dedb5bc342f425f126ef9","observation_id":"b4a49c49-397f-4d5a-bcf6-b533ea6cff43","resolution":{"observed_at":"2026-08-07T12:27:00.075661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:06.386542Z","title":"Geonet: Geometric neural network for joint depth and surface normal estimation","venue":null,"work_id":"ad41d0d3-9280-4948-9b38-0f38e4bcb8ca","year":2018},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:00.144491Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:9d7cf4a74323460348143689b6f46ea11b5614d1cac7de6570f45255203d4696","observation_id":"7897aca7-a174-4b5b-befd-5dd77550264c","resolution":{"observed_at":"2026-08-07T12:27:06.481359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:06.223458Z","title":"Geonet++: Iterative geo- metric neural network with edge-aware refinement for joint depth and surface normal estimation","venue":null,"work_id":"897a4ed5-f316-4bec-a5bd-cdc483c78352","year":null},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:00.236383Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:6a2fdd4a5df2feb75fef1c6ae5d34dbf504d972f300f941ae7bd08acebdb9f11","observation_id":"bd5a1d9d-e812-423d-9fbb-cb46b899114b","resolution":{"observed_at":"2026-08-07T12:27:06.303185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:00.304335Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:00.304335Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:b8ffb8347c675840f8f6f87e898f2be406a7759ad124cc8ccc97742b43573c37","observation_id":"9cc9de4b-d3a3-4d5c-b3ab-ae773ab897c0","resolution":{"observed_at":"2026-08-07T12:27:00.304335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:00.373962Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:00.373962Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:93bf360d07aada374201974a66fd2b8d1f8908a68ce5f73bf3ab558eabebcfe2","observation_id":"73a119ac-8b26-4e29-bf21-897930494676","resolution":{"observed_at":"2026-08-07T12:27:00.373962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:05.978584Z","title":"Hypersim: A photorealis- tic synthetic dataset for holistic indoor scene understanding","venue":null,"work_id":"b9e9cc13-512b-4d14-a967-1579a269ee2b","year":2021},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:00.428199Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:c93f3b5125caed40ade7bf5a5cdca4a4aad77ecf3556f2301edb4e4cfb6d8d87","observation_id":"447be397-8af9-4262-9620-dea09e45d300","resolution":{"observed_at":"2026-08-07T12:27:06.098339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:05.753287Z","title":"Blattmann, Dominik Lorenz, Patrick Esser, and Bj ¨orn Ommer","venue":null,"work_id":"d11453e0-c997-4b53-9119-03795ea18604","year":2022},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:00.544020Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:e871dec04744d1ff2e2a80a099dfbd85130777b53ddb85745b2209318c5e1dc8","observation_id":"c4208839-0796-4828-a1bb-7d541ab30c49","resolution":{"observed_at":"2026-08-07T12:27:05.810018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:00.618126Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:00.618126Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:1936a28caaf8f8df35e6db2555a67ae932cfb03a644034539e774fa4d03fa14d","observation_id":"e5d58610-fa72-4d9d-8882-a41181464b45","resolution":{"observed_at":"2026-08-07T12:27:00.618126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-06T11:05:16.105361Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-07T12:27:00.683070Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:00.683070Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:b94be209f11988988ece409f541d859ab980743c322c7d546ac44d19819fefe9","observation_id":"e456ee21-1227-4fa7-8306-2553b0e0b6f8","resolution":{"observed_at":"2026-08-07T12:27:00.683070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:00.834097Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:00.834097Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:952654f678641c8f83539b2531ca28e6e3e158e8d47726032d482a33e81a4bca","observation_id":"07c820f5-a41c-433b-a04a-7894a842c20f","resolution":{"observed_at":"2026-08-07T12:27:00.834097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01493","last_updated":"2025-06-07T07:24:16Z","snapshot_observed_at":"2026-08-03T17:25:16.750670Z","submitted_at":"2024-06-03T16:20:24Z","title":"Learning Temporally Consistent Video Depth from Video Diffusion Priors","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01493","snapshot_observed_at":"2026-08-07T12:27:00.948363Z","title":"Learning tem- porally consistent video depth from video diffusion priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:00.948363Z"},"links":{"cited_paper":"/paper/2406.01493","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:f0f604195b7ff28db289a30dd2c36fc9377b878696ea442166ffa7debf43540e","observation_id":"90fd036b-a57d-4460-88ec-e203654b88ea","resolution":{"observed_at":"2026-08-07T12:27:00.948363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:05.448556Z","title":"Scene intrinsics and depth from a single image","venue":null,"work_id":"e1fa03a3-18c9-4dd9-9e41-2ae71b4930fe","year":2015},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:01.069343Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:30bb639b1993bceee5bbe38300d71fe57590a2c11eb51b0048b2933b12eedf18","observation_id":"f9cf66f4-ad2f-4bee-89de-d0558b701aed","resolution":{"observed_at":"2026-08-07T12:27:05.584044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:05.229534Z","title":"Scene coordinate regression forests for camera relocalization in rgb-d images","venue":null,"work_id":"14044c07-1487-4d1f-b82a-e6ccb84f7d31","year":2013},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:01.167879Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:7acf5be08bf793824c5dadbb39573b04ce38fddbcca5280987072938024a4d43","observation_id":"5132a635-f916-4c8e-9faf-8e6dbdaf79a1","resolution":{"observed_at":"2026-08-07T12:27:05.320128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:05.031411Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"df9911ef-74ff-4192-a146-728548f91702","year":2012},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:01.284386Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:97fc9e473641c663149ffd02ecbe3c9e51652cd2560f9e0ac546adf074619e67","observation_id":"7c416411-5fda-48ca-9268-2d72596f1009","resolution":{"observed_at":"2026-08-07T12:27:05.124782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-07T12:27:01.438171Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:01.438171Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:8a34389fa4a356de9646a70a1c4a45144ea7f18dd1cfb59c92a0ee00e435ff60","observation_id":"a8beb47c-c712-424f-8874-d7cc88f2d13c","resolution":{"observed_at":"2026-08-07T12:27:01.438171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:04.752451Z","title":"Deep unsupervised learning using 10 nonequilibrium thermodynamics","venue":null,"work_id":"0fbf3adf-3dbb-440f-bcbd-51d8267d74cc","year":2015},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:01.520466Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:dc3860b0e547e608a60d6d93a2c7205cef2c29b0dccf322aa835631cd9f8cc2f","observation_id":"c1d5365a-dc90-4f74-88fd-ea86c7ae4106","resolution":{"observed_at":"2026-08-07T12:27:04.940689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-07T12:27:01.642915Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:01.642915Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:ae74ccb39b241cc0f565aede2f557a0b9c65f1c811a52698ef477670112cfe2f","observation_id":"e66123ba-483e-43ce-9343-18a8ad600a90","resolution":{"observed_at":"2026-08-07T12:27:01.642915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-07T12:27:01.737545Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:01.737545Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:63c5f3628ea8641a70daed6244929080e022f195be08f64f16bd25b03dca9e32","observation_id":"fec091f6-c3df-44e5-98e7-391834d5efb2","resolution":{"observed_at":"2026-08-07T12:27:01.737545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06974","last_updated":"2024-12-09T20:34:55Z","snapshot_observed_at":"2026-07-06T20:04:15.943803Z","submitted_at":"2024-12-09T20:34:55Z","title":"MV-DUSt3R+: Single-Stage Scene Reconstruction from Sparse Views In 2 Seconds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06974","snapshot_observed_at":"2026-08-07T12:27:01.811248Z","title":"Mv-dust3r+: Single-stage scene reconstruction from sparse views in 2 seconds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:01.811248Z"},"links":{"cited_paper":"/paper/2412.06974","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:8933780d83ad41d1047d62f54114a9f779b16d62e30dfbd66dcef507bfb3972a","observation_id":"4a58cf34-6893-4dfa-95bd-0e54358709ef","resolution":{"observed_at":"2026-08-07T12:27:01.811248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16061","last_updated":"2024-08-28T18:01:00Z","snapshot_observed_at":"2026-08-06T09:17:41.634492Z","submitted_at":"2024-08-28T18:01:00Z","title":"3D Reconstruction with Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16061","snapshot_observed_at":"2026-08-07T12:27:01.955499Z","title":"3d reconstruction with spatial memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:01.955499Z"},"links":{"cited_paper":"/paper/2408.16061","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:b676f559ab5d32d5e0d910c8b93ca02e9e4a396c10893de786e23786f85ce604","observation_id":"f8cba505-25cc-4b21-85ee-07f9b87a8476","resolution":{"observed_at":"2026-08-07T12:27:01.955499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12387","last_updated":"2025-01-21T18:59:23Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:59:23Z","title":"Continuous 3D Perception Model with Persistent State","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12387","snapshot_observed_at":"2026-08-07T12:27:02.037632Z","title":"Continuous 3d perception model with persistent state","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:02.037632Z"},"links":{"cited_paper":"/paper/2501.12387","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:3e8184e9b39842fd607777e86ebe32871135741a2a5ef9d58663baa50398cf4e","observation_id":"739cdba6-2abe-413c-8921-3123d81f3e9f","resolution":{"observed_at":"2026-08-07T12:27:02.037632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19115","last_updated":"2025-04-15T06:33:45Z","snapshot_observed_at":"2026-08-07T10:01:09.642030Z","submitted_at":"2024-10-24T19:29:02Z","title":"MoGe: Unlocking Accurate Monocular Geometry Estimation for Open-Domain Images with Optimal Training Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19115","snapshot_observed_at":"2026-08-07T12:27:02.097523Z","title":"Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:02.097523Z"},"links":{"cited_paper":"/paper/2410.19115","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:0a11b53de26a6fb9e5d93f1ab150b76bb6c4fc2e914549e70e1099d0781730d6","observation_id":"b841db22-c530-4539-98c1-accde6bd66e5","resolution":{"observed_at":"2026-08-07T12:27:02.097523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:04.552864Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":"1d124d79-05f6-4559-bd87-8985fe94a8a1","year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:02.188457Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:dd1adc2cd00b128295429c5e9dd2fef73e58b792e36e745a979ed4a1bb3a27ad","observation_id":"1084b898-e80e-43fa-81be-f4a33a1e25ac","resolution":{"observed_at":"2026-08-07T12:27:04.667997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:02.249135Z","title":"Dust3r: Geometric 3d vi- sion made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:02.249135Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:82e93cd8124abcf046b4c366c03038d2d17346789558ac158599f40e3949a82f","observation_id":"d1ff30dd-dad9-411a-b904-941e1a1eed6c","resolution":{"observed_at":"2026-08-07T12:27:02.249135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:04.281070Z","title":"Monocular relative depth percep- tion with web stereo data supervision","venue":null,"work_id":"6d2144e0-7341-4cb9-b06a-54588784574b","year":2018},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:02.302561Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:c11746e4f20d37aba7747a80c4ef03db05167c4550ed69b1e54599622b107652","observation_id":"550d8c1c-d908-439d-9589-605e62659486","resolution":{"observed_at":"2026-08-07T12:27:04.424020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06090","last_updated":"2024-12-01T12:13:57Z","snapshot_observed_at":"2026-07-06T17:42:08.056523Z","submitted_at":"2024-03-10T04:23:24Z","title":"What Matters When Repurposing Diffusion Models for General Dense Perception Tasks?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06090","snapshot_observed_at":"2026-08-07T12:27:02.467759Z","title":"What matters when repurposing diffusion models for general dense perception tasks? arXiv preprint arXiv:2403.06090 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:02.467759Z"},"links":{"cited_paper":"/paper/2403.06090","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:05a144f200fad00e8b30ff9d9afc00420254d43994074e29d653c459f9cef01b","observation_id":"f86c6d6d-b3ec-46ac-b464-1e86fb800805","resolution":{"observed_at":"2026-08-07T12:27:02.467759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:04.085579Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"6caf0871-dd97-4047-8c1d-8c25320e1975","year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:02.531600Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:fc3774e7ffcedb37de74c762e11d93ce2eb84043922d4440554f79530a879a73","observation_id":"fa2c354e-9002-44fd-a4f7-9b3a1a76494e","resolution":{"observed_at":"2026-08-07T12:27:04.199244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:03.862711Z","title":"Depth any- thing v2","venue":null,"work_id":"73e36f55-0e81-4a36-8b7b-32b9d74b6a6b","year":2025},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:02.589322Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:23349a8e4f0f01c8e823eac9d5f10e29504b55fc6b5a23389988e3761508005e","observation_id":"c978a6ac-3145-4fbd-9f9f-8f5dbd8fae78","resolution":{"observed_at":"2026-08-07T12:27:03.961131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T12:27:02.689320Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:02.689320Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:21ab153990ed0f40a490072ff39451c6cbf555f7c1af50f4c70acd1ab57d67c9","observation_id":"a160bd47-10a7-4378-a166-da6b1c5dbfdf","resolution":{"observed_at":"2026-08-07T12:27:02.689320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:03.679618Z","title":"Stablenormal: Reducing diffusion variance for stable and sharp normal.ACM Transactions on Graphics,","venue":null,"work_id":"a116f9f3-a9ce-4784-8990-261ec6c1fd1f","year":null},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:02.753883Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:be1f2cb0d2f194852c928b36a913cff4c9ae06824d9327011239b1f78566da81","observation_id":"05b5d691-4a2e-43ab-bef5-4b70c89e4e91","resolution":{"observed_at":"2026-08-07T12:27:03.783212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:02.824772Z","title":"Scannet++: A high-fidelity dataset of 3d in- door scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:02.824772Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:88692a9f5705bf9802e92dd251a3057bf019041c2aa700aeafc9c3fdccfaacb1","observation_id":"c4f7ea64-a5c8-4796-af11-8689a1baec65","resolution":{"observed_at":"2026-08-07T12:27:02.824772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:03.538828Z","title":"Metric3d: Towards zero-shot metric 3d prediction from a single image","venue":null,"work_id":"8bbdc087-fbd7-4904-932c-b980be3573ca","year":2023},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:02.938986Z"},"links":{"citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:ca3edec4c4cbda22511feed3c5c92737dab5ce646080d54f3722580fa6acfcd8","observation_id":"52ae2683-62ab-4564-a7ee-b03c856de32d","resolution":{"observed_at":"2026-08-07T12:27:03.574652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03825","last_updated":"2025-05-08T08:32:16Z","snapshot_observed_at":"2026-07-06T19:28:08.374354Z","submitted_at":"2024-10-04T18:00:07Z","title":"MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03825","snapshot_observed_at":"2026-08-07T12:27:03.027229Z","title":"ScanNet”, “Neural RGBD","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:03.027229Z"},"links":{"cited_paper":"/paper/2410.03825","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:3a62aa888f009c28d7a17ca4997450270809a39f13c1ea4778ffd22b806f0b3c","observation_id":"c08c55dc-ba5f-4069-97be-3cf166745a2e","resolution":{"observed_at":"2026-08-07T12:27:03.027229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 4 inbound Pith citation observations for arXiv:2505.24521."}