{"as_of":"2026-08-19T08:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:89c0bf9c752ac6db46f7fc5aa49251962f25fab2965a2228d7c4e964f2e069ef","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:26:49.610580Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T00:56:18.867382Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17249","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2411.17249","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:5b68c6d202cc1810384ef33cf9093506ee74f5562346f4346e99aa8b3de12dec","observation_id":"c46a1f6e-6f13-4b8f-9a6c-98450bc7130f","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17249/citation-record","integrity":"/paper/2411.17249/integrity","json":"/paper/2411.17249/citation-record.json","paper":"/paper/2411.17249"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.606422Z","title":"Stable diffusion version 2","venue":null,"work_id":"9c0e0a4d-6a6c-4ba5-919d-6a9a2117fe8d","year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.326039Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:888cc4a1d5aec5953455e6d07ad388cf6edcd60a29b0a65287f785c0502553b3","observation_id":"187910a2-3575-461a-9c28-bc9b1ac1baef","resolution":{"observed_at":"2026-08-12T12:26:50.611236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.590491Z","title":"Rethinking induc- tive biases for surface normal estimation","venue":null,"work_id":"e7e55ae3-a82a-403e-9cdf-620754518080","year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.331132Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:b3fd2cda00e8f11c243044a3bf68884e57276bc167b35c752bcde13628f64e39","observation_id":"59d925b9-d6a3-43cc-b7ef-504d0728e725","resolution":{"observed_at":"2026-08-12T12:26:50.595455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.335953Z","title":"Es- timating and exploiting the aleatoric uncertainty in surface normal estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.335953Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:5b2f7c427a73c139cea1aa27c7484533283c746de6bd9b5aa1c7bcc4d7999b65","observation_id":"e4575005-7e21-49cc-9ca6-4366e1e6a895","resolution":{"observed_at":"2026-08-12T12:26:49.335953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.565260Z","title":"Marr revisited: 2d-3d alignment via surface normal prediction","venue":null,"work_id":"2e10ce82-cbb1-4927-9946-31249e6b13df","year":2016},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.340963Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:aa1ff39ae4d1deb660da999b0f5bd7c944df46307101253c1cea4d8f88df8a2f","observation_id":"262d1cd3-b732-4e78-8a39-4f313c02ed5d","resolution":{"observed_at":"2026-08-12T12:26:50.570136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T12:26:49.345431Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.345431Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:6080547026794cf69a555d3354a05fe0e93a5a9c228cf6b1741ea3424ebe3f37","observation_id":"2518f65c-8653-4fde-acf1-c5c1fb3e8f37","resolution":{"observed_at":"2026-08-12T12:26:49.345431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.350473Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.350473Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:836ca03ca0a2cd5da511008cfff4d65f7bf4083226f8067267f8762cf363bff2","observation_id":"7e247130-d8f9-43b0-9ce8-11808caffa17","resolution":{"observed_at":"2026-08-12T12:26:49.350473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.354841Z","title":"A naturalistic open source movie for opti- cal flow evaluation","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.354841Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:8fb23b6a90b68195d83d8b16299ecfdc59b86cefc01b219d27f2d0739f4eda13","observation_id":"65ececb4-b366-4fa1-bc0b-fbd7eea0694e","resolution":{"observed_at":"2026-08-12T12:26:49.354841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.359265Z","title":"A computational approach to edge detection","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.359265Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:5f22913cd4ca799fc0e9c286a93777ae20a798ebaa72e61618a6a103e11c579b","observation_id":"245df49e-2c83-4604-98f2-8341d16205c1","resolution":{"observed_at":"2026-08-12T12:26:49.359265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.520093Z","title":"Learning structure affinity for video depth estima- tion","venue":null,"work_id":"41a2e495-191c-4f15-94e0-68fda925d940","year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.364198Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:03c37e148294c0711df709d661430139fa981ab59b1a00b0115e019b812f6588","observation_id":"d2c3d993-fed7-4cfe-a952-3673610f9586","resolution":{"observed_at":"2026-08-12T12:26:50.525276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.494957Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion,","venue":null,"work_id":"6efd5b4e-99e4-47b8-bda9-b9a58b7488c3","year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.373053Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:e870412fd5ca24818a0e4c1acf1fef27f6b8d968893d64e50c18eef2be8b8438","observation_id":"56c2cd09-9da3-4dc2-b004-a6773999b77c","resolution":{"observed_at":"2026-08-12T12:26:50.499768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.378047Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.378047Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:1470ceed58f747b51ab8fb8724638ac784a68584a37397a56916728420b64707","observation_id":"01b72b87-6db6-4e18-b6fc-9db078e79c6c","resolution":{"observed_at":"2026-08-12T12:26:49.378047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.469948Z","title":"Surface normal estimation of tilted images via spatial rectifier","venue":null,"work_id":"71b0e25a-bb9f-404e-befc-99961df9f7a6","year":2020},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.382110Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:eabdc12eb0bcea227d5280cfefd2eeddc98cd93384017d49f1b31af52b3f4be9","observation_id":"97050a54-893b-4653-b268-dfea066a0245","resolution":{"observed_at":"2026-08-12T12:26:50.474955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.386304Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.386304Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:c16153ca37e221d861374ae3ce2a4c3e14836ecb48e9192795d40b8f4179e5c0","observation_id":"658f4f7f-8352-4d5b-8e2e-38a96f3f628e","resolution":{"observed_at":"2026-08-12T12:26:49.386304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.390520Z","title":"Omnidata: A scalable pipeline for making multi- task mid-level vision datasets from 3d scans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.390520Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:b619922d3d0266ad490fecde254f95de5a75eceab9c5c63e6307355ebecf0a48","observation_id":"f2f4f897-f0be-4af4-9219-7787f9111105","resolution":{"observed_at":"2026-08-12T12:26:49.390520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.394856Z","title":"Predicting depth, surface nor- mals and semantic labels with a common multi-scale con- volutional architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.394856Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:29801c11a90199c2fc6bbe592c0fecc52fce6788a85cda025b2a912468a3c3de","observation_id":"6ec9e73d-34da-4b78-aaa4-2128f5f59dc9","resolution":{"observed_at":"2026-08-12T12:26:49.394856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.399804Z","title":"Gpt-3: Its nature, scope, limits, and consequences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.399804Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:e7144f9eb01899389ed733b9581048cbd11daaae28bfb2b8bc44881d145ef63c","observation_id":"2c9d8aa0-67eb-462d-8b0e-dd08457fff4e","resolution":{"observed_at":"2026-08-12T12:26:49.399804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.414322Z","title":"Unfolding an indoor origami world","venue":null,"work_id":"666b0587-f163-410e-a934-31c6ba5d5335","year":2014},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.404192Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:31cf0db016b8fc0f1ddfa84ee61c84c795b59ea952501f3956dd66e2d7bb2102","observation_id":"032f69e2-a540-41a1-8fa4-26a649dd0315","resolution":{"observed_at":"2026-08-12T12:26:50.419189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.408572Z","title":"Deep ordinal regression net- work for monocular depth estimation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.408572Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:cf1490d1989151347c55eeb5d21ffc9b82ed4aa8a3455e5dfe9d4731e772df35","observation_id":"82fae043-fe50-4ef7-99ee-7871cdf01673","resolution":{"observed_at":"2026-08-12T12:26:49.408572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.389554Z","title":"Geowiz- ard: Unleashing the diffusion priors for 3d geometry esti- mation from a single image","venue":null,"work_id":"ae95efc1-677b-4c81-a938-4e290fec47ea","year":2025},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.413308Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:a6c84d6d6b866ba9ceb1ab04b48eb522d0b330e29ef3a2659d195726019ed652","observation_id":"2ae88873-2835-4af3-abb9-d76d0f0c1ef9","resolution":{"observed_at":"2026-08-12T12:26:50.394471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.417483Z","title":"Fine-tuning image-conditional diffusion models is easier than you think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.417483Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:76215ae7108279db0727f1552797e13ed91e417456b68c001ecb04c7d4135a07","observation_id":"10fd91f8-9759-4813-ada6-a8b09b7ad15b","resolution":{"observed_at":"2026-08-12T12:26:49.417483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.421736Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.421736Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:8a8f354c8026bba15e23077533e33c2b44f7d664904ca0e5548205fbb6507406","observation_id":"1abc2e7b-9865-47f3-b0df-773249ae66a6","resolution":{"observed_at":"2026-08-12T12:26:49.421736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.425894Z","title":"Unsupervised monocular depth estimation with left- right consistency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.425894Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:87a6cbd6aa5d86a16711bf1dd8dc5231b73e54b1f92d78334a3350cf967095f5","observation_id":"f616ba72-e35a-4819-8b28-52d37ebe15e0","resolution":{"observed_at":"2026-08-12T12:26:49.425894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.355479Z","title":"Sparsectrl: Adding sparse controls to text-to-video diffusion models","venue":null,"work_id":"c2deb632-e794-42fd-8b01-12d5441da529","year":2023},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.430555Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:760ea7b3c78001d5332e5cf624ec752c717d96658adb518f749341c93fb305c2","observation_id":"e8dbd863-3354-471b-b356-c0b7b7935331","resolution":{"observed_at":"2026-08-12T12:26:50.360134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-12T12:26:49.434878Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.434878Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:23f27145fe67e7695bd88fe2b5037d11b2f1e2f7feaefef117982181d3596a32","observation_id":"975036b5-c9bd-48f2-964e-05b94accd2ff","resolution":{"observed_at":"2026-08-12T12:26:49.434878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.439392Z","title":"Cameractrl: Enabling camera control for text-to-video generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.439392Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:4afbe37e176d411f49823960913e0b54027fab96ec57f4c0f3317bc474b3df66","observation_id":"9ac0534f-b42b-44f2-aa42-633ffb811955","resolution":{"observed_at":"2026-08-12T12:26:49.439392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18124","last_updated":"2025-01-18T20:14:54Z","snapshot_observed_at":"2026-08-16T13:15:00.975439Z","submitted_at":"2024-09-26T17:58:55Z","title":"Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18124","snapshot_observed_at":"2026-08-12T12:26:49.443740Z","title":"Lotus: Diffusion-based visual foundation model for high-quality dense prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.443740Z"},"links":{"cited_paper":"/paper/2409.18124","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:54089ebe97d0d767c21775bec4c5151f0a01553582b80ceb3d5b40669e35fe00","observation_id":"9b02d17b-0e95-4da9-aa2b-5900149ae4f9","resolution":{"observed_at":"2026-08-12T12:26:49.443740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.330527Z","title":"Au- tomatic photo pop-up","venue":null,"work_id":"88b58f46-c504-4c3c-9807-6a7f77b07f01","year":2005},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.448544Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:c4becad987a4fdeed297a137bb7e721e8430e0e83058e43b02c044383961d06e","observation_id":"7ac5a2f9-31bf-4f7f-91c8-ba9acc66daf9","resolution":{"observed_at":"2026-08-12T12:26:50.335238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.315773Z","title":"Recov- ering surface layout from an image","venue":null,"work_id":"d4c7f131-246c-4815-b374-e11b594fb74c","year":2007},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.453035Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:681373269342cb2b81f332673e1675f534305acc038445ec9c9b1f10850ec8da","observation_id":"cf3d1765-4faa-4c7b-8986-b284eb72a750","resolution":{"observed_at":"2026-08-12T12:26:50.320375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.457920Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.457920Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:18793fb860ca74be8f4d999986dc4e371e6c406025b8df70d8bd6c0660c56c96","observation_id":"1df4caab-b875-4548-954e-4105eb5519bc","resolution":{"observed_at":"2026-08-12T12:26:49.457920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-16T18:10:25.611057Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-12T12:26:49.462374Z","title":"Depthcrafter: Generating consistent long depth sequences for open-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.462374Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:65e619308c9064f63eedcf28bb69a3699c6ec16ddfd6d69966c5229925787975","observation_id":"40020932-d4fa-4969-82a0-695cf3e8a991","resolution":{"observed_at":"2026-08-12T12:26:49.462374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.290022Z","title":"3d common corruptions and data augmentation","venue":null,"work_id":"dc599bcb-2b53-4419-98e1-0b55b585ddab","year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.467369Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:783adb493843a888eef289f9c43ea415a445882a216e360dd550bf26db455bcb","observation_id":"2568f948-f0d4-4a91-adc3-4ff448e40c6d","resolution":{"observed_at":"2026-08-12T12:26:50.294598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.274014Z","title":"Repurpos- ing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":"42986922-a9a3-4589-aab5-36fc1fa8f577","year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.472397Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:87b27bd1f7f0afbebd10a1edcb0f9c4a93cefd92d5296a311c9abb3bf89e156f","observation_id":"555eb39d-6469-49f0-9625-4f2497ded9d8","resolution":{"observed_at":"2026-08-12T12:26:50.279786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.258837Z","title":"Wetzstein","venue":null,"work_id":"e62003a1-476c-46cc-8122-5071b3b267ab","year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.476689Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:bc5bebdc14843ac29289aa742e4d16ec70e0d0c7459987d2fc204e43795622bf","observation_id":"a67698da-6d59-4469-b48f-c56f66fa77f2","resolution":{"observed_at":"2026-08-12T12:26:50.263587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.244307Z","title":"Sift flow: Dense correspondence across different scenes","venue":null,"work_id":"34f6f351-7913-4f5d-acd3-774fdeb3a441","year":2008},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.480809Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:867290272b01983eafa70ae65f3dd1ebd663e25821a1b94c06ac7db7e3b5a668","observation_id":"787e8a8c-88ec-48e2-85cc-c6f8f7caf426","resolution":{"observed_at":"2026-08-12T12:26:50.248950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.229213Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":"33f2f245-5bf8-4aae-80ea-7acc520eb74e","year":2019},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.485369Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:869fcf429a617c28c08c056d259c8feb13d7014178e2ae66161f75be029eb91a","observation_id":"f251f2a2-e6d2-4adc-9891-fab44589eaad","resolution":{"observed_at":"2026-08-12T12:26:50.234128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.489604Z","title":"Refusion: 3d reconstruction in dynamic environments for rgb-d cameras exploiting resid- uals","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.489604Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:a268edcc97095667e7a12316dd84ee2a541323155baa0ab8dd92736d9526a4fd","observation_id":"88326bde-0c7e-4fe4-86e7-a20d4c0c19fd","resolution":{"observed_at":"2026-08-12T12:26:49.489604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.202902Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":"01a9d6f5-b7dc-4f29-b0cc-d91e659649eb","year":2017},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.493902Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:d692c424f25e1fade690b21ec121aad0b425fb624e158a225196831e00df91c1","observation_id":"a2df41bb-4bb0-4aa4-94fe-464ef2fc8c1d","resolution":{"observed_at":"2026-08-12T12:26:50.208525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.187135Z","title":"State of the art on diffusion models for visual computing","venue":null,"work_id":"3bb622d6-18ac-4afa-a945-de4d0d4a7152","year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.498450Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:b87bb30deb846eaae2defa06765b6bf31f6bc5a4b1caf7bc21aebc0f47b38466","observation_id":"dc4db023-3044-4f21-98b7-1917724f6012","resolution":{"observed_at":"2026-08-12T12:26:50.192683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-12T12:26:49.502751Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.502751Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:82dfaa645016ba0f50ad5443721c9ed079e28120e1eeae8973881d0338660019","observation_id":"41b6bb34-8ea3-4e49-aadf-4b030892ad42","resolution":{"observed_at":"2026-08-12T12:26:49.502751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.508084Z","title":"Geonet: Geometric neural network for joint depth and surface normal estimation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.508084Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:bde2bbbf6a2f9cea4332bbcf328b967d75407afab51c3fc03fb7d87378370340","observation_id":"e9c72c4b-9ab3-4974-a4db-0507721a899a","resolution":{"observed_at":"2026-08-12T12:26:49.508084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.512476Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.512476Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:1e91b1425f1b685f359f4a9449c4d8cc03e76d05cdea3076c1f8d719b46b0ff7","observation_id":"a4a05eea-5326-40b2-871a-9ad9aa4a2b96","resolution":{"observed_at":"2026-08-12T12:26:49.512476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.516819Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.516819Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:4121a99288dc74e9819a285b0127222e3f118dae97c4c76d7a12caf66f87495f","observation_id":"cc6973c1-3e45-4488-8bf9-8313d8c3d00e","resolution":{"observed_at":"2026-08-12T12:26:49.516819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.521458Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.521458Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:309b6e5d5a075b85f6d302a07ff31fffc236a12069311ed6dfbb1120399e41c0","observation_id":"1a86e612-d6b3-4773-82be-6f67fc50394b","resolution":{"observed_at":"2026-08-12T12:26:49.521458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.525708Z","title":"Make3d: Learning 3d scene structure from a single still image","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.525708Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:a82b588dafe1251bd641944be3fc5994f7f734d9e3efdec94844adee93d60770","observation_id":"447cf863-7a9f-4cf0-8274-1461c587a32e","resolution":{"observed_at":"2026-08-12T12:26:49.525708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01493","last_updated":"2025-06-07T07:24:16Z","snapshot_observed_at":"2026-08-18T20:57:59.739948Z","submitted_at":"2024-06-03T16:20:24Z","title":"Learning Temporally Consistent Video Depth from Video Diffusion Priors","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01493","snapshot_observed_at":"2026-08-12T12:26:49.531022Z","title":"Learning tem- porally consistent video depth from video diffusion priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.531022Z"},"links":{"cited_paper":"/paper/2406.01493","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:64f5e4048b745936a46392fba76613326cbaaa4cb1b0811c093baad359dcbb2a","observation_id":"55069968-05a1-4281-9857-e5a3511f756e","resolution":{"observed_at":"2026-08-12T12:26:49.531022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.535752Z","title":"Human4dit: 360-degree human video gen- eration with 4d diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.535752Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:8b5767069625f0ec4fca357941296fee794d23cc5a7c950e98354cb69232b8d6","observation_id":"20332be9-bc3b-422c-8fc7-30c45a9ad1cb","resolution":{"observed_at":"2026-08-12T12:26:49.535752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-12T12:26:49.540029Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.540029Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:a6a238b5ad3892c8df06cb9dc292d3ce3c2fe77c022e02914c4d5281070fa3fe","observation_id":"a0b2460d-c2dd-4561-868d-92c11a7716e5","resolution":{"observed_at":"2026-08-12T12:26:49.540029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T12:26:49.544620Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.544620Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:58a62dbf83c5a7b582f4dffc365c94d09ea3f677fc0313257392d8b7fbad6b4f","observation_id":"0a6d8dc2-3177-467d-bc8f-d2e7e7f35f97","resolution":{"observed_at":"2026-08-12T12:26:49.544620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.549250Z","title":"Diffusers: State-of-the-art diffu- sion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.549250Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:f0ab568a73e11568ee52ecb187ed8a29d6fc515c973b20380213cde0ef067a1e","observation_id":"c8729ca6-1a4e-4c09-95f8-6d771d0c42de","resolution":{"observed_at":"2026-08-12T12:26:49.549250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.100089Z","title":"Vplnet: Deep single view normal estimation with vanishing points and lines","venue":null,"work_id":"39375c27-685a-4576-9e41-e91504c8a9c6","year":2020},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.553546Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:ca28f24676f1dd769532f184042d5b50d2b25831e7fe85958d88b42736b0e4d0","observation_id":"10f8e96c-0a6e-4de1-bf79-f984be9415ae","resolution":{"observed_at":"2026-08-12T12:26:50.105611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.085128Z","title":"De- signing deep networks for surface normal estimation","venue":null,"work_id":"34c110ad-f61c-4b73-9c36-cdcbdc781aae","year":2015},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.558243Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:53b25aad1e1dc48ea13c955578844450ef783d52052747c9f42bf814024952c5","observation_id":"11754409-b13d-45f4-9751-d988e5fbbe34","resolution":{"observed_at":"2026-08-12T12:26:50.089789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.069155Z","title":"Less is more: Consistent video depth estimation with masked frames modeling","venue":null,"work_id":"7b618c5f-8138-4195-b888-84d81c2065de","year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.562494Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:1a28d7d6b5927b360e51392ca913f00b8cf3544f745c4c3bee6acee3dbebc335","observation_id":"b2cbdd1c-6395-4ba8-a6b6-f9f690b4a448","resolution":{"observed_at":"2026-08-12T12:26:50.074061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.566738Z","title":"Neural video depth stabilizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.566738Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:209105f23d90f7f263150aa02247480156aab8778ac540851775859f92e688d1","observation_id":"a85f3e65-fcab-43ec-bdca-3f32631c5da8","resolution":{"observed_at":"2026-08-12T12:26:49.566738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-08-12T12:26:49.571053Z","title":"Camco: Camera- controllable 3d-consistent image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.571053Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:2792a0d04c5cdd4d2cce7acbd21ea7cb4d3617c8d0df67b8fb840a9ca6674d08","observation_id":"b0acf96b-5ada-4329-8bae-d08283b2dda1","resolution":{"observed_at":"2026-08-12T12:26:49.571053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.044380Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"483caf5b-9683-4d05-801a-4de8f12be35c","year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.575647Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:44df9e3659ad6b975c3231a49930c8485f158f051ec3729819e117b24b70be89","observation_id":"d05fd471-d3b3-4e86-bdd8-70c6a9869666","resolution":{"observed_at":"2026-08-12T12:26:50.049053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-12T12:26:49.579883Z","title":"Depth any- thing v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.579883Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:2ac99404c1d593a3423c669830283f858bfa3d696e0c34ad8855bbbb85cdd6ba","observation_id":"117cd4ed-22cd-4fbd-b815-4464841292b2","resolution":{"observed_at":"2026-08-12T12:26:49.579883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.029357Z","title":"En- forcing geometric constraints of virtual normal for depth pre- diction","venue":null,"work_id":"f2cc5373-347a-4a91-a69f-e899b0406d27","year":2019},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.584342Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:2a4e96a2d6072657dc324fa2cba1ea1203d1a8983c6d34723ec607a12c885fde","observation_id":"8a1668ba-09a1-4b4b-8c4b-55c34ccf21cb","resolution":{"observed_at":"2026-08-12T12:26:50.034622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.013675Z","title":"Rgb ↔x: Image decomposition and synthesis using material-and lighting-aware diffusion models","venue":null,"work_id":"43d60e76-acf5-4560-9711-98c07899985d","year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.588513Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:e0d2342393b8b1342a93cb003dcb64301b6546c5971752c25841656c981af891","observation_id":"d5764505-c86a-48da-9dd9-939a82876222","resolution":{"observed_at":"2026-08-12T12:26:50.018555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.997159Z","title":"Hierarchical normalization for robust monocular depth estimation","venue":null,"work_id":"c6ecacb9-1159-4f9c-b1c5-5b7c38868dcb","year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.593053Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:41fe57335bd083fe170fae4ac769c72642d1c4a5b99460dcf7a6edbf1807ce17","observation_id":"2acbd3f7-9950-4622-82d2-f444f9d6f573","resolution":{"observed_at":"2026-08-12T12:26:50.002051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.981350Z","title":"Arf: Artistic radiance fields","venue":null,"work_id":"7c3fb86d-f72f-49b3-becc-832a5d69ee16","year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.597204Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:7b5bbf1a123377b22cb1c74d7ad3c083d8ce3fa179eaee55eefeef834a2f86cc","observation_id":"0c1eebdc-368c-4d59-b42d-321006368869","resolution":{"observed_at":"2026-08-12T12:26:49.986336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.966060Z","title":null,"venue":null,"work_id":"cfc14b48-a406-4c18-a935-61259226b01b","year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.601496Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:fafb4ac5e0a3ea9502c4f558e8591aa0567c56e8934d99f8f71b349fbc7bf665","observation_id":"2a277178-70c8-4b7b-9787-2d804b36647f","resolution":{"observed_at":"2026-08-12T12:26:49.970703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.949919Z","title":"We utilize the official implementations of Depth Anything V2 [56] and Marigold-E2E-FT [20], adapting temporal blocks from the UnetMotion architecture in the Diffusers [49] library","venue":null,"work_id":"3e16de3c-8c18-402b-9dd1-e8043d6891e6","year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.605761Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:0d0a4ad686a25070203a015d22e2805ff6f675923b89d9ad6ba0a058a978a2de","observation_id":"1d80dda8-fece-4ef0-aa11-14c1ef3d8e8e","resolution":{"observed_at":"2026-08-12T12:26:49.955597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.932911Z","title":null,"venue":null,"work_id":"0089130a-ef71-4d2c-b2c9-5604c6912853","year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.610580Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:dfacae943724095d3e31750535f43fbbbfd1d34ce8de381555eb1f00dd24322b","observation_id":"3c3225c1-1da2-49aa-916e-77646c08e3d5","resolution":{"observed_at":"2026-08-12T12:26:49.938514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.368602Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.368602Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:9d48154ca7826b67791e6619aed33e173e0f791792a95fe2247eab446460c8ad","observation_id":"55c7ddf7-4846-4016-ab8f-eb0e4350a923","resolution":{"observed_at":"2026-08-12T12:26:49.368602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2411.17249."}