{"as_of":"2026-08-10T11:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:929c9371c1c412b8f212e93471423ccf3af5ade65cba8437260e1605bcf46426","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:10:55.455485Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T03:42:54.620069Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T03:42:57.302590Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"cited_work":{"arxiv_id":"2502.07001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07001","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Polanía, Yi Yang, Chuhan Zhang, Rishabh Kabra, Anurag Arnab, and Mehdi S","venue":null,"work_id":"c9f45f9a-35a6-4e9c-a01e-63922b716060","year":2025},"citing_paper":{"arxiv_id":"2507.13942","last_updated":"2026-04-15T13:59:47Z","snapshot_observed_at":"2026-07-31T09:25:03.034282Z","submitted_at":"2025-07-18T14:14:19Z","title":"Frozen Forecasting: A Unified Evaluation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T03:42:54.620069Z"},"links":{"cited_paper":"/paper/2502.07001","citing_paper":"/paper/2507.13942"},"observation_digest":"sha256:079f3d10d4be33f1712e263f61c295fec318c2574ed47df160b5d479eebb23dd","observation_id":"a2d5ddbd-90f3-4119-9328-a330dd5eaf9c","resolution":{"observed_at":"2026-05-19T03:42:57.304495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"cited_work":{"arxiv_id":"2502.07001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07001","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Polanía, Yi Yang, Chuhan Zhang, Rishabh Kabra, Anurag Arnab, and Mehdi S","venue":null,"work_id":"c9f45f9a-35a6-4e9c-a01e-63922b716060","year":2025},"citing_paper":{"arxiv_id":"2605.02134","last_updated":"2026-05-04T01:30:04Z","snapshot_observed_at":"2026-08-03T21:24:39.449239Z","submitted_at":"2026-05-04T01:30:04Z","title":"Video Generation with Predictive Latents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-09T16:55:54.709581Z"},"links":{"cited_paper":"/paper/2502.07001","citing_paper":"/paper/2605.02134"},"observation_digest":"sha256:f7a1545b2ea7b4b5ac67d385aff2cad1384fb9d3349fdf06b2dd1d4d7bd35f95","observation_id":"0b36fdbc-3921-4f57-8d81-c211e5d371ff","resolution":{"observed_at":"2026-05-11T16:26:09.069938Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07001/citation-record","integrity":"/paper/2502.07001/integrity","json":"/paper/2502.07001/citation-record.json","paper":"/paper/2502.07001"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.539035Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture","venue":null,"work_id":"7f077ff8-264b-4ab0-99a6-f49b5747a6db","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.116949Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:3f50fe793fe36060a2745bf65509808d53beb240aff4b99758e5093b8849ea43","observation_id":"603821a0-9355-48c5-9aeb-a0481d66b0c7","resolution":{"observed_at":"2026-08-08T14:10:56.543774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.524085Z","title":"Video diffusion models learn the struc- ture of the dynamic world","venue":null,"work_id":"44a8f526-d63b-4daf-94d4-63fa27bcfb9d","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.122254Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:0fbb26172e7be929804d4b6745b4f79e2fde7bfa59e4e0b46be32c00abc9e69c","observation_id":"cf7f64f8-25c1-4c34-910c-da56a3c62b98","resolution":{"observed_at":"2026-08-08T14:10:56.529087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11337","last_updated":"2024-02-17T17:08:16Z","snapshot_observed_at":"2026-07-06T17:31:37.574049Z","submitted_at":"2024-02-17T17:08:16Z","title":"Learning by Reconstruction Produces Uninformative Features For Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11337","snapshot_observed_at":"2026-08-08T14:10:55.127624Z","title":"Learning by recon- struction produces uninformative features for perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.127624Z"},"links":{"cited_paper":"/paper/2402.11337","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:29b9d5e7a3f8e499e53fda7c11a6937fe19bf588c552f888b22f2c0803a5432d","observation_id":"84998fb5-9c41-4862-ad36-25ae68f7595f","resolution":{"observed_at":"2026-08-08T14:10:55.127624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.509052Z","title":"Label-efficient se- mantic segmentation with diffusion models","venue":null,"work_id":"bed6fe24-09ea-4984-b4a2-c7b34c4bff72","year":2022},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.133861Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:8c5d38f0e3b0eaa60c227c9b0c655a5cd243b319bbd8fa9da19a8e5ba553f1fc","observation_id":"e8f2fc10-1067-4eb7-b442-9c176f7863b6","resolution":{"observed_at":"2026-08-08T14:10:56.513716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-07T02:30:11.447693Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-08-08T14:10:55.138930Z","title":"Revisiting feature prediction for learn- ing visual representations from video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.138930Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:240a1b95a6b4893c440371f85f34380ed3f47291f0ac29be61a22a2508cb8119","observation_id":"a21fbcaf-e472-4e30-a2ab-a570cd1ceb2a","resolution":{"observed_at":"2026-08-08T14:10:55.138930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T14:10:55.144179Z","title":"Stable Video Diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.144179Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:0dcefd1cd84709a75c227626c1d7377c29891e3dd41a24103a73b5ff95d9b4c3","observation_id":"65321793-a5fe-4987-8f30-8828dc9fc8d7","resolution":{"observed_at":"2026-08-08T14:10:55.144179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.494094Z","title":"Deep regression on manifolds: a 3D rota- tion case study","venue":null,"work_id":"1433411f-5eb3-4d01-a875-d6a1ddc2c507","year":2021},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.149974Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:ff4e0c5417bc45bf7fdfd8133ceb9efca5bb658dc34378e2c9fef7fd0f212902","observation_id":"ae5814d3-b1c7-4258-a241-1b50a0120411","resolution":{"observed_at":"2026-08-08T14:10:56.499007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.477224Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"515c380c-92f3-4815-9488-2c4226f9a21c","year":2021},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.154906Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:2b297b9b6db4ba2ef62c2d65ffeb82b1231d8bed14a71efea12af30bc9acc7d6","observation_id":"2b88fef2-7f80-42e0-b5a4-fc00d09576d3","resolution":{"observed_at":"2026-08-08T14:10:56.482929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.159745Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.159745Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:d700e2df2b0e4769620f669bbf54a96710e8f3e1aed05d707242d405d9de2c6b","observation_id":"2c952667-f4b4-437d-946e-a2045f6b52b9","resolution":{"observed_at":"2026-08-08T14:10:55.159745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-08T14:10:55.165909Z","title":"A short note on the kinetics-700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.165909Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:de7cdcbea34d803a9615c433f69db3dca7c7452c54d018f690a535aa85b6eed1","observation_id":"ddf9d714-8dfe-4364-b1e4-2a330064446e","resolution":{"observed_at":"2026-08-08T14:10:55.165909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15212","last_updated":"2025-07-09T16:58:07Z","snapshot_observed_at":"2026-08-06T10:25:48.518948Z","submitted_at":"2024-12-19T18:59:51Z","title":"Scaling 4D Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15212","snapshot_observed_at":"2026-08-08T14:10:55.171296Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.171296Z"},"links":{"cited_paper":"/paper/2412.15212","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:0f937f40bc2b48df7611ac65398084a617770509132f28ecfc9b8ac794390b57","observation_id":"647ea506-fb21-412f-8709-191a86556497","resolution":{"observed_at":"2026-08-08T14:10:55.171296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.448664Z","title":null,"venue":null,"work_id":"cfb334d2-d1fb-4e96-95c0-951b927c3dba","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.176297Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:e7590a177fe40bad057a461167f1d21c0cde396779eb08b79f7308b9494b7190","observation_id":"fd97b2ea-81ad-4ab1-84fb-bf8e4fc288ed","resolution":{"observed_at":"2026-08-08T14:10:56.454616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-09T14:40:36.849154Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-08T14:10:55.182071Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.182071Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:fb1efb05947e610f025a759d2cef359ac69b3085296155ed1f5917b351f1b8d2","observation_id":"62146370-3bbb-4834-85ed-c1be60865c89","resolution":{"observed_at":"2026-08-08T14:10:55.182071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.432629Z","title":"Text-to-image diffusion mod- els are zero shot classifiers","venue":null,"work_id":"06e8ad83-a913-4229-a632-1410615da276","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.187263Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:3ef1ef6ef9d390cbe2b451dd7f9518689ee5407001a953426ee63dc5dd91b304","observation_id":"c7fff663-46f1-4cee-9c79-59e461514fc6","resolution":{"observed_at":"2026-08-08T14:10:56.437657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.415190Z","title":"Chang, Manolis Savva, Maciej Hal- ber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":"4af8d44d-d1cc-4efc-a8d8-a9c20102cb5f","year":2017},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.191848Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:e65949b13d3bce5bc76c844fc8680f2eb93bc30a6335d4e8a44966e5b094a29c","observation_id":"6babfe3c-9302-4e56-9aee-1c71d713bea9","resolution":{"observed_at":"2026-08-08T14:10:56.421615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.398361Z","title":"Depth map prediction from a single image using a multi-scale deep net- work","venue":null,"work_id":"9f2aa87e-b853-408e-b2e0-dcbdc67073c0","year":2014},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.196339Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:7e27ce669427b3ca661d344077f16180948fcb0026f89fdf12e31ca17bf9f068","observation_id":"ceb7d32a-da1d-453d-bd88-0f0e747d5aa5","resolution":{"observed_at":"2026-08-08T14:10:56.404034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.200902Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.200902Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:4e65bb7610286e26524b0f01503c98271380aed2a1922d36113249e324f53693","observation_id":"a71f2f6c-c156-4b51-a343-bf48d93d0515","resolution":{"observed_at":"2026-08-08T14:10:55.200902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.369072Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":"4903a9de-cc54-43d2-84ed-0eb6cad38b49","year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.206228Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:b35fcaa83ce95d74dad09f9601fc4da70ff85dfb3c54f472b47fc85f9ab9046d","observation_id":"48a5b6a2-1bea-47c0-9fda-cc34bcdc70fc","resolution":{"observed_at":"2026-08-08T14:10:56.374861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00783","last_updated":"2024-06-30T17:59:58Z","snapshot_observed_at":"2026-08-10T09:55:22.812749Z","submitted_at":"2024-06-30T17:59:58Z","title":"Diffusion Models and Representation Learning: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00783","snapshot_observed_at":"2026-08-08T14:10:55.211931Z","title":"Diffusion mod- els and representation learning: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.211931Z"},"links":{"cited_paper":"/paper/2407.00783","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:8d16ae5962e9873c7246b949f3b88802d9ca69a11b3a26994f189d18f8e5fb51","observation_id":"ade7fd2f-118a-4d8b-a295-b245f66e7678","resolution":{"observed_at":"2026-08-08T14:10:55.211931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.349516Z","title":"Something Something","venue":null,"work_id":"73c9c563-588d-4fdd-8d2c-f7149e0c008b","year":2017},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.217130Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:613f50bb4b11a0b512e9cf3eb96b502233457735b7a3c6eb3e3ac6da697699ed","observation_id":"16a378de-c69e-41e8-8dcc-8909361ab035","resolution":{"observed_at":"2026-08-08T14:10:56.354536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.332551Z","title":"Kubric: A scalable dataset generator","venue":null,"work_id":"87388ee1-f3a4-486b-b9db-7dc0cd0c6e9d","year":2022},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.222921Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:5151c942976b12e5ca7b4cbdabf17562131060ee4c3454070a6f12eb0ec43442","observation_id":"20c8d60a-5b6a-427b-b8fd-cfcf907d1c47","resolution":{"observed_at":"2026-08-08T14:10:56.338487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.315244Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"93cc3b18-5274-4ef5-98da-01241af44118","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.227765Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:18afacb79eaae934985172a574441b4ab5097dc6f39ba1998f233e14e5b7f897","observation_id":"8d92fef7-1769-4742-b1e0-aeed694afa2b","resolution":{"observed_at":"2026-08-08T14:10:56.321232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.298733Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"6e0f21fa-4c9c-434b-af36-9260730f3c5e","year":2022},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.232445Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:2889f13f58cae80051513b185e41561e06a49d174cc7a37fa63bd18993c724e1","observation_id":"7302ca0f-4509-4216-a41e-7b1fd9d63e17","resolution":{"observed_at":"2026-08-08T14:10:56.303949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.283115Z","title":"Unsupervised keypoints from pretrained diffusion models","venue":null,"work_id":"d8800939-e00f-4bb1-8374-90e8b6c187e8","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.237362Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:ad20005a22280d750985aea19011e6ac2b30bca21defc8eba11133733efba6f7","observation_id":"737ae461-0659-4691-a059-b1c40a504c27","resolution":{"observed_at":"2026-08-08T14:10:56.288117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.242828Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.242828Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:bb532bd625e318bdc6adee7c744e38d793cc6225f67b52c4e2cedb1ddb034050","observation_id":"a2be131a-35d6-40b5-873b-dd347fdbb184","resolution":{"observed_at":"2026-08-08T14:10:55.242828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-07T23:17:31.541423Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-08T14:10:55.247542Z","title":"Depthcrafter: Generating consistent long depth sequences for open-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.247542Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:c82fccb753adbe58636fd2c022c48c36435bf3bb3ed2d66ca96412de12731d7a","observation_id":"a32fe247-85c8-4dc7-8b9e-4ab376ec1002","resolution":{"observed_at":"2026-08-08T14:10:55.247542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.255222Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"b4c54cb1-8f2a-4bae-8fb6-3a8c3dbbeea1","year":2022},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.252875Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:263d94943148f5b723479a0ee5a1e32ab6d3bb21e11358fb0d63ff406e545b8d","observation_id":"68812302-5910-4492-ada0-0d5cf32723e1","resolution":{"observed_at":"2026-08-08T14:10:56.261203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.238586Z","title":"Your diffusion model is secretly a zero-shot classifier","venue":null,"work_id":"9fd1f47b-e3bb-443f-9b43-ae9a8af33fc5","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.257709Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:5c9c4b20a6ff7394bb32f2f8e2ab35fd5e9c2451c4c71e8e614bb5d9d2172713","observation_id":"87a222f0-25fc-41b2-bad7-3d32451b08f8","resolution":{"observed_at":"2026-08-08T14:10:56.243722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-08T14:10:55.263104Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.263104Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:9a1712b964d59c79fa551cd8e89773f3e6b2f6a031cd08c5187ea79b5e99d3d9","observation_id":"c3a21647-dd1e-4432-8077-36b0cb0d8030","resolution":{"observed_at":"2026-08-08T14:10:55.263104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.221648Z","title":"Diffusion hyperfeatures: Search- ing through time and space for semantic correspondence","venue":null,"work_id":"7e0d9f6f-004f-4103-9bed-8ebe446647fa","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.268287Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:a7caa55389d2673b72eac17ef0fa7793326c6583a12ff136818b5a6dbf98eeee","observation_id":"fe5d3173-800e-4721-9961-1d22c15a3088","resolution":{"observed_at":"2026-08-08T14:10:56.226488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.206390Z","title":"Understanding deep image representations by inverting them","venue":null,"work_id":"069e2083-b822-4749-a922-9d8b78a7391a","year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.272944Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:3d4d186edead9b5c27d8cb181a75981d4459f0c4511cf4929dce04cd22a98c1f","observation_id":"db54a12f-71f6-4882-b412-13304013a4d5","resolution":{"observed_at":"2026-08-08T14:10:56.211266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.189634Z","title":"Lexicon3d: Probing vi- sual foundation models for complex 3d scene understanding","venue":null,"work_id":"d7a0eb7d-5b5f-49f3-bd7f-2f851527363e","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.277612Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:85712134be70e31d60b39e401cc4b1edd6d6b0d35f1811c178d2ce409ffdefed","observation_id":"f6c3539d-ca5e-4a6c-b193-e525ed96fc62","resolution":{"observed_at":"2026-08-08T14:10:56.194835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.173460Z","title":"NeRF: Representing scenes as neural radiance fields for view syn- thesis","venue":null,"work_id":"21da2594-75d2-4925-9e32-56c125196df7","year":2020},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.282206Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:9cf659b66bef2d392a82285365eaa110aa3e3d7cd4b3a01e3ac9b20114c11629","observation_id":"24f582d3-87f7-4921-a4c4-d2b6ba373ad6","resolution":{"observed_at":"2026-08-08T14:10:56.178589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08702","last_updated":"2023-07-17T17:59:40Z","snapshot_observed_at":"2026-08-07T23:37:36.441503Z","submitted_at":"2023-07-17T17:59:40Z","title":"Diffusion Models Beat GANs on Image Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08702","snapshot_observed_at":"2026-08-08T14:10:55.286821Z","title":"Diffusion models beat GANs on image classification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.286821Z"},"links":{"cited_paper":"/paper/2307.08702","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:d0de7fe315f256dd2a25c2db63b2540045ba4c9fbd05403585a2d90b04b36d16","observation_id":"7cc0493e-586f-4637-b833-9ad2376161ba","resolution":{"observed_at":"2026-08-08T14:10:55.286821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.156968Z","title":"DiffTAD: Temporal action detection with proposal denoising diffusion","venue":null,"work_id":"7c179d41-d583-4c75-8ae2-cbd5415bacb4","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.291762Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:65bdabd6a39acd277540c62e0050817029280ce7421dc3567aad2465a3d3bdd8","observation_id":"41f6959e-fb2f-4959-a742-3f5306b03908","resolution":{"observed_at":"2026-08-08T14:10:56.162756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.296307Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.296307Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:ea0a7c6ec87b128716b320c82bfabc11f3d002343e025973d039f3aeda8c983a","observation_id":"297db8f9-bf23-4d29-abec-819a1b70cac8","resolution":{"observed_at":"2026-08-08T14:10:55.296307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.131199Z","title":"Self-supervised video pretraining yields robust and more human-aligned visual representations","venue":null,"work_id":"b4748936-9e9b-4deb-9ed3-b32e47b798dd","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.301353Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:6790f73787f2cc83a4f845d170d94dab6768668ed1b3218ad65e59b45fb82ad6","observation_id":"1bcfb7f4-2bf5-4b4b-98e8-0b52de14c06d","resolution":{"observed_at":"2026-08-08T14:10:56.136122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.115646Z","title":"Per- ception Test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"1d4d4bfe-3791-42f5-800f-7b864b53c3db","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.306794Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:1544b79fc6d8fc4425563ce6be1313e5eac3af9f55bf362b9343bee5f10d6131","observation_id":"08856bea-5579-4067-91d6-e9ddf695b466","resolution":{"observed_at":"2026-08-08T14:10:56.120448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.311336Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.311336Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:a51c53551c0a9378165fb87ec230aa58f6f8cc35923bad34dc725be2da35f1bd","observation_id":"babb581f-0cb3-4ed5-a5c6-ed0d335fa9bc","resolution":{"observed_at":"2026-08-08T14:10:55.311336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-08T14:10:55.315744Z","title":"The 2017 DA VIS challenge on video object segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.315744Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:a0841bf5361d4bf7b162ee34ab22466d4bb7b4a191072d979b9c301729b01954","observation_id":"08672b8d-6e27-4aa5-a28f-9001a1def01e","resolution":{"observed_at":"2026-08-08T14:10:55.315744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.320638Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.320638Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:e922842491dad20fa508b292eec708d4cfa920da0f92d6ff99090d626d0cd640","observation_id":"a81a3c84-5fe0-4f51-a6bc-e6a6fb922909","resolution":{"observed_at":"2026-08-08T14:10:55.320638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.326083Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.326083Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:3c2db964d93a48636aeb4740f80b060e89edada37f286dee39d350c51d22a548","observation_id":"a5c0f855-667d-4bca-8468-481b32e18231","resolution":{"observed_at":"2026-08-08T14:10:55.326083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.068129Z","title":"U- Net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":"8d824540-a038-4b9d-a246-830541fd6623","year":2015},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.331019Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:9efbd9b70ec1aafcf90271cd5f29ae67877001e44377c967c2ca07b27fab2d1d","observation_id":"116c1a14-2760-4986-a65c-d87aa487f408","resolution":{"observed_at":"2026-08-08T14:10:56.074226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.051645Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"e31e7a8e-8151-476f-a4b1-f4fcaa666e5d","year":2015},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.335679Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:2be6f46565458c18183e19d1d94d3f0f0478d2975baaa9d6d86b107f01ea5905","observation_id":"dbfba91e-e117-43b3-a687-098d0627e39b","resolution":{"observed_at":"2026-08-08T14:10:56.056491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.035987Z","title":"Scene representation transformer: Geometry-free novel view syn- thesis through set-latent scene representations","venue":null,"work_id":"c4b36d38-2add-495d-8e1a-5fc31ec6d090","year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.340453Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:07354a897f70c3e2691eea7566a1367514b0778ad91dcfd449fe418fda0d3245","observation_id":"c6ab9844-88b4-41a7-b0c7-50e4d4d98c4c","resolution":{"observed_at":"2026-08-08T14:10:56.041323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:56.020498Z","title":"Only time can tell: Discovering temporal data for temporal modeling","venue":null,"work_id":"cf23db0c-a463-4a42-af57-5962e2e08aa0","year":2021},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.345836Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:4f6c3edb47d41d45706f5a2e67d18a99a9f520020cd64ef63d4cb42497d2e750","observation_id":"3b8c6641-290a-4a7d-8e5b-11179bae4712","resolution":{"observed_at":"2026-08-08T14:10:56.025424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07198","last_updated":"2023-11-13T09:38:30Z","snapshot_observed_at":"2026-07-06T16:46:30.470666Z","submitted_at":"2023-11-13T09:38:30Z","title":"MonoDiffusion: Self-Supervised Monocular Depth Estimation Using Diffusion Model","version":1},"cited_work":{"arxiv_id":"2311.07198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07198","snapshot_observed_at":"2026-08-08T14:10:55.556457Z","title":"MonoDiffusion: Self-Supervised Monocular Depth Estimation Using Diffusion Model","venue":"cs.CV","work_id":"28d67ea4-ee19-44d5-9d30-6024ba6a13e2","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.350854Z"},"links":{"cited_paper":"/paper/2311.07198","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:ea9d689f93326aa96b9c400b1e12bb9e27d4d282bd1f80ae9e9a1c353bbcffc7","observation_id":"6fb7003e-13f5-43c8-bb60-fff423a83da4","resolution":{"observed_at":"2026-08-08T14:10:55.563436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.355636Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.355636Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:48e7342f7a34b0506689d5329099935564997740b884e7e1611fb9e982a35939","observation_id":"f154804d-1108-4532-90cb-1f8bf6e6e25a","resolution":{"observed_at":"2026-08-08T14:10:55.355636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.993863Z","title":"Scalability in perception for autonomous driving: Waymo Open Dataset","venue":null,"work_id":"145237d9-20cb-4fc7-88b8-c7e91ee5072b","year":2020},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.360284Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:531588e86417c30e72104916456d59d2e74f96d79c4971105530362e2b4d4f52","observation_id":"7b302f72-d9ab-45a3-bb7e-53a11f481eb2","resolution":{"observed_at":"2026-08-08T14:10:55.998842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.978878Z","title":"Emergent correspondence from image diffusion","venue":null,"work_id":"496e504a-9cba-431d-af1f-f781505f3b95","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.364835Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:f9bf0770d7c1da4c9513641b22273f4744f3b96ffefb0974d4c7e78e07f5afe5","observation_id":"23f0ce83-05b5-4ff3-bb97-8c14bd76ba9e","resolution":{"observed_at":"2026-08-08T14:10:55.984019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.963887Z","title":"VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"48318430-f685-44f7-8c57-318c8aab79e8","year":2022},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.369731Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:fc27a914c46a2663b86319a6db4bd675c6b83250c1462bc91cfd0b12ce410b73","observation_id":"ea064e57-1183-4773-92f6-55510f4c043b","resolution":{"observed_at":"2026-08-08T14:10:55.968978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-08T14:10:55.374419Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.374419Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:c63207b7b39aee3dfe6849bdc92f62edd209ea1c70676746e41c46790d6611b2","observation_id":"2ffa4df1-3728-42d1-89f9-fbbfc6e56103","resolution":{"observed_at":"2026-08-08T14:10:55.374419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.948893Z","title":"Neural discrete representation learning","venue":null,"work_id":"af39a95a-8c88-474d-8233-92ae4e53a854","year":2017},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.379343Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:c83a6a5e06f69a86d90070de7f624593813a86f6f7ba5d052a259b41794eaa3f","observation_id":"94445917-140d-4ed1-83c5-d54ac64332f1","resolution":{"observed_at":"2026-08-08T14:10:55.953590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.933529Z","title":"The iNaturalist species classification and detection dataset","venue":null,"work_id":"ce350872-88d4-4071-8dd7-bb6a88a5c140","year":2018},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.383979Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:ac7366615c2d8678dd34f136a584488018da18c637dcea3cb3c44dbfdb2edaef","observation_id":"958500c9-b3bb-4d5f-9c02-e736c5693d7a","resolution":{"observed_at":"2026-08-08T14:10:55.938315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.917775Z","title":"Hudson, Thomas Albert Keck, Joao Carreira, Alexey Doso- vitskiy, Mehdi S","venue":null,"work_id":"f2530685-7c68-441c-a31c-790a0bb77a78","year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.389085Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:c29e21e81faa14aa94989421cd7deed0fd45c25ea4cf891f0d401f7b6b760781","observation_id":"af177f6d-7537-46b7-923d-127918f55d41","resolution":{"observed_at":"2026-08-08T14:10:55.923033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.902390Z","title":"Attention is all you need","venue":null,"work_id":"722f2b98-d711-4e87-bd49-d701145db3d5","year":2017},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.393683Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:5e81ecf58c3d4f50cee039b0c4b12de9d31e5c2eb9aeb3c79a1f30b443cebd27","observation_id":"3c76d85f-a3a4-41f4-b74a-885ad9d09450","resolution":{"observed_at":"2026-08-08T14:10:55.907171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.886408Z","title":"VideoMAE v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"b9e67632-f2cd-4533-86f9-6c51f293b2c3","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.398243Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:67cece5d54136e950c141599c6e34bcfbf3f16419b9035f685634e746e1bed3d","observation_id":"7502c86a-a9a9-438b-82d0-d8af2e1c7a85","resolution":{"observed_at":"2026-08-08T14:10:55.891728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07860","last_updated":"2025-04-20T04:48:38Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:23:33Z","title":"Controlling Space and Time with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07860","snapshot_observed_at":"2026-08-08T14:10:55.402609Z","title":"Controlling space and time with dif- fusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.402609Z"},"links":{"cited_paper":"/paper/2407.07860","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:e967ccb753316134c6abd343b549a2c6e9f0f53e44f59bd45bcfc584db13f594","observation_id":"2f9ede65-af59-4efc-aee6-1dbd688e7143","resolution":{"observed_at":"2026-08-08T14:10:55.402609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.869418Z","title":"Denoising diffusion autoencoders are unified self-supervised learners","venue":null,"work_id":"dc1fa155-2190-4698-8493-99ac8218b198","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.407888Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:2bf5ea4244ee769b0624baa33c16b1e4db4b63dce6ba4696467a307a3177ec59","observation_id":"0fe87e0a-d124-4519-87a1-eba6c744e2ac","resolution":{"observed_at":"2026-08-08T14:10:55.874562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.852958Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"2fc4e492-d85c-4289-a7ea-c2c26136c3b3","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.412593Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:fbdb82f61b83262d0b8a406add7c0aa748f44c98ed723d4396a489bad3c28258","observation_id":"a6a4e390-b173-415c-9063-ac78ec4bac71","resolution":{"observed_at":"2026-08-08T14:10:55.858262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.837357Z","title":"Diffusion Model as Rep- resentation Learner","venue":null,"work_id":"215fbb6a-4fd4-4601-b62f-5a2f7c186254","year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.417404Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:18d92726d1eab264c812a4dff0674cb79d7bbe89a6224ab4e247620859a975c7","observation_id":"27edcb1a-eb8b-4d72-8352-ff598a435d7b","resolution":{"observed_at":"2026-08-08T14:10:55.842384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.821241Z","title":"Gundavarapu, Luca Ver- sari, Kihyuk Sohn, David Minnen, Yong Cheng, Vigh- nesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":"1fe80ee0-ef0f-486f-ac41-10e583061480","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.421970Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:22425938a21a797329fa783fc69cccd63c0b0209e7c59b9f71f0dc6c7bef7476","observation_id":"b0ac0337-c4a8-47d4-ba5a-16d07178cb95","resolution":{"observed_at":"2026-08-08T14:10:55.826303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.804404Z","title":"A tale of two features: Stable diffusion complements DINO for zero-shot semantic correspondence","venue":null,"work_id":"4db3b70c-6798-4bfe-9708-e00b3e91d3e9","year":null},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.426588Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:85c96c3a86e819a651051a874a4237a91dd1fb4f2e893e587b2bf773e8aaa281","observation_id":"af5a3197-f2c1-4c5a-901f-b84be0514da7","resolution":{"observed_at":"2026-08-08T14:10:55.809804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13142","last_updated":"2023-08-25T02:35:54Z","snapshot_observed_at":"2026-08-09T21:09:26.219434Z","submitted_at":"2023-08-25T02:35:54Z","title":"A Survey of Diffusion Based Image Generation Models: Issues and Their Solutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13142","snapshot_observed_at":"2026-08-08T14:10:55.431225Z","title":"A survey of diffusion based image generation models: Issues and their solutions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.431225Z"},"links":{"cited_paper":"/paper/2308.13142","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:c4d31fe46eebd9c33e939d4d3309b221c13b83465bd513ae0cc9bb863751030c","observation_id":"adc973b1-8a9f-4c9f-810d-c9d4f59e998a","resolution":{"observed_at":"2026-08-08T14:10:55.431225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.788344Z","title":null,"venue":null,"work_id":"c6f365ea-a858-468c-a402-d6d212e7778d","year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.437068Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:6c13420faa5068039a2c67c1911babe50000d49523c8314367952a415ea72b79","observation_id":"54c34bff-d2ce-477f-8bfd-a6ac1a5c169a","resolution":{"observed_at":"2026-08-08T14:10:55.793939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.441538Z","title":"Unleashing text-to-image diffusion models for visual perception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.441538Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:b5a3ee697b4d4c09a2d92156f99716b5cc48d3e521c541543dfcc1d664fe6650","observation_id":"1462df58-ed28-4474-a511-dcab881afb14","resolution":{"observed_at":"2026-08-08T14:10:55.441538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.761312Z","title":"Places: A 10 million image database for scene recognition","venue":null,"work_id":"9b77be4b-6abb-4113-9149-f174909e579a","year":2017},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.446497Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:f7f3c65d3fbdb1696365d0df51c8774e88ae938b7fe76597e8648606eefc0f11","observation_id":"0f76226c-d04b-4335-801b-81acca099df6","resolution":{"observed_at":"2026-08-08T14:10:55.767105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:10:55.744304Z","title":"Stereo magnification: Learning view syn- thesis using multiplane images","venue":null,"work_id":"111ceef5-09a2-4e3a-8ced-f0e0355b55cd","year":2018},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.450982Z"},"links":{"citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:92bf8ebca094ee5ca44756e8940b64be440bba5b5c3e7d0d2321b2a2873f9723","observation_id":"3b551034-2701-48cf-a3d5-164bf2b1f3d6","resolution":{"observed_at":"2026-08-08T14:10:55.750105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12042","last_updated":"2024-07-06T04:32:58Z","snapshot_observed_at":"2026-08-09T15:23:31.528051Z","submitted_at":"2024-03-18T17:59:58Z","title":"Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12042","snapshot_observed_at":"2026-08-08T14:10:55.455485Z","title":"squeezing some- thing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T14:10:55.455485Z"},"links":{"cited_paper":"/paper/2403.12042","citing_paper":"/paper/2502.07001"},"observation_digest":"sha256:46b4d6af098826fa79f5d0f0ec22f5f904255045b8f7fa4169f31611f04016cb","observation_id":"6e333442-b790-49a6-871e-4f4bcf9c06e7","resolution":{"observed_at":"2026-08-08T14:10:55.455485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07001","last_updated":"2025-03-19T21:27:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T04:18:09.127812Z","submitted_at":"2025-02-10T19:53:46Z","title":"From Image to Video: An Empirical Study of Diffusion Representations"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 2 inbound Pith citation observations for arXiv:2502.07001."}