{"as_of":"2026-08-21T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19b5d59cdd2997dd32f38dcfbbd41bed4f21fcd8cc0f3a4fdc2e01dc3239bd73","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:13:40.206348Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:51:02.404616Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:28:38.483958Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2506.17220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17220","snapshot_observed_at":"2026-07-03T16:28:38.483958Z","title":"Emergent temporal correspondences from video diffusion transformers","venue":null,"work_id":"8be5667b-9bb1-4948-aea6-b3458f899dc7","year":2025},"citing_paper":{"arxiv_id":"2605.12587","last_updated":"2026-05-12T17:59:27Z","snapshot_observed_at":"2026-08-13T07:47:23.900604Z","submitted_at":"2026-05-12T17:59:27Z","title":"TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:12.151547Z"},"links":{"cited_paper":"/paper/2506.17220","citing_paper":"/paper/2605.12587"},"observation_digest":"sha256:e2c050810ccce2606c4ed8e43418f952e3166bfa64653c717f573df423869b4e","observation_id":"1a61c6d2-5b04-48cc-8f92-960d16369481","resolution":{"observed_at":"2026-05-14T21:29:28.981190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2506.17220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17220","snapshot_observed_at":"2026-07-03T16:28:38.483958Z","title":"Emergent temporal correspondences from video diffusion transformers","venue":null,"work_id":"8be5667b-9bb1-4948-aea6-b3458f899dc7","year":2025},"citing_paper":{"arxiv_id":"2605.30231","last_updated":"2026-05-28T17:00:52Z","snapshot_observed_at":"2026-08-13T05:41:06.302698Z","submitted_at":"2026-05-28T17:00:52Z","title":"Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T07:47:52.739735Z"},"links":{"cited_paper":"/paper/2506.17220","citing_paper":"/paper/2605.30231"},"observation_digest":"sha256:75b678b75be52690254af199300f1040147d864fbb6d3616bbad1de4c4202df2","observation_id":"080a97df-cd2c-4677-92d0-e4204c1d6f08","resolution":{"observed_at":"2026-06-29T07:53:13.652234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2506.17220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17220","snapshot_observed_at":"2026-07-03T16:28:38.483958Z","title":"Emergent temporal correspondences from video diffusion transformers","venue":null,"work_id":"8be5667b-9bb1-4948-aea6-b3458f899dc7","year":2025},"citing_paper":{"arxiv_id":"2607.01869","last_updated":"2026-07-02T08:25:38Z","snapshot_observed_at":"2026-07-07T00:07:23.664493Z","submitted_at":"2026-07-02T08:25:38Z","title":"QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-03T16:19:51.348169Z"},"links":{"cited_paper":"/paper/2506.17220","citing_paper":"/paper/2607.01869"},"observation_digest":"sha256:05f21dfdcd72dad4abcf7e81f11c35a47ba46a7d78a4c68644ab0335e947775d","observation_id":"4aaee8e3-0ee6-43c6-a899-01dbf60d87fa","resolution":{"observed_at":"2026-07-03T16:28:38.485470Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17220","snapshot_observed_at":"2026-07-14T07:11:45.493916Z","title":"arXiv preprint arXiv:2506.17220 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11081","last_updated":"2026-07-13T04:44:14Z","snapshot_observed_at":"2026-08-16T16:50:21.464152Z","submitted_at":"2026-07-13T04:44:14Z","title":"Controlling Motion Transfer in Diffusion Transformers via Attention Heads","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T07:11:45.493916Z"},"links":{"cited_paper":"/paper/2506.17220","citing_paper":"/paper/2607.11081"},"observation_digest":"sha256:53d25e85aafc20571892ae138c20d6a715873fa80ac63966d1fbfab7e1dadc41","observation_id":"f2c825ce-0016-4433-b2f9-1252f9b3732f","resolution":{"observed_at":"2026-07-14T07:11:45.493916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17220","snapshot_observed_at":"2026-08-04T16:51:02.404616Z","title":"Emergent temporal correspondences from video diffusion trans- formers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02006","last_updated":"2026-08-06T02:18:15Z","snapshot_observed_at":"2026-08-09T23:10:03.885825Z","submitted_at":"2026-08-03T10:06:45Z","title":"ASTRA: Asynchronous Spatio-Temporal Reconstruction via Trajectory Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:02.404616Z"},"links":{"cited_paper":"/paper/2506.17220","citing_paper":"/paper/2608.02006"},"observation_digest":"sha256:07e5a0d81826df0a40188390616c0d6ac2e32120ec5dfe4e183675e5f1935bbf","observation_id":"08d76611-dc7a-47f3-b541-efa44cb57232","resolution":{"observed_at":"2026-08-04T16:51:02.404616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17220/citation-record","integrity":"/paper/2506.17220/integrity","json":"/paper/2506.17220/citation-record.json","paper":"/paper/2506.17220"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T19:13:38.587882Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.587882Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:f8c2fa7e963aa7296cb755fc5a8ad89abaec3390113cee38938419ff00c9c3f9","observation_id":"d667174f-0174-4d1c-8067-ee8edf5577a8","resolution":{"observed_at":"2026-08-15T19:13:38.587882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.618161Z","title":"Self-rectifying diffusion sampling with perturbed-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.618161Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:67a812564a23a84caefa856be3c7a88ca9abf7ab51097f4e2c07f6e34d52dafa","observation_id":"9aa4e928-019a-4e95-b902-deff9ee5bf74","resolution":{"observed_at":"2026-08-15T19:13:38.618161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09072","last_updated":"2024-12-12T08:58:20Z","snapshot_observed_at":"2026-08-18T16:42:47.604260Z","submitted_at":"2024-12-12T08:58:20Z","title":"Cross-View Completion Models are Zero-shot Correspondence Estimators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09072","snapshot_observed_at":"2026-08-15T19:13:38.624015Z","title":"Cross-view completion models are zero-shot correspondence estimators.arXiv preprint arXiv:2412.09072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.624015Z"},"links":{"cited_paper":"/paper/2412.09072","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:631e9203a5787051d041d4a0010638a5973fbab179ac5ac948a30a082296d108","observation_id":"720025fd-2594-439a-b772-c81b13b132b4","resolution":{"observed_at":"2026-08-15T19:13:38.624015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08477","last_updated":"2023-04-18T03:27:52Z","snapshot_observed_at":"2026-08-16T15:39:48.920549Z","submitted_at":"2023-04-17T17:57:06Z","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08477","snapshot_observed_at":"2026-08-15T19:13:38.630126Z","title":"Latent-shift: Latent diffusion with temporal shift for efficient text-to-video generation.arXiv preprint arXiv:2304.08477, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.630126Z"},"links":{"cited_paper":"/paper/2304.08477","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:0bb232e2ca66e12301e162a98141e3b6d94488eac542d87a1815034d11d09090","observation_id":"3157be52-84b8-44d4-8a19-d22a302d83ec","resolution":{"observed_at":"2026-08-15T19:13:38.630126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13575","last_updated":"2024-08-24T12:58:08Z","snapshot_observed_at":"2026-08-20T11:39:37.153392Z","submitted_at":"2024-08-24T12:58:08Z","title":"Can Visual Foundation Models Achieve Long-term Point Tracking?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13575","snapshot_observed_at":"2026-08-15T19:13:38.635364Z","title":"Can visual foundation models achieve long-term point tracking?arXiv preprint arXiv:2408.13575, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.635364Z"},"links":{"cited_paper":"/paper/2408.13575","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:88eb9a37961b2b6be8dfadaf4a5d798977affb3de8f0f90b48e0bc602999c300","observation_id":"11ae0dc1-4dd1-446a-babc-ed4975cb84be","resolution":{"observed_at":"2026-08-15T19:13:38.635364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-20T09:39:07.545813Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-15T19:13:38.640365Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.640365Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:72c1324b2b47d681a6ecdab8cdd037f7b2acf33c6ece681f7642d47626ef5804","observation_id":"2a0cbfe5-1465-4cfa-a541-fc5924e52bc5","resolution":{"observed_at":"2026-08-15T19:13:38.640365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.691658Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.691658Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:5094d415e0fc441668362d9c1d1521ed75bc4657f1d072bff50ba8c92f69e4f9","observation_id":"ef334008-58c0-411b-a554-718ab610f3d6","resolution":{"observed_at":"2026-08-15T19:13:38.691658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18597","last_updated":"2025-03-26T09:05:41Z","snapshot_observed_at":"2026-08-16T12:59:57.130892Z","submitted_at":"2024-12-24T18:51:19Z","title":"DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18597","snapshot_observed_at":"2026-08-15T19:13:38.703145Z","title":"DiTCtrl: Exploring attention control in multi-modal diffusion transformer for tuning-free multi-prompt longer video generation.arXiv preprint arXiv:2412.18597, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.703145Z"},"links":{"cited_paper":"/paper/2412.18597","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:cfba872e9e6381fe99700ee9e3403ac2458936b679eabe134cab2f8d6caf2100","observation_id":"80b36b94-06f3-443d-8076-d2abc153124a","resolution":{"observed_at":"2026-08-15T19:13:38.703145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"cited_work":{"arxiv_id":"2412.16155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16155","snapshot_observed_at":"2026-08-15T19:13:40.995213Z","title":"Can Generative Video Models Help Pose Estimation?","venue":"cs.CV","work_id":"1231c1d0-9a12-4d56-931b-8d6da8759b27","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.707597Z"},"links":{"cited_paper":"/paper/2412.16155","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:0fa9d397c2694e0e9e0724e5b5c9bbf4d78dd91d920aef38aea75ac7dfb74ac6","observation_id":"335da015-e5d6-4308-bdd9-aaed01a63ee9","resolution":{"observed_at":"2026-08-15T19:13:41.000631Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.713091Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.713091Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:ad2f8110fa3259b9580566c60199cba68865053373db5259f53a2b058a45b950","observation_id":"372abf9e-fd1f-441e-9c52-77ac313b2de7","resolution":{"observed_at":"2026-08-15T19:13:38.713091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-13T21:01:04.724772Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-15T19:13:38.718442Z","title":"VideoJAM: Joint appearance-motion representations for enhanced motion generation in video models.arXiv preprint arXiv:2502.02492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.718442Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:0ec491bacae76451a48ee3efcfc3d4d28528ac0fdcf6054cae90b47685d28cdd","observation_id":"0fd63fc9-ed9e-40b9-9262-05af6cc1665e","resolution":{"observed_at":"2026-08-15T19:13:38.718442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-19T21:14:32.076838Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-15T19:13:38.722682Z","title":"Videocrafter1: Open diffusion models for high-quality video generation.arXiv preprint arXiv:2310.19512, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.722682Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:63c6c59b505abf705d5d43aad59d8da20eb62220e4cb634df6229a2cadbfb5ca","observation_id":"d4d86ce4-71c2-4fc2-9461-af681ef6d2de","resolution":{"observed_at":"2026-08-15T19:13:38.722682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.951302Z","title":"CATs: Cost aggregation transformers for visual correspondence.NeurIPS, 34:9011–9023, 2021","venue":null,"work_id":"05ae9249-eb97-42b7-8428-b4a936f346be","year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.802609Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:8fa7473e15eb7c6b8e671ab3e38d987679a9cdca650c58bd71185af790d649dc","observation_id":"bcdcf13c-4af2-49d1-94e9-10333f1a0245","resolution":{"observed_at":"2026-08-15T19:13:43.959581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.932165Z","title":"CATs++: Boosting cost aggregation with convolutions and transformers.IEEE TPAMI, 45(6):7174–7194, 2022","venue":null,"work_id":"2c4f9b93-c85f-47ad-9e38-d83ad3cba8fb","year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.848794Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:b84e6bc5248794f057eede1b6c4181b9ac9fdd305ae88ab07106bc7694645e40","observation_id":"fe13b774-46d7-4f59-bffd-1e143e5c33d8","resolution":{"observed_at":"2026-08-15T19:13:43.939150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14687","last_updated":"2025-04-20T17:37:02Z","snapshot_observed_at":"2026-08-18T10:45:54.870763Z","submitted_at":"2025-04-20T17:37:02Z","title":"Seurat: From Moving Points to Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14687","snapshot_observed_at":"2026-08-15T19:13:38.852878Z","title":"Seurat: From moving points to depth","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.852878Z"},"links":{"cited_paper":"/paper/2504.14687","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:6ff4090c01374874129f9fbeba8cad0830d05b4554ecc945b62a4d4bfc70b287","observation_id":"f68ddba8-690b-4958-9c7b-a8d7b7341831","resolution":{"observed_at":"2026-08-15T19:13:38.852878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.722411Z","title":"Local all-pair correspondence for point tracking","venue":null,"work_id":"f3e0e044-b187-4d3c-8cc9-2b5802b0defa","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.858121Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:3b031fa34570d420492bb1ab8d84afbcb294b0c0caa78f9eaf0aa9614a6e871f","observation_id":"7a7c5bfc-ea72-47f3-a3b7-ad22484a8d66","resolution":{"observed_at":"2026-08-15T19:13:43.822039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-15T19:13:38.862232Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.862232Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:2d6359d4bb674fa322141ab33152b3079b697863e2682f38acbde67df5073054","observation_id":"f3395634-0928-47da-80e6-ccc2e5a1dfaa","resolution":{"observed_at":"2026-08-15T19:13:38.862232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.657519Z","title":"TAP-Vid: A benchmark for tracking any point in a video.NeurIPS, 35:13610–13626, 2022","venue":null,"work_id":"de3dfd47-0c6e-4572-9baf-5537d8470f99","year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.867585Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:0a116eb8fb50f26c68e95e2f0b55a71c978759b40659f6a8cea7908d8e3f1347","observation_id":"3c986a74-a6b8-4b9a-9803-2689d37ccb7a","resolution":{"observed_at":"2026-08-15T19:13:43.695873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.577974Z","title":"TAPIR: Tracking any point with per-frame initialization and temporal refinement","venue":null,"work_id":"68ceccaf-d1cf-4935-b433-e040e90b85b1","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.934649Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:919e7df25aebb2b8af51356a2ffdb8a2362ee5fe8cdd058455bb31806c1d68ad","observation_id":"a82932e7-36cb-41f1-8319-32a377a32d9a","resolution":{"observed_at":"2026-08-15T19:13:43.611186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:38.961511Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.961511Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:bf7c3adb751be3128f3a2537eb0edbb46b4a6344a4bca990d2e72f0971db7134","observation_id":"3b2003ff-6fbb-4af5-abe0-8df9aa9156a3","resolution":{"observed_at":"2026-08-15T19:13:38.961511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.400593Z","title":"Perceptual quality assessment of smartphone photography","venue":null,"work_id":"35790db5-8d77-4746-b5e4-d5c2c31a654a","year":2020},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.967025Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:bc8e7dc95a6246e268aaacb964e9dccf9d356b70783325fcf7062c1e88f8e3ee","observation_id":"33f5eb86-6c04-40e5-8b71-137af0883265","resolution":{"observed_at":"2026-08-15T19:13:43.452787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10314","last_updated":"2024-05-16T17:59:05Z","snapshot_observed_at":"2026-08-15T07:34:03.035482Z","submitted_at":"2024-05-16T17:59:05Z","title":"CAT3D: Create Anything in 3D with Multi-View Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10314","snapshot_observed_at":"2026-08-15T19:13:38.971715Z","title":"Barron, and Ben Poole","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.971715Z"},"links":{"cited_paper":"/paper/2405.10314","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:29523162fa409461b5cfda88d0dfb6b6e631155f20cb26a645e30f6622aaa41e","observation_id":"3e921545-138c-4ded-b054-d57a6a7305d5","resolution":{"observed_at":"2026-08-15T19:13:38.971715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02700","last_updated":"2025-03-27T21:38:09Z","snapshot_observed_at":"2026-08-17T17:55:41.151533Z","submitted_at":"2024-12-03T18:59:56Z","title":"Motion Prompting: Controlling Video Generation with Motion Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02700","snapshot_observed_at":"2026-08-15T19:13:38.975658Z","title":"Motion prompting: Controlling video generation with motion trajectories.arXiv preprint arXiv:2412.02700, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.975658Z"},"links":{"cited_paper":"/paper/2412.02700","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:7407cd9475f40e679a8313233aafdcf79350e36402380a726c72d85136b7ce49","observation_id":"6066171c-b810-4915-9367-280e54f8c5e5","resolution":{"observed_at":"2026-08-15T19:13:38.975658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.385015Z","title":"Mochi 1: A new SOTA in open-source video generation models, 2023","venue":null,"work_id":"e2e2e441-23ac-428e-b5e3-2186afc95574","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.980746Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:c4addd03c8a1d4ee7223e8855adef6cbab8db37be31ba83abcb7115fbb32c790","observation_id":"8eb2c98d-a25a-4595-8494-b293fdb143bf","resolution":{"observed_at":"2026-08-15T19:13:43.390377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.299472Z","title":"SparseCtrl: Adding sparse controls to text-to-video diffusion models","venue":null,"work_id":"94b72695-d080-488a-9459-592512749354","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.985936Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:90b738212565c2d48a95564d877658d6cfca591725075db6a1998b33c1527932","observation_id":"66fcffc3-04b9-4896-a1ae-75e4fe170bab","resolution":{"observed_at":"2026-08-15T19:13:43.328877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-15T19:13:38.990688Z","title":"AnimateDiff: Animate your personalized text-to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.990688Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:7cebf3b3801a03c59f70ee02fbc809dc84d6c3b0e8908e2e72ae44a9c2f65080","observation_id":"f442abc9-75f3-4fd7-aab7-3498a74b3651","resolution":{"observed_at":"2026-08-15T19:13:38.990688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-15T19:13:39.011253Z","title":"LTX-Video: Realtime video latent diffusion.arXiv preprint arXiv:2501.00103, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.011253Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:e7b6b8a5a3b31580e4c5ae69d21ae152b40122f244b857bf76065a888745201c","observation_id":"2e4c1763-768f-4813-940e-81297155648d","resolution":{"observed_at":"2026-08-15T19:13:39.011253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.284323Z","title":"Harley, Zhaoyuan Fang, and Katerina Fragkiadaki","venue":null,"work_id":"cd542e72-4988-44d2-a426-1babb4f7dba4","year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.083506Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:ad18ca782043490f78a781a8334c9344454bb8c5abd5a65fba723d74ab7b8b88","observation_id":"5a0beaf0-fc71-4364-83ec-60bcfb33eb53","resolution":{"observed_at":"2026-08-15T19:13:43.289520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-17T16:16:01.560363Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-15T19:13:39.114343Z","title":"Latent video diffusion models for high-fidelity long video generation.arXiv preprint arXiv:2211.13221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.114343Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:8a4825c19e46db9b16830cf9ff11b76f8376518684fd5e7ed800033e292712b0","observation_id":"39821cab-3ba0-4fd2-bd7a-cb7c7ce76a6e","resolution":{"observed_at":"2026-08-15T19:13:39.114343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.183304Z","title":"Unsupervised semantic correspondence using stable diffusion.NeurIPS, 36:8266–8279, 2023","venue":null,"work_id":"8fe51a70-c232-4673-a580-e41a3f83ca55","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.119451Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:60b78b2ae119033db2b2d2d2dca7f44d47fc918c1346c0ae8bc4e4adda080207","observation_id":"fa35a892-0df5-42c6-a7dc-19ae6d5ac23a","resolution":{"observed_at":"2026-08-15T19:13:43.273165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.169126Z","title":"Denoising diffusion probabilistic models.NeurIPS, 33:6840– 6851, 2020","venue":null,"work_id":"d679d987-f989-45b7-b019-fe3126aa921e","year":2020},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.124777Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:693e2196afd240a89660afb8c809c88244fca4c7071cdcfdaafdd29c50883743","observation_id":"f6413a89-f3da-4fe7-9c0a-af2769bdb820","resolution":{"observed_at":"2026-08-15T19:13:43.173878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08742","last_updated":"2022-09-20T04:51:13Z","snapshot_observed_at":"2026-08-18T14:42:55.595149Z","submitted_at":"2022-09-19T03:33:35Z","title":"Integrative Feature and Cost Aggregation with Transformers for Dense Correspondence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.08742","snapshot_observed_at":"2026-08-15T19:13:39.128864Z","title":"Integrative feature and cost aggregation with transformers for dense correspondence.arXiv preprint arXiv:2209.08742, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.128864Z"},"links":{"cited_paper":"/paper/2209.08742","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:86474e0dc456c9b6e8a2ccf2cc75fdf7d59ad611db4605cbc15777bf6dc790b3","observation_id":"a2b514bb-3489-4d12-aec4-a5e0e0e5c9c6","resolution":{"observed_at":"2026-08-15T19:13:39.128864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.036821Z","title":"Cost aggregation with 4D convolutional swin transformer for few-shot segmentation","venue":null,"work_id":"b3967084-93ab-4564-81ad-5e35726b032d","year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.133584Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:3f7cc10a8e08a935d7240e69931a83ec435d1b515d5d9854f4d938eb618ef910","observation_id":"bc77ebad-7518-4716-baae-0ec19155cd71","resolution":{"observed_at":"2026-08-15T19:13:43.119740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:43.020220Z","title":"Unifying correspondence pose and nerf for generalized pose-free novel view synthesis","venue":null,"work_id":"1d33c276-cbf2-4bb3-8800-8b1c86500a6b","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.138210Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:e4aee26b80dce9a7f7c374ec163fd02db3d7726fc7056e4a8b40c9fd531d96df","observation_id":"2ac08c4b-4c11-499f-b871-f4435aab7cf2","resolution":{"observed_at":"2026-08-15T19:13:43.025900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.923505Z","title":"Deep matching prior: Test-time optimization for dense correspon- dence","venue":null,"work_id":"722391d1-ef3e-4c82-80eb-51cc2b204e11","year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.142769Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:eb65099beeef7bf45d3d70fbd53baf82700202f102e49cef50f37e6ee42a2f22","observation_id":"cc1d3be2-47d3-45a3-9939-c21ebe4ca8cf","resolution":{"observed_at":"2026-08-15T19:13:43.008580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.819732Z","title":"Neural matching fields: Implicit representation of matching fields for visual correspondence.NeurIPS, 35:13512–13526, 2022","venue":null,"work_id":"7044e24a-711f-4717-89fd-f2a64e6c31e3","year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.147536Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:8c419e3a2bf61efdd355a7641e8a50202b2c1ac24a4e405a35c61737bd1f7a7a","observation_id":"811b445e-ace6-4c39-b735-28bb56fe30a3","resolution":{"observed_at":"2026-08-15T19:13:42.825966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.803175Z","title":"VBench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"a74caef0-97af-43a5-9587-1f18d4bc0a31","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.197835Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:2a6df77f46855606578a40d8bb1b4bc167b8881586e7f53760a39e43fb270615","observation_id":"e6b06d83-a966-4503-8475-c1bdbed5c6da","resolution":{"observed_at":"2026-08-15T19:13:42.808548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.777336Z","title":"Space-time correspondence as a contrastive random walk","venue":null,"work_id":"3dfd4bc1-e0b8-4637-9e2e-ffd7d8405b5f","year":2020},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.235267Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:43b5e2d550ad79b6a36a4fb3d40adddbf973b7dbc5491fec2d13d254f2d9fc65","observation_id":"e511ab6b-bbc3-4577-9c92-8c89d679f741","resolution":{"observed_at":"2026-08-15T19:13:42.789974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06016","last_updated":"2025-04-07T11:16:47Z","snapshot_observed_at":"2026-08-11T20:03:50.332267Z","submitted_at":"2024-12-08T18:21:00Z","title":"Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06016","snapshot_observed_at":"2026-08-15T19:13:39.257714Z","title":"Track4Gen: Teach- ing video diffusion models to track points improves video generation.arXiv preprint arXiv:2412.06016, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.257714Z"},"links":{"cited_paper":"/paper/2412.06016","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:29a5d9471bfb500c1de3eae14d8d2a3b59296267796f4cf4f223e47ae559306e","observation_id":"f1b61264-22c8-40db-9f42-360642c5195a","resolution":{"observed_at":"2026-08-15T19:13:39.257714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03150","last_updated":"2025-03-18T07:31:49Z","snapshot_observed_at":"2026-08-16T04:35:28.437141Z","submitted_at":"2024-12-04T09:17:47Z","title":"Appearance Matching Adapter for Exemplar-based Semantic Image Synthesis in-the-Wild","version":2},"cited_work":{"arxiv_id":"2412.03150","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03150","snapshot_observed_at":"2026-08-15T19:13:40.710529Z","title":"Appearance Matching Adapter for Exemplar-based Semantic Image Synthesis in-the-Wild","venue":"cs.CV","work_id":"1a1ea09e-4b53-4a1e-9ffa-d9c2ee1875e1","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.262818Z"},"links":{"cited_paper":"/paper/2412.03150","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:98ed8f46260b437faafa89445eb31eb84566ee23577dc5d31fa540fe79b3a859","observation_id":"97805d44-ad69-4e2d-9d20-55c463834da5","resolution":{"observed_at":"2026-08-15T19:13:40.767937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11831","last_updated":"2024-10-15T17:56:32Z","snapshot_observed_at":"2026-08-18T10:54:06.071321Z","submitted_at":"2024-10-15T17:56:32Z","title":"CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11831","snapshot_observed_at":"2026-08-15T19:13:39.267934Z","title":"CoTracker3: Simpler and better point tracking by pseudo-labelling real videos.arXiv preprint arXiv:2410.11831, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.267934Z"},"links":{"cited_paper":"/paper/2410.11831","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:f844b3873631878a6d5ec261222aca3162e9e2cd7e8138ed1dbd3f33b582add2","observation_id":"ba5f69c1-c466-4e7d-b68a-8fe2c5615902","resolution":{"observed_at":"2026-08-15T19:13:39.267934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.762009Z","title":"CoTracker: It is better to track together","venue":null,"work_id":"3406a079-357c-4ae1-afef-85420721b463","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.274246Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:31cc36fe4391c04c762b159c65a26482cd91dc9887f02bee7c255eb9d8e4e2f6","observation_id":"143386ba-99a7-4f30-8a62-e8a69ddb0e33","resolution":{"observed_at":"2026-08-15T19:13:42.766778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.718940Z","title":"MUSIQ: Multi-scale image quality transformer","venue":null,"work_id":"c1066890-c5fa-4cec-95ef-35017142356b","year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.278977Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:b851316b9836bdb2b2e8615564f2049e274e5595f9073a33ffff71dd9da0a7f9","observation_id":"26c5ddf7-c618-4537-88d2-59aec05fd1b8","resolution":{"observed_at":"2026-08-15T19:13:42.750973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12218","last_updated":"2025-04-20T14:33:55Z","snapshot_observed_at":"2026-08-14T13:31:51.787116Z","submitted_at":"2025-01-21T15:39:40Z","title":"Exploring Temporally-Aware Features for Point Tracking","version":2},"cited_work":{"arxiv_id":"2501.12218","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12218","snapshot_observed_at":"2026-08-15T19:13:40.636377Z","title":"Exploring Temporally-Aware Features for Point Tracking","venue":"cs.CV","work_id":"2d69a497-0529-4a73-abe7-6f45eea64de1","year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.283076Z"},"links":{"cited_paper":"/paper/2501.12218","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:2f60f639d1fb3e0fc4e56cdad4ab010f75fd9f9b405e2a9a8bf85fd2e7cda94c","observation_id":"81b736a7-1451-4379-9744-d565a8ab7b78","resolution":{"observed_at":"2026-08-15T19:13:40.678647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.658535Z","title":"MoDiTalker: Motion-disentangled diffusion model for high-fidelity talking head generation","venue":null,"work_id":"15825499-142a-4d0d-a519-2b428b667914","year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.288344Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:011c7f1684989bdf4bd9ec5e170228d387e9d6eb879340d4b6f5c4e1629bd9d5","observation_id":"4058f211-7f87-4e58-bc0b-f97b9417d45a","resolution":{"observed_at":"2026-08-15T19:13:42.663115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.642025Z","title":"Berg, Wan-Yen Lo, et al","venue":null,"work_id":"fc50078b-da23-4748-b57c-be9751fe29cd","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.330619Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:25a243f88aaa91f04adcd3bb6c35b8d1672bfa3305fcdc24ddaa6b9b20e380ba","observation_id":"4d731154-c6f7-4fd7-a74d-711eefd5279b","resolution":{"observed_at":"2026-08-15T19:13:42.648010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-15T19:13:39.411683Z","title":"HunyuanVideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.411683Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:bf2612df5ca5a9a947590e8da421fcf10bd65290925a64df70982c3dacdcc043","observation_id":"6a6e781b-c4ef-4a0f-81ae-4189cd7c8c4c","resolution":{"observed_at":"2026-08-15T19:13:39.411683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.510124Z","title":"Kling: Video generation by kuaishou, 2024","venue":null,"work_id":"748ac689-cb4c-4ea2-99db-aa2027ff75dd","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.487395Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:c5b9b445c22676d86fd956a759e0ecf7b9310dc557533caa7a988de659753df6","observation_id":"596a9e4f-4bc8-49c1-bb5d-4b7a3741329a","resolution":{"observed_at":"2026-08-15T19:13:42.573897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.494121Z","title":"Efficient spatially sparse inference for conditional gans and diffusion models.NeurIPS, 35:28858–28873, 2022","venue":null,"work_id":"c64791a3-db02-4718-b384-83fcbf45af67","year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.491851Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:424c625dbcd7f7ca9933c1944c6692dbd16015b949d2bb1e13b063d7ff444ca3","observation_id":"0fbe97fc-80df-44af-ac1b-57d4c8b2c169","resolution":{"observed_at":"2026-08-15T19:13:42.499942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.332818Z","title":"Spatial-then-temporal self-supervised learning for video correspondence","venue":null,"work_id":"a52eefc8-9049-4ca5-b225-199ac2cf2d9f","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.500695Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:cf4fb1e1eede2ac9c016d8aaa895615dc18094c341309cee2318140539287c1a","observation_id":"ccd121ab-a919-48be-b891-2ad6528f30c2","resolution":{"observed_at":"2026-08-15T19:13:42.443079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16767","last_updated":"2025-06-25T07:19:44Z","snapshot_observed_at":"2026-08-18T09:25:14.498467Z","submitted_at":"2024-08-29T17:59:40Z","title":"ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16767","snapshot_observed_at":"2026-08-15T19:13:39.506088Z","title":"ReconX: Reconstruct any scene from sparse views with video diffusion model.arXiv preprint arXiv:2408.16767, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.506088Z"},"links":{"cited_paper":"/paper/2408.16767","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:94ed4bab9816ad49bb9355a706b417e2f7ff4fbb544ba1bef06a36dd3fb160bc","observation_id":"90a6b606-ee26-4627-a0b7-53dd9999f42f","resolution":{"observed_at":"2026-08-15T19:13:39.506088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-15T19:13:39.510944Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models.arXiv preprint arXiv:2402.17177, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.510944Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:ff9953b9b4ed3fa11de7c8fce1e091ab0cfdf29977036798210c986c5ec8207d","observation_id":"7d77039e-0df3-4b17-ab88-82f11ccd6125","resolution":{"observed_at":"2026-08-15T19:13:39.510944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.316599Z","title":"Not all diffusion model activations have been evaluated as discriminative features.NeurIPS, 37:55141–55177, 2025","venue":null,"work_id":"fedc4354-4c9b-4ae2-a942-e2713c1bc3d3","year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.515483Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:f5ded6b18aca9b704a2337a6095d5a4b4fd07b20b137bff79511d3b27c59f160","observation_id":"9990f26c-fd8a-4df9-9c8f-f7930005e5c7","resolution":{"observed_at":"2026-08-15T19:13:42.322221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.233755Z","title":"DreamMatcher: appearance matching self-attention for semantically-consistent text-to-image personalization","venue":null,"work_id":"20afa1a5-53ba-4ad0-bb3f-3dfe69800775","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.583898Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:a994abf144b2747fb10c5095c5f622a5b8fd1a631658b912b5e2c0cef6416ab3","observation_id":"bdfb7234-6734-47f1-a680-c4c1a4c41309","resolution":{"observed_at":"2026-08-15T19:13:42.305310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19094","last_updated":"2024-01-25T07:10:41Z","snapshot_observed_at":"2026-08-18T12:23:12.257407Z","submitted_at":"2023-05-30T14:58:24Z","title":"Diffusion Model for Dense Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19094","snapshot_observed_at":"2026-08-15T19:13:39.669281Z","title":"Diffusion model for dense matching.arXiv preprint arXiv:2305.19094, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.669281Z"},"links":{"cited_paper":"/paper/2305.19094","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:cb046257dddc5ed6372738483aca0bf9fae907e15f92b5168e4ca30f966e3c64","observation_id":"e796b727-caed-4871-bbb2-6f58a84a91ed","resolution":{"observed_at":"2026-08-15T19:13:39.669281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15406","last_updated":"2025-03-24T07:28:09Z","snapshot_observed_at":"2026-08-16T12:48:32.519117Z","submitted_at":"2025-03-19T16:45:47Z","title":"Visual Persona: Foundation Model for Full-Body Human Customization","version":2},"cited_work":{"arxiv_id":"2503.15406","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.15406","snapshot_observed_at":"2026-08-15T19:13:40.406708Z","title":"Visual Persona: Foundation Model for Full-Body Human Customization","venue":"cs.CV","work_id":"b20365a3-acaf-4bdd-9f8e-2a57c40b331e","year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.674774Z"},"links":{"cited_paper":"/paper/2503.15406","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:29cf702a1fda0c9c93065992d90bc6a491a283380aea5f8af41984d7cf3fec3b","observation_id":"191a8596-d505-4d96-8833-0028ceff3908","resolution":{"observed_at":"2026-08-15T19:13:40.557927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T19:13:39.679605Z","title":"DINOv2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.679605Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:b5cced9d0aa8adfdb331a991330d6c96f250dc9b38e9ee563a471f9df93d6337","observation_id":"03198abf-ae6d-4fdc-92e2-e155a9838b2c","resolution":{"observed_at":"2026-08-15T19:13:39.679605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:39.685451Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.685451Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:91bf84fd84808ec964a017ee18ba3b4806dbc65a05bb824289e15d0b9b0a8497","observation_id":"8a8467e4-cf6f-4b84-ad33-ef018b3f5a5e","resolution":{"observed_at":"2026-08-15T19:13:39.685451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-15T19:13:39.691810Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.691810Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:01395d5237dfa121b1d4062b928d8ebc8c570e8b117be0a1919a6260eda19878","observation_id":"84d46051-60bd-412a-8cee-78d597477bd1","resolution":{"observed_at":"2026-08-15T19:13:39.691810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.206628Z","title":"Movie Gen: A cast of media foundation models, 2025","venue":null,"work_id":"8b228333-f117-4a4b-abf6-044102aa9644","year":2025},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.699881Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:c0c6a7dc542de1e2d83951631bdb4c7e2108eaffbb7b39e6d758e2b3402f82df","observation_id":"750dd959-4eea-4cbf-9a44-9decd7879ccf","resolution":{"observed_at":"2026-08-15T19:13:42.212793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-15T19:13:39.788381Z","title":"The 2017 DA VIS challenge on video object segmentation.arXiv preprint arXiv:1704.00675, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.788381Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:ab5788e50e130c7723164d70437e59bd4934f93d042c00fb43fc747a1c96f650","observation_id":"4397c251-e36b-43cf-bd37-2209c9cc56f1","resolution":{"observed_at":"2026-08-15T19:13:39.788381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.175345Z","title":"Semantics meets temporal correspondence: Self- supervised object-centric learning in videos","venue":null,"work_id":"b9e77a85-6b35-4ba2-95c3-6713c5b8324b","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.817315Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:95f9223cead32d391d7299d76a416d4ecd023cde6fb0f7c68b5ee67cdeba95e8","observation_id":"b6960061-cde2-4743-af19-2e8370c0d9b4","resolution":{"observed_at":"2026-08-15T19:13:42.195229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:39.823600Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.823600Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:09421361e0347ff6d09cfdada2b5e027ae45f944bffba2473366faac5ccd969c","observation_id":"594e3340-0fdb-4d73-b40a-217b69f0ee06","resolution":{"observed_at":"2026-08-15T19:13:39.823600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.133716Z","title":null,"venue":null,"work_id":"9b906fe0-f533-4d9b-a98f-3f409a40e6ef","year":2020},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.828902Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:4776648fda7e577b87883e83629dec830c8784d84064c642c7e267a945146cf3","observation_id":"72d7111e-42c4-46b6-98cf-274ae5656bbe","resolution":{"observed_at":"2026-08-15T19:13:42.139594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:39.833861Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.833861Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:7e3b269e6666ecb663ce10ee76a184897ec0924da5b41a9e93807a1573c0eb4b","observation_id":"efd69bfd-d978-403d-83cb-c3d94b1630e5","resolution":{"observed_at":"2026-08-15T19:13:39.833861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.108795Z","title":"Introducing Gen-3 Alpha, 2024","venue":null,"work_id":"a348dd52-9a87-4ada-9fbd-fd6ec462fe00","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.839671Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:b9f8e9c8f10b90bf0cafe5fc380820385a2282ae7c0437022832ed30220279bb","observation_id":"8780f1eb-469a-457e-a5f2-f2445ab3bb97","resolution":{"observed_at":"2026-08-15T19:13:42.114305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-15T19:13:39.844362Z","title":"Make-A-Video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.844362Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:66e555b1eee8e2d1f3759c2b2db6bb0a3adfe8357694d2c4100cf9cca105ac32","observation_id":"e6912f63-954a-4a6f-a455-71737afcc15e","resolution":{"observed_at":"2026-08-15T19:13:39.844362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-15T19:13:39.881217Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.881217Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:d45e42c9583be3160c2cfadea9e770dbf786a4e18ae5b3970c90381b8a65a3a2","observation_id":"80d30d88-9235-4a58-9c54-838715681181","resolution":{"observed_at":"2026-08-15T19:13:39.881217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:39.933730Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.933730Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:597216dee632639e32f9a4ba68c2bac3116fd2219d0898c949cbe49b978c20df","observation_id":"0633a4b2-2e23-4b0e-b10c-82f32bd4e20d","resolution":{"observed_at":"2026-08-15T19:13:39.933730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04928","last_updated":"2024-11-07T18:07:31Z","snapshot_observed_at":"2026-08-16T13:02:01.454341Z","submitted_at":"2024-11-07T18:07:31Z","title":"DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04928","snapshot_observed_at":"2026-08-15T19:13:39.939649Z","title":"Dimen- sionX: Create any 3D and 4D scenes from a single image with controllable video diffusion.arXiv preprint arXiv:2411.04928, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.939649Z"},"links":{"cited_paper":"/paper/2411.04928","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:e29a3546ceacf5067809ab28dd1be74d890a71fc32e84a35d138ab827ac89926","observation_id":"aa8f1fe9-27d9-4348-a6a6-401f47abb153","resolution":{"observed_at":"2026-08-15T19:13:39.939649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:42.050283Z","title":"Emergent correspondence from image diffusion.NeurIPS, 36:1363–1389, 2023","venue":null,"work_id":"866f2841-a638-4b16-bd7b-d60bfeaf9231","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.945033Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:075499eb0597184b64e14052b13ee46f68d46d0253c046ee99f1cdbec7a783be","observation_id":"92a5006e-b65d-4fbd-b4c1-dc643758d51d","resolution":{"observed_at":"2026-08-15T19:13:42.089298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.900620Z","title":"RAFT: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"592923a0-6b59-40cc-8b0b-b5b2685bd523","year":2020},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.949243Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:6f76836ee0d801b335a9c4a1bcbdbe8b47a9b5fb3dacfeef65529e7b92162251","observation_id":"35976cb2-6e83-47ba-831d-4df7642ab946","resolution":{"observed_at":"2026-08-15T19:13:41.950837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.884752Z","title":"GLU-Net: Global-local universal network for dense flow and correspondences","venue":null,"work_id":"8a82c74f-fb84-47e1-ba61-d845f8c8a5fc","year":2020},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:39.953490Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:385fd33611b27076724467b095b84d9ad39534623b3a05c5f2bfb1a8f3b7c83c","observation_id":"7f3bdeda-b99e-4963-974e-65f05a75398c","resolution":{"observed_at":"2026-08-15T19:13:41.890337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.631946Z","title":"Learning accurate dense correspon- dences and when to trust them","venue":null,"work_id":"2a85ab4c-b777-4f2d-bd27-92273ec5af96","year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.018213Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:5ad8add3ff36c1b39811724ad9806e22729bc909d6649aea2c1e872c6333211f","observation_id":"f088dc25-a18d-4988-b2cc-7efb65d16c2f","resolution":{"observed_at":"2026-08-15T19:13:41.770708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.583381Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"2cfdb962-1dd0-4ae3-a395-57d58731e7f1","year":2017},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.045840Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:2706bbfd1a79d547fae9442775385eafd4bcc5fc967d6f9eacfda36276306ec2","observation_id":"16e739dc-0e71-4631-a8ad-9e3b5aad1253","resolution":{"observed_at":"2026-08-15T19:13:41.621054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18613","last_updated":"2024-12-18T21:21:07Z","snapshot_observed_at":"2026-08-20T08:18:02.465597Z","submitted_at":"2024-11-27T18:57:16Z","title":"CAT4D: Create Anything in 4D with Multi-View Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18613","snapshot_observed_at":"2026-08-15T19:13:40.050744Z","title":"Barron, and Aleksander Holynski","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.050744Z"},"links":{"cited_paper":"/paper/2411.18613","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:7de56ac654818b8f827aafe8b98e76e60bb7cb87413ed94ecbf4c77094a0e0b4","observation_id":"56f38322-c7d3-47af-ba9d-df34764ed62e","resolution":{"observed_at":"2026-08-15T19:13:40.050744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14864","last_updated":"2024-11-12T01:31:41Z","snapshot_observed_at":"2026-08-16T13:50:03.452370Z","submitted_at":"2024-05-23T17:59:40Z","title":"Video Diffusion Models are Training-free Motion Interpreter and Controller","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14864","snapshot_observed_at":"2026-08-15T19:13:40.056138Z","title":"Video diffusion models are training-free motion interpreter and controller.arXiv preprint arXiv:2405.14864, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.056138Z"},"links":{"cited_paper":"/paper/2405.14864","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:611241a9430720e76e99b3bb7b0fa71b4b252468feed61f018dcb5410830ff18","observation_id":"71215075-cecb-4c25-8509-20f0bfe36853","resolution":{"observed_at":"2026-08-15T19:13:40.056138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.491037Z","title":"DynamiCrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"8e42c522-fa26-4cbe-88bd-2f5cf1e1c309","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.061077Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:eecd4ecb60a7d7589ef83b44cda0d5fa7beaba416d3c0d79c6fa5c75740f47b4","observation_id":"434068e2-d2e7-4a0e-966c-968658c06bd0","resolution":{"observed_at":"2026-08-15T19:13:41.496368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.259261Z","title":"Rethinking self-supervised correspondence learning: A video frame-level similarity perspective","venue":null,"work_id":"01771541-605a-4bf0-a1de-42be17be50e5","year":2021},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.065360Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:d82cd6ad3bad7ffacdd66110ababc32f9ecfcbf14ef644d9678e6b0870f63665","observation_id":"5f0bf968-ae86-41b8-81db-55c7770c86f0","resolution":{"observed_at":"2026-08-15T19:13:41.342982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-15T19:13:40.190379Z","title":"CogVideoX: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.190379Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:f195cbc36b3ba120f58b8f57d634f9a6c4c6fc4b7bd11676ce2c805e0250e110","observation_id":"326fb110-3160-487c-9171-65cf122024e0","resolution":{"observed_at":"2026-08-15T19:13:40.190379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:13:41.234578Z","title":"A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence.NeurIPS, 36:45533–45547, 2023","venue":null,"work_id":"d7ee23e6-fd2f-4e8f-8d70-85cbf80f2c5c","year":2023},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.196336Z"},"links":{"citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:8c6720f852efb4f2d3dd9840cf191b22c34951c8630aa6ef815af59db7cb8428","observation_id":"5616778c-5335-475e-84ff-dc368a19dc30","resolution":{"observed_at":"2026-08-15T19:13:41.248103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01821","last_updated":"2024-12-02T18:58:23Z","snapshot_observed_at":"2026-08-19T20:02:45.164059Z","submitted_at":"2024-12-02T18:58:23Z","title":"World-consistent Video Diffusion with Explicit 3D Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01821","snapshot_observed_at":"2026-08-15T19:13:40.201882Z","title":"World-consistent video diffusion with explicit 3D modeling.arXiv preprint arXiv:2412.01821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.201882Z"},"links":{"cited_paper":"/paper/2412.01821","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:81b67fd39625e7456bd06e8fd526c9b569a86333e02fb5ad619f08758ec7bdd5","observation_id":"bab06ec1-95da-4441-aae9-cdc3817c1259","resolution":{"observed_at":"2026-08-15T19:13:40.201882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-08-20T23:16:18.586164Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-15T19:13:40.206348Z","title":"Open-Sora: Democratizing efficient video production for all.arXiv preprint arXiv:2412.20404, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:40.206348Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:f33075928cf1a0c05daba7eea062de3acb208efe891fa876befd52295aa76018","observation_id":"2a288842-bd80-40f9-ab84-029626272ace","resolution":{"observed_at":"2026-08-15T19:13:40.206348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":42,"verified_exact":3,"verified_fuzzy":37},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 5 inbound Pith citation observations for arXiv:2506.17220."}