{"as_of":"2026-08-18T23:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d7a83cd19372f6cc1e84f3799bbce2f0dca0624138038cc1164470a69c116fe","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:24:50.041031Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:58:40.497878Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T21:29:28.947667Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"cited_work":{"arxiv_id":"2512.20606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.20606","snapshot_observed_at":"2026-06-30T03:17:26.209732Z","title":"Repurposing video diffusion transformers for robust point tracking","venue":null,"work_id":"fb5b6fe6-7a25-4ff2-84d4-c34db24e1f4e","year":2025},"citing_paper":{"arxiv_id":"2605.12587","last_updated":"2026-05-12T17:59:27Z","snapshot_observed_at":"2026-08-13T07:47:23.900604Z","submitted_at":"2026-05-12T17:59:27Z","title":"TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:12.151547Z"},"links":{"cited_paper":"/paper/2512.20606","citing_paper":"/paper/2605.12587"},"observation_digest":"sha256:f7c4a1dde8298bec0dee17171a127564bd9530c710c09fcefea8f9d72c9b4803","observation_id":"1ad67764-8a1e-415c-9f5f-4fa44f865a6f","resolution":{"observed_at":"2026-06-30T03:17:26.209732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.20606","snapshot_observed_at":"2026-07-12T05:46:45.293902Z","title":"Repurposing video diffusion transformers for robust point tracking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02968","last_updated":"2026-07-03T05:21:46Z","snapshot_observed_at":"2026-08-16T15:16:10.440947Z","submitted_at":"2026-07-03T05:21:46Z","title":"Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T05:46:45.293902Z"},"links":{"cited_paper":"/paper/2512.20606","citing_paper":"/paper/2607.02968"},"observation_digest":"sha256:db9114714bef6ce0c1d3150e87a5bec8571d13f963a325a204dc2776b6d6ca93","observation_id":"b16e9fe9-2d55-4840-bab2-3a2aed90ce51","resolution":{"observed_at":"2026-07-12T05:46:45.293902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.20606","snapshot_observed_at":"2026-08-05T00:58:40.497878Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00486","last_updated":"2026-08-01T07:24:41Z","snapshot_observed_at":"2026-08-16T10:36:48.308333Z","submitted_at":"2026-08-01T07:24:41Z","title":"DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T00:58:40.497878Z"},"links":{"cited_paper":"/paper/2512.20606","citing_paper":"/paper/2608.00486"},"observation_digest":"sha256:aeb6fa23a00d492684df9ff8b1aefa9b6724ec37691e6ff28aa794da72b594dd","observation_id":"78783360-127a-4b11-aeff-7ca67c429118","resolution":{"observed_at":"2026-08-05T00:58:40.497878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.20606/citation-record","integrity":"/paper/2512.20606/integrity","json":"/paper/2512.20606/citation-record.json","paper":"/paper/2512.20606"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-08-15T13:40:01.739055Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-03T14:24:49.389952Z","title":"V-JEPA 2: Self-supervised video models enable understanding, predic- tion and planning.arXiv preprint arXiv:2506.09985, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.389952Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:1f4aba5306a2ffd0bf292dfad117c4159f398496bc3b33614cfb20568dda7590","observation_id":"ae34eebe-d67b-4c98-ad3d-87c153291f73","resolution":{"observed_at":"2026-08-03T14:24:49.389952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.525136Z","title":"Can visual foundation models achieve long-term point tracking? InEC- CVW, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.525136Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:2c531ce2f787efd36514fb74af920d02468182709365bd21dbd00840b29c669f","observation_id":"5a97110c-e6a4-493b-882a-64bd428aa7c7","resolution":{"observed_at":"2026-08-03T14:24:49.525136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.642120Z","title":"Track-On: Transformer-based online point tracking with memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.642120Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:98d822ec081d7032e4d651a6c2b0e33e5a93ceee80417bd21e4c13414bf34aa0","observation_id":"8a299e67-8c2c-4b0c-9b93-20dbc9923c2a","resolution":{"observed_at":"2026-08-03T14:24:49.642120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.738532Z","title":"DriveTrack: A benchmark for long-range point tracking in real-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.738532Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:cb3d7e89eebcb1f69d91f77a42d2507a2c64ce877695c3331f0dc22db76300f3","observation_id":"9c79274d-f32a-4bc0-bd03-77bc63b63698","resolution":{"observed_at":"2026-08-03T14:24:49.738532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.866652Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.866652Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:497220dee90b332c40b7e832be0408b2ca4398627a07ecc398bb339aa0b50c4e","observation_id":"31f8982a-0d7d-462d-abd0-193aedbec7ab","resolution":{"observed_at":"2026-08-03T14:24:49.866652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.869836Z","title":"FlowTrack: Revisiting optical flow for long- range dense tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.869836Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:4816106741a7e66b12c9ba6d359eaa4478c00a45a20ed3e87d240cf68e7ca8f2","observation_id":"41c076c1-3f1e-49bd-b4cc-40e0f057c8aa","resolution":{"observed_at":"2026-08-03T14:24:49.869836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.873130Z","title":"Local all-pair correspon- dence for point tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.873130Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:703394062c5c1748d556d3ae2b238b7fccefda65dbaa01137082b2cb9b019c65","observation_id":"92d69132-925b-4290-9660-dba18299845a","resolution":{"observed_at":"2026-08-03T14:24:49.873130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.875930Z","title":"Seurat: From moving points to depth","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.875930Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:055a493bb8a33496785f2b307360837209e1b111d5ac399b1ba505ea9cc2ca1e","observation_id":"18776465-0a43-478c-890c-971305fd7c0f","resolution":{"observed_at":"2026-08-03T14:24:49.875930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.878748Z","title":"Is this tracker on? a benchmark protocol for dynamic tracking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.878748Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:303fc36c021d38a27ef8a42283b9536f5e19c1e1f9256fa767df3d3dc6d06303","observation_id":"5f4b16cb-1abf-43b0-965a-de464f7068ba","resolution":{"observed_at":"2026-08-03T14:24:49.878748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.882124Z","title":"MOSE: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.882124Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:209bc1456d1a9e09de016cee906310088eb7c2cfa7f25cd49ab02f888b4fd862","observation_id":"5000c9f6-0441-4d08-a7cb-d9237112dfdf","resolution":{"observed_at":"2026-08-03T14:24:49.882124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.884852Z","title":"TAP-Vid: A benchmark for track- ing any point in a video.NeurIPS, 35:13610–13626, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.884852Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:3a9d0064aa7ef113e246f4e78bbbd2f0605670135b7af2a0c3932b1a39921326","observation_id":"c5e7a2cc-7593-44df-8d47-516c683f76be","resolution":{"observed_at":"2026-08-03T14:24:49.884852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.887708Z","title":"TAPIR: Tracking any point with per-frame initialization and temporal refinement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.887708Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:9bf22089bb07ab6a3400533cc3f64c70208a5aac6e78dff9edd3a2932aa1a85f","observation_id":"10aa5af2-639b-4c7d-98d0-f6410ce05a01","resolution":{"observed_at":"2026-08-03T14:24:49.887708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.890368Z","title":"BootsTAP: Bootstrapped training for tracking-any-point","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.890368Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:a0e7b87288c69902c45c7ebbcddea5732f37cd287eccdad5a2ae07053e3b6a18","observation_id":"d1357e20-15f9-4af1-a272-c72fa200a1b2","resolution":{"observed_at":"2026-08-03T14:24:49.890368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.893309Z","title":"Unleashing diffu- sion transformers for visual correspondence by modulating massive activations.NeurIPS, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.893309Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:528ee003bda493ab3539b124df919860ce8364476b4305130624f2279e2cbb9e","observation_id":"eb37bf9f-0a33-437e-b169-0555283cda41","resolution":{"observed_at":"2026-08-03T14:24:49.893309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.896143Z","title":"Motion prompting: Controlling video generation with motion trajec- tories","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.896143Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:18e8fb6be82582293b2ebdfdd0b9b19ff240dea89d4cc0e805c664e24f1c571e","observation_id":"cfbd658d-67df-49ed-a3ee-82708fcf220f","resolution":{"observed_at":"2026-08-03T14:24:49.896143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.898905Z","title":"Ego4D: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.898905Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:fe16b3532f77f92e2d67272bb734a1b7a4f3c6cae219d9f6e6e3c5d27044ca44","observation_id":"f5e4e64c-1bb7-49bd-a16a-e114c8b72245","resolution":{"observed_at":"2026-08-03T14:24:49.898905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.901721Z","title":"Fleet, Dan Gnanapra- gasam, Florian Golemo, Charles Herrmann, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.901721Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:509608f04f90abb15b7b812b9160111f78c56256563c4300f35694d8db3b83ad","observation_id":"a45d4666-0927-4eef-bd61-7c2f54475b76","resolution":{"observed_at":"2026-08-03T14:24:49.901721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.904596Z","title":"Harley, Zhaoyuan Fang, and Katerina Fragkiadaki","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.904596Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:50f29c6011c3dc202dc7925aa0a221f344aae62d2e4df5d2b7f24a63b8a42209","observation_id":"cc66a702-2cfd-4202-88c5-87ef1c24808e","resolution":{"observed_at":"2026-08-03T14:24:49.904596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.907275Z","title":"Harley, Yang You, Xinglong Sun, Yang Zheng, Nikhil Raghuraman, Yunqi Gu, Sheldon Liang, Wen-Hsuan Chu, Achal Dave, Pavel Tokmakov, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.907275Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:a138f9e21de61507e66f2861a64121d6532b384ff13120c7e9afecc9953d969a","observation_id":"c6c2a53c-1fcf-49a9-8c96-653b55c9186e","resolution":{"observed_at":"2026-08-03T14:24:49.907275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.910344Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.910344Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:b8f6dff58b9a8c2e9d144e861a7e5d407035a2ea9362441e8ffa272319d4e6e8","observation_id":"10fc45cd-b166-4e24-9293-35a0a02f4c96","resolution":{"observed_at":"2026-08-03T14:24:49.910344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.913288Z","title":"Benchmarking neu- ral network robustness to common corruptions and perturba- tions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.913288Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:6bdbc52ad6fc07836f783e31fb168f8e6091a287a9780be813e70f361856d2b9","observation_id":"4d17f473-d0fd-4549-9d89-8346b29c1789","resolution":{"observed_at":"2026-08-03T14:24:49.913288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.915954Z","title":"Denoising dif- fusion probabilistic models.NeurIPS, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.915954Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:d0ce564416991f5dbf18d5893249ca20f68a136f34cea195b12456ae0175bd25","observation_id":"ee303070-89f3-4c2f-a2d0-080557402d19","resolution":{"observed_at":"2026-08-03T14:24:49.915954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.918585Z","title":"LVOS: A benchmark for long-term video object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.918585Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:4ca221b7a5e1541014b4b93f1694b9f2bc4ab6ff4325e76902cb4b800a72bd62","observation_id":"a5abb6db-e25b-4e2e-89de-9f787d9051ff","resolution":{"observed_at":"2026-08-03T14:24:49.918585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.921316Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, Weizhu Chen, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.921316Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:6e3258d9187a9c281ad3405fed2795163e732af1a9f0ad050aa1fd7b26616527","observation_id":"0895bf86-a777-4b32-b07b-535086cdfa88","resolution":{"observed_at":"2026-08-03T14:24:49.921316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.923931Z","title":"Stereo4D: Learning how things move in 3D from internet stereo videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.923931Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:a73f70ed30d0ede7cbbd65eb76d8a9c5aeac4d25d6b163b6bf651f552092ed30","observation_id":"fcca869b-9a6d-477d-bb7a-bf0d1de32019","resolution":{"observed_at":"2026-08-03T14:24:49.923931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11831","last_updated":"2024-10-15T17:56:32Z","snapshot_observed_at":"2026-08-18T10:54:06.071321Z","submitted_at":"2024-10-15T17:56:32Z","title":"CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11831","snapshot_observed_at":"2026-08-03T14:24:49.926648Z","title":"Co- Tracker3: Simpler and better point tracking by pseudo- labelling real videos.arXiv preprint arXiv:2410.11831,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.926648Z"},"links":{"cited_paper":"/paper/2410.11831","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:c41eb840cf16839c75c8f22982b792bd3f278c1b88502a9106153efab5499801","observation_id":"be36ee79-b4c3-44f1-9d9f-eaee40793b61","resolution":{"observed_at":"2026-08-03T14:24:49.926648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.933213Z","title":"Co- Tracker: It is better to track together","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.933213Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:8841afd8fb1ff4093f609f39b332c0071a1ca84c8a1c07fe4b1d2303b7b7cedd","observation_id":"8cb20428-acf5-4508-8b3b-934c185c6eef","resolution":{"observed_at":"2026-08-03T14:24:49.933213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.936225Z","title":"Repurpos- ing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.936225Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:f9b9abd710cdeff2e15f7765f7f58722ed57bfa58a85682437ee6eb4a12cce75","observation_id":"9a20db7b-7535-4877-9d35-27a23fa7124a","resolution":{"observed_at":"2026-08-03T14:24:49.936225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.939023Z","title":"Exploring temporally-aware features for point tracking","venue":null,"work_id":null,"year":1962},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.939023Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:3a34428795e8c673eccdb3cd74f26e33826c5d2347028d0db91d94ec5a0cff54","observation_id":"faef7abb-83e3-4619-af08-9a67ee9e5bec","resolution":{"observed_at":"2026-08-03T14:24:49.939023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.941786Z","title":"Learning to track any points from human motion.arXiv preprint arXiv:2507.06233, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.941786Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:7d5bc7ef5d2e8ac2ddf82d0e1e8d0d13dc95f1e4fdf7eef37924a1e9cde4d449","observation_id":"5d8e3044-ed07-440e-88fe-4ebd9d803c01","resolution":{"observed_at":"2026-08-03T14:24:49.941786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T14:24:49.944520Z","title":"HunyuanVideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.944520Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:e5c3686cdf4ed800a9c37399adcab663a1bfd503f15fbd95f29ceb96b2803dc1","observation_id":"701615fe-de36-4a32-b6f8-a275d82f03d0","resolution":{"observed_at":"2026-08-03T14:24:49.944520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.948093Z","title":"Dense optical tracking: Connecting the dots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.948093Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:7ad95ccdb91fda14856613becdb842a0265a295d3865500963ccfef3d997398e","observation_id":"17495e53-6355-4b5e-ab3a-3df584ef5e43","resolution":{"observed_at":"2026-08-03T14:24:49.948093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.950782Z","title":"TAPTRv2: Attention-based position update improves tracking any point","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.950782Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:5b3ddfc8ce31e81fcd946cd73f66a17d5cab271d7f6fd77859d7cfb538722cee","observation_id":"4ec1c034-e5ec-44f9-bce7-cf67b4d0da00","resolution":{"observed_at":"2026-08-03T14:24:49.950782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.953483Z","title":"TAPTR: Tracking any point with transformers as detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.953483Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:0e5557626f09deb82605147dc2625b1faf36a21d2218bf800cafff17d35a4e5e","observation_id":"67820d67-fdae-44c1-9e8f-5622a5665494","resolution":{"observed_at":"2026-08-03T14:24:49.953483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.956326Z","title":"SD4Match: Learning to prompt stable diffu- sion model for semantic matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.956326Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:9aa2d84a52135664097e730783181c8a153cd04c23df066868643072b993d893","observation_id":"59a77615-d0e9-411c-9ab2-9d08d00fcc08","resolution":{"observed_at":"2026-08-03T14:24:49.956326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-03T14:24:49.959310Z","title":"Hunyuan-DIT: A power- ful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.959310Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:0805b2947cca3bc6e42f816a96e2320763803a09f14f408153f5f8984d0911b7","observation_id":"c0bbf535-9216-4c07-8dea-6120b2872110","resolution":{"observed_at":"2026-08-03T14:24:49.959310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.962984Z","title":"TSM: Temporal shift module for efficient video understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.962984Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:ce6bd6e6f2b8bb24256e0a5abb241900ae600dae9356a2adcd9bbf4a3364cef5","observation_id":"7edf6d9b-7d02-4684-bea1-be667425451e","resolution":{"observed_at":"2026-08-03T14:24:49.962984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T14:24:49.965791Z","title":"Flow matching for generative mod- eling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.965791Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:4c19a304584afc7a05269551b2f7bb1882ac7327dd8dcff54360b066c0f2deb2","observation_id":"916a207d-0708-488c-abd7-1a616732e4c5","resolution":{"observed_at":"2026-08-03T14:24:49.965791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-15T15:38:59.253749Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10318","snapshot_observed_at":"2026-08-03T14:24:49.968980Z","title":"Mind the gap: Aligning vision foundation models to image feature match- ing.arXiv preprint arXiv:2507.10318, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.968980Z"},"links":{"cited_paper":"/paper/2507.10318","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:86147d648e2587817c937647228c9073f0023af1e4e0e472f3e7c3836aaa4452","observation_id":"5470f779-d45d-474b-a5cd-7888123a85c0","resolution":{"observed_at":"2026-08-03T14:24:49.968980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.971914Z","title":"Diffusion hyperfeatures: Search- ing through time and space for semantic correspondence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.971914Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:3686862b494561cfca8dd4f49c38489ed6f39ac9e5ed6a2b2b4d8ce95b813212","observation_id":"df19a93e-ca3d-4c67-a02b-d07bcc60a382","resolution":{"observed_at":"2026-08-03T14:24:49.971914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.974936Z","title":"Not all diffusion model activations have been evaluated as discriminative features.NeurIPS, 37: 55141–55177, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.974936Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:481dabe85335164152368cde9a44db0ffbbbf3822d798a88e3273294eba9f0a5","observation_id":"76008ce0-efd5-498c-82a1-4f3b4bba696a","resolution":{"observed_at":"2026-08-03T14:24:49.974936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.977631Z","title":"DreamMatcher: Ap- pearance matching self-attention for semantically-consistent text-to-image personalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.977631Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:7aed9750bf1259ddc13390ad3c7a2c1081a6cbb25e3a2f74bdc9998b17cf67b2","observation_id":"9404ce03-0556-430d-b0ae-219d791c7cdf","resolution":{"observed_at":"2026-08-03T14:24:49.977631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.980553Z","title":"Diffusion model for dense matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.980553Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:1681983c26d9a440abb5a7f5a6bca82ff8927f0a4ad878898bab18cbee0e2b3d","observation_id":"9dee5f80-4e64-41e6-b4ff-4246cae5dd14","resolution":{"observed_at":"2026-08-03T14:24:49.980553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.983741Z","title":"Emergent tem- poral correspondences from video diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.983741Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:a5e95f7244177e0ecc505ce26da2c699bdb814706f4a3e826e3a85a5c961b604","observation_id":"7f537e2d-2b3e-4356-ad07-70a33707cd0e","resolution":{"observed_at":"2026-08-03T14:24:49.983741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-03T14:24:49.986517Z","title":"DINOv2: Learning robust visual features without supervi- sion.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.986517Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:c6991a060480f7a8921b9cd5cb205e66ad55126c5026f85f055d665fa8bc876b","observation_id":"23e5a106-6d3a-4d89-a032-6c78b0e04696","resolution":{"observed_at":"2026-08-03T14:24:49.986517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-03T14:24:49.989545Z","title":"The 2017 davis challenge on video object segmentation.arXiv preprint arXiv:1704.00675, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.989545Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:a2e3a386f9308ad8b94cb70fb74c157971ce20fe8db174de3a4a8c1d97080e04","observation_id":"8f42bb26-8114-4a08-8a87-12df9908ca52","resolution":{"observed_at":"2026-08-03T14:24:49.989545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.992653Z","title":"TAPTRv3: Spatial and temporal context foster robust tracking of any point in long video.arXiv preprint arXiv:2411.18671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.992653Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:53ae5ec93a32d748320262163d7b7f508ff9cda889479ead05f70ce9b0153aad","observation_id":"a3dba75d-942e-45c4-b63a-d832f13949ee","resolution":{"observed_at":"2026-08-03T14:24:49.992653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.995491Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.995491Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:83818d0f5bc54eb4f76266531c6c00e756e9902ddb9fe162a5d59bf7ea8fdfe9","observation_id":"9701f532-b481-454a-8c5a-4a3cbba5d411","resolution":{"observed_at":"2026-08-03T14:24:49.995491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.998411Z","title":"Particle video: Long-range mo- tion estimation using point trajectories.IJCV, 80(1):72–91,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.998411Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:372fa44695c2158731f28a1556a26854cead094e6d5f526b1d8e3622a3eb4583","observation_id":"460e08e3-00e7-4c93-87b8-5d62e9f5d3f1","resolution":{"observed_at":"2026-08-03T14:24:49.998411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-18T01:07:23.737664Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-03T14:24:50.001185Z","title":"DINOv3.arXiv preprint arXiv:2508.10104, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.001185Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:741413db6c8352e1963b6692b8c253bc0c6e594f661978de746a258b2a4fda72","observation_id":"49177057-4adf-4cc4-ad48-879945916bd6","resolution":{"observed_at":"2026-08-03T14:24:50.001185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:50.004272Z","title":"CleanDIFT: Diffusion features without noise","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.004272Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:ad04cf9dc3c1c6e827115bd07e30aa86012b690c79d3c96612df93ea02589338","observation_id":"44cfb36c-6f29-4d2e-9e25-9e1a09ffd733","resolution":{"observed_at":"2026-08-03T14:24:50.004272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:50.007045Z","title":"Emergent correspondence from image diffusion.NeurIPS, 36:1363–1389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.007045Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:c6a59a1b1c9416a1a5e558e022cfab2bdae03fe7e322c8e590bf4adfac69cf25","observation_id":"43b7c304-3c1c-42d4-8d37-1426903e83de","resolution":{"observed_at":"2026-08-03T14:24:50.007045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:50.010092Z","title":"DINO-Tracker: Taming DINO for self-supervised point tracking in a single video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.010092Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:06280340cb9a6c3356024870b4175ab1c7364174e6fd63127354600dea68ae0d","observation_id":"991b3bd0-e8c6-4b53-afc3-7bbf54373352","resolution":{"observed_at":"2026-08-03T14:24:50.010092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:50.013064Z","title":"RoboTAP: Tracking arbitrary points for few-shot visual imitation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.013064Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:296ef2e00727c95fc4a08abd411e8c315218d3c29f750840de6246ad3191ddcc","observation_id":"6f830326-7f3d-417e-9c2d-1ca771694829","resolution":{"observed_at":"2026-08-03T14:24:50.013064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T14:24:50.015846Z","title":"Wan: Open and advanced large-scale video gen- erative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.015846Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:2ab25ffc52134fd046ec1f847328bf3ae29c3c5b855a324f9dd487290b2076f9","observation_id":"801ee485-e8ce-4edb-89fa-d0bd8e743fea","resolution":{"observed_at":"2026-08-03T14:24:50.015846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:50.018716Z","title":"Tracking everything everywhere all at once","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.018716Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:e679a2d6ba290dd93436c249d37d2dd906dd45598dd5748b8b0e786d2abd9798","observation_id":"03ae073a-3751-4d75-99e1-b590b0f7799f","resolution":{"observed_at":"2026-08-03T14:24:50.018716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:50.021424Z","title":"Shape of motion: 4D reconstruc- tion from a single video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.021424Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:38d8020ff6cac4e39bc97b0b4dd2bdef9158fe38044a3036c95660278bfd289e","observation_id":"966a07cb-03ca-4688-8641-611b8c230efe","resolution":{"observed_at":"2026-08-03T14:24:50.021424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:50.024050Z","title":"SpatialTracker: Tracking any 2D pixels in 3D space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.024050Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:92ecc83179f514d790a806ce83fc0e77a9e03ef365165f87ee7bd60e89410986","observation_id":"77e3d0d8-03ff-4d9b-b1e4-6ee20146ad36","resolution":{"observed_at":"2026-08-03T14:24:50.024050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:50.026992Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.026992Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:936737849c5cb0be6e643ad31cf918ee8a983a20301b13b28b3b6e1de9af32a5","observation_id":"eccbeb07-636b-45fa-8020-aa93dee1fc27","resolution":{"observed_at":"2026-08-03T14:24:50.026992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:50.029730Z","title":"MATCHA: Towards matching anything","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.029730Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:9a3780859d7321fbef82938c799d788ac15f7fbe1d8ff21f7456c7d6e2297851","observation_id":"12f5182a-f5c2-4439-80ad-ab28c4c246ea","resolution":{"observed_at":"2026-08-03T14:24:50.029730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-03T14:24:50.032484Z","title":"CogVideoX: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.032484Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:29253f0e63e6884f50c2573e6a9c68d66e1d07f9eee0ad887fa595e0d9ef53f0","observation_id":"04e8d77a-e119-45a5-814c-b95acd252a90","resolution":{"observed_at":"2026-08-03T14:24:50.032484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:50.035528Z","title":"A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence.NeurIPS, 36: 45533–45547, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.035528Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:e7c99d0b9ca82ce244162d772fe595dda31f9f26ff7e9d2ce1108e0bc5280328","observation_id":"2cd55ece-a74d-4998-acbe-2c683c3ff317","resolution":{"observed_at":"2026-08-03T14:24:50.035528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:50.038330Z","title":"Telling left from right: Identifying geometry-aware semantic corre- spondence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.038330Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:f6e6c95b70f4c936105353f8a44001333996cb44d05e87d5b5c0f33d6c4c8d26","observation_id":"8c64c5c0-3d1b-44de-aa42-ffd07badfa0d","resolution":{"observed_at":"2026-08-03T14:24:50.038330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:50.041031Z","title":"TAPNext: Tracking any point (TAP) as next token prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:50.041031Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:8da622f783c7761989a2fa34cd04ceb5557e3af00ff344fbe4b6adda14e216ef","observation_id":"1475eefc-0c7e-437f-93c7-e50e8a267a6b","resolution":{"observed_at":"2026-08-03T14:24:50.041031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:49.929912Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.929912Z"},"links":{"citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:d9fc7ae9d9cdf90fd376512f0b258ac2dc073c19e710c2525c908f6dc76b18df","observation_id":"0f0ffd0d-e3e1-453e-9570-00eb643378d1","resolution":{"observed_at":"2026-08-03T14:24:49.929912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 3 inbound Pith citation observations for arXiv:2512.20606."}