Pith. sign in

Paper Citation Record · LEDGER

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking

As of 18 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 3 inbound Pith citation observations for arXiv:2512.20606.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2512.20606 v2

Coverage vector

measured 65 of 65 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-03T14:24:50.041031Z

measured 68 of 68 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T00:58:40.497878Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-14T21:29:28.947667Z

Reference resolution

65 of 65 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved65
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation ae34eebe-d67b-4c98-ad3d-87c153291f73 · outbound

This paper cites V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.389952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.389952Z digest=sha256:1f4aba5306a2ffd0bf292dfad117c4159f398496bc3b33614cfb20568dda7590

Observation 5a97110c-e6a4-493b-882a-64bd428aa7c7 · outbound

This paper cites Can visual foundation models achieve long-term point tracking? InEC- CVW, 2024.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Can visual foundation models achieve long-term point tracking? InEC- CVW, 2024

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.525136Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.525136Z digest=sha256:2c531ce2f787efd36514fb74af920d02468182709365bd21dbd00840b29c669f

Observation 8a299e67-8c2c-4b0c-9b93-20dbc9923c2a · outbound

This paper cites Track-On: Transformer-based online point tracking with memory.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Track-On: Transformer-based online point tracking with memory

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.642120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.642120Z digest=sha256:98d822ec081d7032e4d651a6c2b0e33e5a93ceee80417bd21e4c13414bf34aa0

Observation 9c79274d-f32a-4bc0-bd03-77bc63b63698 · outbound

This paper cites DriveTrack: A benchmark for long-range point tracking in real-world videos.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking DriveTrack: A benchmark for long-range point tracking in real-world videos

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.738532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.738532Z digest=sha256:cb3d7e89eebcb1f69d91f77a42d2507a2c64ce877695c3331f0dc22db76300f3

Observation 31f8982a-0d7d-462d-abd0-193aedbec7ab · outbound

This paper cites Quo vadis, action recognition? a new model and the kinetics dataset.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Quo vadis, action recognition? a new model and the kinetics dataset

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.866652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.866652Z digest=sha256:497220dee90b332c40b7e832be0408b2ca4398627a07ecc398bb339aa0b50c4e

Observation 41c076c1-3f1e-49bd-b4cc-40e0f057c8aa · outbound

This paper cites FlowTrack: Revisiting optical flow for long- range dense tracking.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking FlowTrack: Revisiting optical flow for long- range dense tracking

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.869836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.869836Z digest=sha256:4816106741a7e66b12c9ba6d359eaa4478c00a45a20ed3e87d240cf68e7ca8f2

Observation 92d69132-925b-4290-9660-dba18299845a · outbound

This paper cites Local all-pair correspon- dence for point tracking.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Local all-pair correspon- dence for point tracking

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.873130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.873130Z digest=sha256:703394062c5c1748d556d3ae2b238b7fccefda65dbaa01137082b2cb9b019c65

Observation 18776465-0a43-478c-890c-971305fd7c0f · outbound

This paper cites Seurat: From moving points to depth.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Seurat: From moving points to depth

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.875930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.875930Z digest=sha256:055a493bb8a33496785f2b307360837209e1b111d5ac399b1ba505ea9cc2ca1e

Observation 5f4b16cb-1abf-43b0-965a-de464f7068ba · outbound

This paper cites Is this tracker on? a benchmark protocol for dynamic tracking.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Is this tracker on? a benchmark protocol for dynamic tracking

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.878748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.878748Z digest=sha256:303fc36c021d38a27ef8a42283b9536f5e19c1e1f9256fa767df3d3dc6d06303

Observation 5000c9f6-0441-4d08-a7cb-d9237112dfdf · outbound

This paper cites MOSE: A new dataset for video object segmentation in complex scenes.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking MOSE: A new dataset for video object segmentation in complex scenes

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.882124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.882124Z digest=sha256:209bc1456d1a9e09de016cee906310088eb7c2cfa7f25cd49ab02f888b4fd862

Observation c5e7a2cc-7593-44df-8d47-516c683f76be · outbound

This paper cites TAP-Vid: A benchmark for track- ing any point in a video.NeurIPS, 35:13610–13626, 2022.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking TAP-Vid: A benchmark for track- ing any point in a video.NeurIPS, 35:13610–13626, 2022

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.884852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.884852Z digest=sha256:3a9d0064aa7ef113e246f4e78bbbd2f0605670135b7af2a0c3932b1a39921326

Observation 10aa5af2-639b-4c7d-98d0-f6410ce05a01 · outbound

This paper cites TAPIR: Tracking any point with per-frame initialization and temporal refinement.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking TAPIR: Tracking any point with per-frame initialization and temporal refinement

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.887708Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.887708Z digest=sha256:9bf22089bb07ab6a3400533cc3f64c70208a5aac6e78dff9edd3a2932aa1a85f

Observation d1357e20-15f9-4af1-a272-c72fa200a1b2 · outbound

This paper cites BootsTAP: Bootstrapped training for tracking-any-point.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking BootsTAP: Bootstrapped training for tracking-any-point

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.890368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.890368Z digest=sha256:a0e7b87288c69902c45c7ebbcddea5732f37cd287eccdad5a2ae07053e3b6a18

Observation eb37bf9f-0a33-437e-b169-0555283cda41 · outbound

This paper cites Unleashing diffu- sion transformers for visual correspondence by modulating massive activations.NeurIPS, 2025.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Unleashing diffu- sion transformers for visual correspondence by modulating massive activations.NeurIPS, 2025

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.893309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.893309Z digest=sha256:528ee003bda493ab3539b124df919860ce8364476b4305130624f2279e2cbb9e

Observation cfbd658d-67df-49ed-a3ee-82708fcf220f · outbound

This paper cites Motion prompting: Controlling video generation with motion trajec- tories.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Motion prompting: Controlling video generation with motion trajec- tories

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.896143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.896143Z digest=sha256:18e8fb6be82582293b2ebdfdd0b9b19ff240dea89d4cc0e805c664e24f1c571e

Observation f5e4e64c-1bb7-49bd-a16a-e114c8b72245 · outbound

This paper cites Ego4D: Around the world in 3,000 hours of egocentric video.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Ego4D: Around the world in 3,000 hours of egocentric video

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.898905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.898905Z digest=sha256:fe16b3532f77f92e2d67272bb734a1b7a4f3c6cae219d9f6e6e3c5d27044ca44

Observation a45d4666-0927-4eef-bd61-7c2f54475b76 · outbound

This paper cites Fleet, Dan Gnanapra- gasam, Florian Golemo, Charles Herrmann, et al.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Fleet, Dan Gnanapra- gasam, Florian Golemo, Charles Herrmann, et al

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.901721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.901721Z digest=sha256:509608f04f90abb15b7b812b9160111f78c56256563c4300f35694d8db3b83ad

Observation cc66a702-2cfd-4202-88c5-87ef1c24808e · outbound

This paper cites Harley, Zhaoyuan Fang, and Katerina Fragkiadaki.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Harley, Zhaoyuan Fang, and Katerina Fragkiadaki

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.904596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.904596Z digest=sha256:50f29c6011c3dc202dc7925aa0a221f344aae62d2e4df5d2b7f24a63b8a42209

Observation c6c2a53c-1fcf-49a9-8c96-653b55c9186e · outbound

This paper cites Harley, Yang You, Xinglong Sun, Yang Zheng, Nikhil Raghuraman, Yunqi Gu, Sheldon Liang, Wen-Hsuan Chu, Achal Dave, Pavel Tokmakov, et al.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Harley, Yang You, Xinglong Sun, Yang Zheng, Nikhil Raghuraman, Yunqi Gu, Sheldon Liang, Wen-Hsuan Chu, Achal Dave, Pavel Tokmakov, et al

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.907275Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.907275Z digest=sha256:a138f9e21de61507e66f2861a64121d6532b384ff13120c7e9afecc9953d969a

Observation 10fc45cd-b166-4e24-9293-35a0a02f4c96 · outbound

This paper cites Deep residual learning for image recognition.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Deep residual learning for image recognition

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.910344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.910344Z digest=sha256:b8f6dff58b9a8c2e9d144e861a7e5d407035a2ea9362441e8ffa272319d4e6e8

Observation 4d17f473-d0fd-4549-9d89-8346b29c1789 · outbound

This paper cites Benchmarking neu- ral network robustness to common corruptions and perturba- tions.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Benchmarking neu- ral network robustness to common corruptions and perturba- tions

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.913288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.913288Z digest=sha256:6bdbc52ad6fc07836f783e31fb168f8e6091a287a9780be813e70f361856d2b9

Observation ee303070-89f3-4c2f-a2d0-080557402d19 · outbound

This paper cites Denoising dif- fusion probabilistic models.NeurIPS, 33:6840–6851, 2020.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Denoising dif- fusion probabilistic models.NeurIPS, 33:6840–6851, 2020

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.915954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.915954Z digest=sha256:d0ce564416991f5dbf18d5893249ca20f68a136f34cea195b12456ae0175bd25

Observation a5abb6db-e25b-4e2e-89de-9f787d9051ff · outbound

This paper cites LVOS: A benchmark for long-term video object segmentation.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking LVOS: A benchmark for long-term video object segmentation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.918585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.918585Z digest=sha256:4ca221b7a5e1541014b4b93f1694b9f2bc4ab6ff4325e76902cb4b800a72bd62

Observation 0895bf86-a777-4b32-b07b-535086cdfa88 · outbound

This paper cites Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, Weizhu Chen, et al.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, Weizhu Chen, et al

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.921316Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.921316Z digest=sha256:6e3258d9187a9c281ad3405fed2795163e732af1a9f0ad050aa1fd7b26616527

Observation fcca869b-9a6d-477d-bb7a-bf0d1de32019 · outbound

This paper cites Stereo4D: Learning how things move in 3D from internet stereo videos.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Stereo4D: Learning how things move in 3D from internet stereo videos

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.923931Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.923931Z digest=sha256:a73f70ed30d0ede7cbbd65eb76d8a9c5aeac4d25d6b163b6bf651f552092ed30

Observation be36ee79-b4c3-44f1-9d9f-eaee40793b61 · outbound

This paper cites CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.926648Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.926648Z digest=sha256:c41eb840cf16839c75c8f22982b792bd3f278c1b88502a9106153efab5499801

Observation 8cb20428-acf5-4508-8b3b-934c185c6eef · outbound

This paper cites Co- Tracker: It is better to track together.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Co- Tracker: It is better to track together

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.933213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.933213Z digest=sha256:8841afd8fb1ff4093f609f39b332c0071a1ca84c8a1c07fe4b1d2303b7b7cedd

Observation 9a20db7b-7535-4877-9d35-27a23fa7124a · outbound

This paper cites Repurpos- ing diffusion-based image generators for monocular depth estimation.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Repurpos- ing diffusion-based image generators for monocular depth estimation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.936225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.936225Z digest=sha256:f9b9abd710cdeff2e15f7765f7f58722ed57bfa58a85682437ee6eb4a12cce75

Observation faef7abb-83e3-4619-af08-9a67ee9e5bec · outbound

This paper cites Exploring temporally-aware features for point tracking.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Exploring temporally-aware features for point tracking

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.939023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.939023Z digest=sha256:3a34428795e8c673eccdb3cd74f26e33826c5d2347028d0db91d94ec5a0cff54

Observation 5d8e3044-ed07-440e-88fe-4ebd9d803c01 · outbound

This paper cites Learning to track any points from human motion.arXiv preprint arXiv:2507.06233, 2025.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Learning to track any points from human motion.arXiv preprint arXiv:2507.06233, 2025

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.941786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.941786Z digest=sha256:7d5bc7ef5d2e8ac2ddf82d0e1e8d0d13dc95f1e4fdf7eef37924a1e9cde4d449

Observation 701615fe-de36-4a32-b6f8-a275d82f03d0 · outbound

This paper cites HunyuanVideo: A Systematic Framework For Large Video Generative Models.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking HunyuanVideo: A Systematic Framework For Large Video Generative Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.944520Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.944520Z digest=sha256:e5c3686cdf4ed800a9c37399adcab663a1bfd503f15fbd95f29ceb96b2803dc1

Observation 17495e53-6355-4b5e-ab3a-3df584ef5e43 · outbound

This paper cites Dense optical tracking: Connecting the dots.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Dense optical tracking: Connecting the dots

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.948093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.948093Z digest=sha256:7ad95ccdb91fda14856613becdb842a0265a295d3865500963ccfef3d997398e

Observation 4ec1c034-e5ec-44f9-bce7-cf67b4d0da00 · outbound

This paper cites TAPTRv2: Attention-based position update improves tracking any point.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking TAPTRv2: Attention-based position update improves tracking any point

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.950782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.950782Z digest=sha256:5b3ddfc8ce31e81fcd946cd73f66a17d5cab271d7f6fd77859d7cfb538722cee

Observation 67820d67-fdae-44c1-9e8f-5622a5665494 · outbound

This paper cites TAPTR: Tracking any point with transformers as detection.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking TAPTR: Tracking any point with transformers as detection

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.953483Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.953483Z digest=sha256:0e5557626f09deb82605147dc2625b1faf36a21d2218bf800cafff17d35a4e5e

Observation 59a77615-d0e9-411c-9ab2-9d08d00fcc08 · outbound

This paper cites SD4Match: Learning to prompt stable diffu- sion model for semantic matching.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking SD4Match: Learning to prompt stable diffu- sion model for semantic matching

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.956326Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.956326Z digest=sha256:9aa2d84a52135664097e730783181c8a153cd04c23df066868643072b993d893

Observation c0bbf535-9216-4c07-8dea-6120b2872110 · outbound

This paper cites Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.959310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.959310Z digest=sha256:0805b2947cca3bc6e42f816a96e2320763803a09f14f408153f5f8984d0911b7

Observation 7edf6d9b-7d02-4684-bea1-be667425451e · outbound

This paper cites TSM: Temporal shift module for efficient video understanding.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking TSM: Temporal shift module for efficient video understanding

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.962984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.962984Z digest=sha256:ce6bd6e6f2b8bb24256e0a5abb241900ae600dae9356a2adcd9bbf4a3364cef5

Observation 916a207d-0708-488c-abd7-1a616732e4c5 · outbound

This paper cites Flow Matching for Generative Modeling.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Flow Matching for Generative Modeling

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.965791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.965791Z digest=sha256:4c19a304584afc7a05269551b2f7bb1882ac7327dd8dcff54360b066c0f2deb2

Observation 5470f779-d45d-474b-a5cd-7888123a85c0 · outbound

This paper cites Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.968980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.968980Z digest=sha256:86147d648e2587817c937647228c9073f0023af1e4e0e472f3e7c3836aaa4452

Observation df19a93e-ca3d-4c67-a02b-d07bcc60a382 · outbound

This paper cites Diffusion hyperfeatures: Search- ing through time and space for semantic correspondence.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Diffusion hyperfeatures: Search- ing through time and space for semantic correspondence

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.971914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.971914Z digest=sha256:3686862b494561cfca8dd4f49c38489ed6f39ac9e5ed6a2b2b4d8ce95b813212

Observation 76008ce0-efd5-498c-82a1-4f3b4bba696a · outbound

This paper cites Not all diffusion model activations have been evaluated as discriminative features.NeurIPS, 37: 55141–55177, 2024.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Not all diffusion model activations have been evaluated as discriminative features.NeurIPS, 37: 55141–55177, 2024

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.974936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.974936Z digest=sha256:481dabe85335164152368cde9a44db0ffbbbf3822d798a88e3273294eba9f0a5

Observation 9404ce03-0556-430d-b0ae-219d791c7cdf · outbound

This paper cites DreamMatcher: Ap- pearance matching self-attention for semantically-consistent text-to-image personalization.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking DreamMatcher: Ap- pearance matching self-attention for semantically-consistent text-to-image personalization

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.977631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.977631Z digest=sha256:7aed9750bf1259ddc13390ad3c7a2c1081a6cbb25e3a2f74bdc9998b17cf67b2

Observation 9dee5f80-4e64-41e6-b4ff-4246cae5dd14 · outbound

This paper cites Diffusion model for dense matching.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Diffusion model for dense matching

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.980553Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.980553Z digest=sha256:1681983c26d9a440abb5a7f5a6bca82ff8927f0a4ad878898bab18cbee0e2b3d

Observation 7f537e2d-2b3e-4356-ad07-70a33707cd0e · outbound

This paper cites Emergent tem- poral correspondences from video diffusion transformers.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Emergent tem- poral correspondences from video diffusion transformers

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.983741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.983741Z digest=sha256:a5e95f7244177e0ecc505ce26da2c699bdb814706f4a3e826e3a85a5c961b604

Observation 23e5a106-6d3a-4d89-a032-6c78b0e04696 · outbound

This paper cites DINOv2: Learning Robust Visual Features without Supervision.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking DINOv2: Learning Robust Visual Features without Supervision

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.986517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.986517Z digest=sha256:c6991a060480f7a8921b9cd5cb205e66ad55126c5026f85f055d665fa8bc876b

Observation 8f42bb26-8114-4a08-8a87-12df9908ca52 · outbound

This paper cites The 2017 DAVIS Challenge on Video Object Segmentation.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking The 2017 DAVIS Challenge on Video Object Segmentation

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.989545Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.989545Z digest=sha256:a2e3a386f9308ad8b94cb70fb74c157971ce20fe8db174de3a4a8c1d97080e04

Observation a3dba75d-942e-45c4-b63a-d832f13949ee · outbound

This paper cites TAPTRv3: Spatial and temporal context foster robust tracking of any point in long video.arXiv preprint arXiv:2411.18671, 2024.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking TAPTRv3: Spatial and temporal context foster robust tracking of any point in long video.arXiv preprint arXiv:2411.18671, 2024

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.992653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.992653Z digest=sha256:53ae5ec93a32d748320262163d7b7f508ff9cda889479ead05f70ce9b0153aad

Observation 9701f532-b481-454a-8c5a-4a3cbba5d411 · outbound

This paper cites High-resolution image syn- thesis with latent diffusion models.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking High-resolution image syn- thesis with latent diffusion models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.995491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.995491Z digest=sha256:83818d0f5bc54eb4f76266531c6c00e756e9902ddb9fe162a5d59bf7ea8fdfe9

Observation 460e08e3-00e7-4c93-87b8-5d62e9f5d3f1 · outbound

This paper cites Particle video: Long-range mo- tion estimation using point trajectories.IJCV, 80(1):72–91,.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Particle video: Long-range mo- tion estimation using point trajectories.IJCV, 80(1):72–91,

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.998411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.998411Z digest=sha256:372fa44695c2158731f28a1556a26854cead094e6d5f526b1d8e3622a3eb4583

Observation 49177057-4adf-4cc4-ad48-879945916bd6 · outbound

This paper cites DINOv3.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking DINOv3

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.001185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.001185Z digest=sha256:741413db6c8352e1963b6692b8c253bc0c6e594f661978de746a258b2a4fda72

Observation 44cfb36c-6f29-4d2e-9e25-9e1a09ffd733 · outbound

This paper cites CleanDIFT: Diffusion features without noise.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking CleanDIFT: Diffusion features without noise

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.004272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.004272Z digest=sha256:ad04cf9dc3c1c6e827115bd07e30aa86012b690c79d3c96612df93ea02589338

Observation 43b7c304-3c1c-42d4-8d37-1426903e83de · outbound

This paper cites Emergent correspondence from image diffusion.NeurIPS, 36:1363–1389, 2023.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Emergent correspondence from image diffusion.NeurIPS, 36:1363–1389, 2023

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.007045Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.007045Z digest=sha256:c6a59a1b1c9416a1a5e558e022cfab2bdae03fe7e322c8e590bf4adfac69cf25

Observation 991b3bd0-e8c6-4b53-afc3-7bbf54373352 · outbound

This paper cites DINO-Tracker: Taming DINO for self-supervised point tracking in a single video.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking DINO-Tracker: Taming DINO for self-supervised point tracking in a single video

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.010092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.010092Z digest=sha256:06280340cb9a6c3356024870b4175ab1c7364174e6fd63127354600dea68ae0d

Observation 6f830326-7f3d-417e-9c2d-1ca771694829 · outbound

This paper cites RoboTAP: Tracking arbitrary points for few-shot visual imitation.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking RoboTAP: Tracking arbitrary points for few-shot visual imitation

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.013064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.013064Z digest=sha256:296ef2e00727c95fc4a08abd411e8c315218d3c29f750840de6246ad3191ddcc

Observation 801ee485-e8ce-4edb-89fa-d0bd8e743fea · outbound

This paper cites Wan: Open and Advanced Large-Scale Video Generative Models.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Wan: Open and Advanced Large-Scale Video Generative Models

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.015846Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.015846Z digest=sha256:2ab25ffc52134fd046ec1f847328bf3ae29c3c5b855a324f9dd487290b2076f9

Observation 03ae073a-3751-4d75-99e1-b590b0f7799f · outbound

This paper cites Tracking everything everywhere all at once.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Tracking everything everywhere all at once

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.018716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.018716Z digest=sha256:e679a2d6ba290dd93436c249d37d2dd906dd45598dd5748b8b0e786d2abd9798

Observation 966a07cb-03ca-4688-8641-611b8c230efe · outbound

This paper cites Shape of motion: 4D reconstruc- tion from a single video.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Shape of motion: 4D reconstruc- tion from a single video

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.021424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.021424Z digest=sha256:38d8020ff6cac4e39bc97b0b4dd2bdef9158fe38044a3036c95660278bfd289e

Observation 77e3d0d8-03ff-4d9b-b1e4-6ee20146ad36 · outbound

This paper cites SpatialTracker: Tracking any 2D pixels in 3D space.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking SpatialTracker: Tracking any 2D pixels in 3D space

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.024050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.024050Z digest=sha256:92ecc83179f514d790a806ce83fc0e77a9e03ef365165f87ee7bd60e89410986

Observation eccbeb07-636b-45fa-8020-aa93dee1fc27 · outbound

This paper cites Open-vocabulary panop- tic segmentation with text-to-image diffusion models.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Open-vocabulary panop- tic segmentation with text-to-image diffusion models

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.026992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.026992Z digest=sha256:936737849c5cb0be6e643ad31cf918ee8a983a20301b13b28b3b6e1de9af32a5

Observation 12f5182a-f5c2-4439-80ad-ab28c4c246ea · outbound

This paper cites MATCHA: Towards matching anything.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking MATCHA: Towards matching anything

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.029730Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.029730Z digest=sha256:9a3780859d7321fbef82938c799d788ac15f7fbe1d8ff21f7456c7d6e2297851

Observation 04e8d77a-e119-45a5-814c-b95acd252a90 · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.032484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.032484Z digest=sha256:29253f0e63e6884f50c2573e6a9c68d66e1d07f9eee0ad887fa595e0d9ef53f0

Observation 2cd55ece-a74d-4998-acbe-2c683c3ff317 · outbound

This paper cites A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence.NeurIPS, 36: 45533–45547, 2023.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence.NeurIPS, 36: 45533–45547, 2023

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.035528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.035528Z digest=sha256:e7c99d0b9ca82ce244162d772fe595dda31f9f26ff7e9d2ce1108e0bc5280328

Observation 8c64c5c0-3d1b-44de-aa42-ffd07badfa0d · outbound

This paper cites Telling left from right: Identifying geometry-aware semantic corre- spondence.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Telling left from right: Identifying geometry-aware semantic corre- spondence

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.038330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.038330Z digest=sha256:f6e6c95b70f4c936105353f8a44001333996cb44d05e87d5b5c0f33d6c4c8d26

Observation 1475eefc-0c7e-437f-93c7-e50e8a267a6b · outbound

This paper cites TAPNext: Tracking any point (TAP) as next token prediction.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking TAPNext: Tracking any point (TAP) as next token prediction

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:50.041031Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:50.041031Z digest=sha256:8da622f783c7761989a2fa34cd04ceb5557e3af00ff344fbe4b6adda14e216ef

Observation 0f0ffd0d-e3e1-453e-9570-00eb643378d1 · outbound

This paper cites an unresolved cited work.

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking Unresolved cited work

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-03T14:24:49.929912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:24:49.929912Z digest=sha256:d9fc7ae9d9cdf90fd376512f0b258ac2dc073c19e710c2525c908f6dc76b18df

Pith citing papers

Observation 1ad67764-8a1e-415c-9f5f-4fa44f865a6f · inbound

TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking cites this paper.

TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking

Reference 63

Resolution
verified exact
arxiv_id, observed 2026-06-30T03:17:26.209732Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-14T21:28:12.151547Z digest=sha256:f7c4a1dde8298bec0dee17171a127564bd9530c710c09fcefea8f9d72c9b4803

Observation b16e9fe9-2d55-4840-bab2-3a2aed90ce51 · inbound

Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation cites this paper.

Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking

Reference 37

Resolution
unresolved
no resolver link, observed 2026-07-12T05:46:45.293902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T05:46:45.293902Z digest=sha256:db9114714bef6ce0c1d3150e87a5bec8571d13f963a325a204dc2776b6d6ca93

Observation 78783360-127a-4b11-aeff-7ca67c429118 · inbound

DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents cites this paper.

DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T00:58:40.497878Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T00:58:40.497878Z digest=sha256:aeb6fa23a00d492684df9ff8b1aefa9b6724ec37691e6ff28aa794da72b594dd