{"as_of":"2026-08-09T16:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:336f87875893e252ab752db77c43f4635ae093492170b1a34d42886822ab0d2f","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:09:23.706315Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.10607/citation-record","integrity":"/paper/2512.10607/integrity","json":"/paper/2512.10607/citation-record.json","paper":"/paper/2512.10607"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-03T17:09:18.919548Z","title":"V-jepa 2: Self- supervised video models enable understanding, prediction and planning.arXiv preprint arXiv:2506.09985, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:18.919548Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:379f49b16aed1cfbbfc4d8d857258074c00affb6e18ffe1b6cb2a9fd8a4937bb","observation_id":"aef58132-70af-47e3-981d-a8f1dd0a24c8","resolution":{"observed_at":"2026-08-03T17:09:18.919548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:19.085406Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:19.085406Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:ac6323fb412c2e0352791f2ecb3d973388336ab3fb48d588bae414a896db12d3","observation_id":"3de8bd12-c4a3-4ae6-81dd-9e3040ac3c31","resolution":{"observed_at":"2026-08-03T17:09:19.085406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:19.314939Z","title":"Object segmentation by long term analysis of point trajectories","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:19.314939Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:1d2c48b1e274854ea401635e27ad133c5c9ba6b82d9ca5d098bed81acc734b82","observation_id":"57223da2-1323-42c2-b54b-7aedaac20fb0","resolution":{"observed_at":"2026-08-03T17:09:19.314939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:19.393314Z","title":"Mevis: A large-scale bench- mark for video segmentation with motion expressions.arXiv preprint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:19.393314Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:e1bc84d2bbcd86a46d2e0fcf6f380bce5191050e2e8f8275ca8b6d35ab8bff41","observation_id":"2ec8f9ad-ab2d-4ca3-88b0-90f5975c6255","resolution":{"observed_at":"2026-08-03T17:09:19.393314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:19.499474Z","title":"Mevis: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:19.499474Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:fd7a037e28eda893df5eac129c7e772eb604bff048791a0b8a08932222fbbfea","observation_id":"cb279774-a2a2-4d49-aa4d-0317a17c0c6d","resolution":{"observed_at":"2026-08-03T17:09:19.499474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:19.601245Z","title":"Tap-vid: A benchmark for tracking any point in a video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:19.601245Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:98d3ee64cc4369acd3579cfd679740719a5d4b7619e1cc7b94ccef524e605848","observation_id":"6e836d57-eb99-428a-a673-fae38e6452d4","resolution":{"observed_at":"2026-08-03T17:09:19.601245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:19.705194Z","title":"Tapir: Tracking any point with per-frame initialization and temporal refinement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:19.705194Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:d7245981dc3596e81392641447d3bada585a52ecafc1ffb788fcbadf0f7de01d","observation_id":"2cde1e77-91b2-4942-a4be-392db3c47f80","resolution":{"observed_at":"2026-08-03T17:09:19.705194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:19.771927Z","title":"Step- former: Self-supervised step discovery and localization in instructional videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:19.771927Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:26b270edb9802c9522b783b677922a84ddb41ea9c60e77fe02f390cc00685520","observation_id":"3f6755db-4ee8-4051-a93c-1a896198f5bc","resolution":{"observed_at":"2026-08-03T17:09:19.771927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:19.858416Z","title":"Context-guided spatio-temporal video grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:19.858416Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:b69b7e1d05a6303b503cf95b5f27342fd90fe52a9bf3571f93745c57f1bdcf5e","observation_id":"02fd8f7d-495d-4c5b-b962-a2541a8c1cd3","resolution":{"observed_at":"2026-08-03T17:09:19.858416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:20.013031Z","title":"Harley, Zhaoyuan Fang, and Katerina Fragkiadaki","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:20.013031Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:6654c9b8c613eed37575c9f8ab847f5b69a83fd1213b40c9ece08f3884708783","observation_id":"ae883612-6ff8-4ec3-b5a6-fdbacb368aa1","resolution":{"observed_at":"2026-08-03T17:09:20.013031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:20.111151Z","title":"Pips++: Improved tracking through occlusions via extended point trajectories","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:20.111151Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:e5ca75426639b179c5a9d00fcfd50169cd64927eaa083d309ebc16f790c4f21a","observation_id":"79d85d07-c7bc-4506-8df5-80a4a1ea4892","resolution":{"observed_at":"2026-08-03T17:09:20.111151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:20.297182Z","title":"A better use of audio-visual cues: Dense video captioning with bi-modal transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:20.297182Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:f70dde5c345589e51ad631a59d529fcbf9aa87bc666e5492594db04e54155920","observation_id":"b3f971f9-358c-4fc3-a93d-d3026f16ce28","resolution":{"observed_at":"2026-08-03T17:09:20.297182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05874","last_updated":"2025-05-28T18:14:55Z","snapshot_observed_at":"2026-08-06T20:37:11.586885Z","submitted_at":"2025-01-10T11:17:15Z","title":"VideoRAG: Retrieval-Augmented Generation over Video Corpus","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05874","snapshot_observed_at":"2026-08-03T17:09:20.433930Z","title":"Videorag: Retrieval-augmented generation over video corpus.arXiv preprint arXiv:2501.05874, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:20.433930Z"},"links":{"cited_paper":"/paper/2501.05874","citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:f525640b98c705a6dddd3a4fdcec89f0ff1c60f854e1bd548f87e36217cab2d9","observation_id":"2d83ecfe-48f0-4669-aeb5-e8d9310fb367","resolution":{"observed_at":"2026-08-03T17:09:20.433930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:20.509094Z","title":"Embracing consistency: A one-stage approach for spatio- temporal video grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:20.509094Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:9f023a897646c8952577237cd3542803e8bf6125fc24445477ea99c3a5f94e65","observation_id":"63cadd34-5091-46d2-8b09-0636e0f1acb5","resolution":{"observed_at":"2026-08-03T17:09:20.509094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:20.649128Z","title":"Co- tracker: It is better to track together","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:20.649128Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:a9220c7aba0b2d34bbdd1efc35fa0ca3b0abfc9aa98b68dfa41dfb60477c5323","observation_id":"0ca2e823-4436-4236-9394-08565064ccda","resolution":{"observed_at":"2026-08-03T17:09:20.649128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:20.768356Z","title":"Co- tracker3: Simpler and better point tracking by pseudo- labelling real videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:20.768356Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:75fdb03759a1d4e68a9c0f7ce391e86a37c5aa56dc7dd35c1f9ec1510a5af540","observation_id":"3e7ef5ab-bb89-4ce2-9340-b5cbe8dfb9ba","resolution":{"observed_at":"2026-08-03T17:09:20.768356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:20.857564Z","title":"Cospal: Co-optimizing spatio-temporal context prompting and adapt- ing for weakly supervised video grounding.arXiv preprint,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:20.857564Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:ac6c0518390405a073481b401e44b655bce37dae73ee20515dd3def447168a03","observation_id":"2bc5818c-8fd0-417e-a7a2-4a303e1c170d","resolution":{"observed_at":"2026-08-03T17:09:20.857564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:20.957468Z","title":"Unsupervised object discovery and track- ing in video collections","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:20.957468Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:ff5019f4ed26d9fcb540accdc710153789144da93109a8f1be49ed6b3b24895c","observation_id":"acf569f3-09ba-4e5c-a3b5-bd2fb4392fd2","resolution":{"observed_at":"2026-08-03T17:09:20.957468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:21.061329Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning.Neu- rocomputing, 508:293–304, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:21.061329Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:da5ae8e0ca13d1cfe33fa961f1abee96ce49dda0795fa67a971d0ebbe19bc322","observation_id":"6f3e8864-aa41-4109-aa52-be2b78164700","resolution":{"observed_at":"2026-08-03T17:09:21.061329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:21.162440Z","title":"X-clip: End-to-end multi-grained con- trastive learning for video-text retrieval","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:21.162440Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:554c667e68194a3597302e677c3df5dac677f23650279893aa9d5e793f4dc49f","observation_id":"03c7596a-8e0d-48e1-a2aa-b3c9189148fa","resolution":{"observed_at":"2026-08-03T17:09:21.162440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:21.268988Z","title":"Delta: Dense efficient long-range 3d tracking for any video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:21.268988Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:7728b1f3062002b2677d79a199bf8d3d715f6d841011fdedacb80c60c4439124","observation_id":"cbcefd51-4e0f-4550-a9b3-952260870a1f","resolution":{"observed_at":"2026-08-03T17:09:21.268988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:21.333781Z","title":"Unsupervised discovery of actions in in- structional videos","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:21.333781Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:9be2237a265981d3164b1df0f75fd2779e55d0a6c007e19e655cb22fc893cd9f","observation_id":"07ff6088-b3f4-4858-840a-d34b39a37d13","resolution":{"observed_at":"2026-08-03T17:09:21.333781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:21.415070Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:21.415070Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:6afc7b1f377325b31c85323dd2affe992a651d5f28a2a49978de400f6e502ef9","observation_id":"cfcbe662-b9b0-4172-8b78-064f432908d2","resolution":{"observed_at":"2026-08-03T17:09:21.415070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:21.447677Z","title":"Two-stream con- volutional networks for action recognition in videos","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:21.447677Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:9cfeaf6061beb84c2ac0b22105af3d6449265d1ac3e34a2f0bd5858fa8230f5b","observation_id":"b8830128-56a8-407e-8ec4-7b20d4a3f0b6","resolution":{"observed_at":"2026-08-03T17:09:21.447677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:21.479717Z","title":"Human-centric spatio-temporal video grounding with visual transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:21.479717Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:ae988ba137ad68b2dca25a4136a96b424175e783b83e0fcf48b59044ca90484e","observation_id":"3caa1e21-e743-41b5-b7b7-64487c2b8549","resolution":{"observed_at":"2026-08-03T17:09:21.479717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:21.523247Z","title":"Human-centric spatio-temporal video grounding with visual transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:21.523247Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:198006820f5e25b25d61fafac51a64787e4ed9b8624f2557bfcd889e0df09a83","observation_id":"72058787-6fce-4a60-be68-312eb18d98d0","resolution":{"observed_at":"2026-08-03T17:09:21.523247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:21.689307Z","title":"Repre- sentation learning with contrastive predictive coding, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:21.689307Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:d912256eab93a6b8c059643a6e6793c783383c57b3fa0d0e9ce2dea352050ede","observation_id":"bb08ca90-92cd-4658-afde-b968f42db816","resolution":{"observed_at":"2026-08-03T17:09:21.689307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:21.810364Z","title":"Action recognition with trajectories","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:21.810364Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:ea7e5d9716e05e62d93edefe9b8816539c3cc2eb837be985276e06f1cb664656","observation_id":"646b2a06-6c64-4872-a89d-e77122168216","resolution":{"observed_at":"2026-08-03T17:09:21.810364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-03T17:09:21.923280Z","title":"Actionclip: A new paradigm for video action recognition.arXiv preprint arXiv:2109.08472, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:21.923280Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:d7b8b0fe9974a03eec8e8a173b169fc3d9ab1eedba7c5f095cefaa6239e1461b","observation_id":"0984b6a3-f540-4e40-80e9-ffdbb441b3ec","resolution":{"observed_at":"2026-08-03T17:09:21.923280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:22.067340Z","title":"Tracking everything everywhere all at once","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:22.067340Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:58576b5bdc0acf760a87d859bd0c5b51e451754866f2b97b1adcc18f485bbad9","observation_id":"2d453055-c304-4433-aee9-73bb93a9b9ea","resolution":{"observed_at":"2026-08-03T17:09:22.067340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:22.234388Z","title":"End-to-end dense video captioning with parallel decoding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:22.234388Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:593d458803631b41cf00b203a31c91484cfb41b315dc49b40f7d20b544822859","observation_id":"c865365e-747b-4104-9df0-304c5e1e3458","resolution":{"observed_at":"2026-08-03T17:09:22.234388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:22.353539Z","title":"Language as queries for referring video object segmen- tation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:22.353539Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:429c2046afb71e77f80eaa4c459708ccc1ec2d3cfc269df97d7f8698babfd1ef","observation_id":"67248719-9360-4fdf-8aea-7097a183c0e3","resolution":{"observed_at":"2026-08-03T17:09:22.353539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:22.453670Z","title":"Spatialtracker: Tracking any 2d pixels in 3d space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:22.453670Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:ed9bd4276f0c2491527ecd82dfd070dc1d507bf62736a7de77e967070dd3e184","observation_id":"b85600e1-13f3-4eb1-a4bc-5b4987b4f7fb","resolution":{"observed_at":"2026-08-03T17:09:22.453670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12462","last_updated":"2025-07-19T02:07:12Z","snapshot_observed_at":"2026-08-08T08:02:10.460729Z","submitted_at":"2025-07-16T17:59:03Z","title":"SpatialTrackerV2: 3D Point Tracking Made Easy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12462","snapshot_observed_at":"2026-08-03T17:09:22.596059Z","title":"Spatialtrackerv2: 3d point tracking made easy.arXiv preprint arXiv:2507.12462, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:22.596059Z"},"links":{"cited_paper":"/paper/2507.12462","citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:ff0cb424b1953aee6d8e5b8660564f4772830a9840f8cc2c519134e0d9d6f0a7","observation_id":"5163c027-4ad1-48c0-b1ad-548dd93d88b1","resolution":{"observed_at":"2026-08-03T17:09:22.596059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:22.725031Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:22.725031Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:39fa6a76a73323492ace9f7b5b47db1877aa84aaa7a25cacaedd76ae793c5786","observation_id":"636d8ca8-ba1e-4cdc-b5af-8e847c87a78a","resolution":{"observed_at":"2026-08-03T17:09:22.725031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:22.836577Z","title":"Universal instance perception as object discovery and retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:22.836577Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:5155a1d23c2901cfe610b74a169a316dea0cf5404bda845c3f95c0c54d2579da","observation_id":"da50673d-f83d-4fe4-851b-4db90ae7451c","resolution":{"observed_at":"2026-08-03T17:09:22.836577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:22.954450Z","title":"Tubedetr: Spatio-temporal video ground- ing with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:22.954450Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:6496fb1b8ada464cf3fa264cbf6737d9856ee0cba0b6d73bf89a720542b6a1fe","observation_id":"1b7764ea-dabf-4c23-a7fc-61399e6be65f","resolution":{"observed_at":"2026-08-03T17:09:22.954450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:23.075433Z","title":"Vid2seq: Large-scale pretraining of a vi- sual language model for dense video captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:23.075433Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:b6029b87210dc71fda8193eb43429284da5411dcdee80ae50cd09278fbf58c3f","observation_id":"52dbcf17-2ab9-434c-be6a-afbed23b942a","resolution":{"observed_at":"2026-08-03T17:09:23.075433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:23.165943Z","title":"Tapip3d: Tracking any point in persistent 3d geome- try.arXiv preprint arXiv:2504.14717, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:23.165943Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:d9b1e7733f4116a55617635df363fb82c8a5e46b0c34ab6fd9b7f17ddd31073c","observation_id":"a810d00c-526e-4f9d-85c1-081f80f0a3a3","resolution":{"observed_at":"2026-08-03T17:09:23.165943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:23.290128Z","title":"Where does it exist: Spatio-temporal video grounding for multi-form sentences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:23.290128Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:5e3357ae19f2f4eeb964663b6d9312d7828b49b5b589bfd283b9aeafdc796032","observation_id":"8d26d584-b579-49ae-b32f-8708aba588bc","resolution":{"observed_at":"2026-08-03T17:09:23.290128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:23.418978Z","title":"Video- text prompting for weakly supervised spatio-temporal video grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:23.418978Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:3fdf8d567fd0f02f48a5a4047f7cbe2b8c7751de7bbec863b0f023624d4495bb","observation_id":"08531455-bcdd-4cd6-ba43-80920be9c8e3","resolution":{"observed_at":"2026-08-03T17:09:23.418978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:23.508626Z","title":"Unsupervised learning from video to detect foreground objects in single images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:23.508626Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:cfdf9797bc6e29d41e0c83f1cb4c46d433201a31491085909946dfb6443c5f00","observation_id":"a3da8936-48f8-4637-bf56-0c9cca9f15ca","resolution":{"observed_at":"2026-08-03T17:09:23.508626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05579","last_updated":"2025-04-14T12:17:03Z","snapshot_observed_at":"2026-08-07T16:07:45.648626Z","submitted_at":"2025-04-08T00:28:42Z","title":"TAPNext: Tracking Any Point (TAP) as Next Token Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05579","snapshot_observed_at":"2026-08-03T17:09:23.609008Z","title":"Tapnext: Tracking any point as next token predic- tion.arXiv preprint arXiv:2504.05579, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:23.609008Z"},"links":{"cited_paper":"/paper/2504.05579","citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:3b0cb339cd921fa8cc7c1e9fdb9cbb67116dccb804f4cabe01e00ed88abedfb1","observation_id":"8ef7c3d8-a217-4a02-bc1c-cef4b6e0600f","resolution":{"observed_at":"2026-08-03T17:09:23.609008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:23.706315Z","title":"Dense video object captioning from disjoint super- vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:23.706315Z"},"links":{"citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:c5de97981247c1f84bad61c135611567f99185f29ecc90ebfddafe35c345bb22","observation_id":"0cb55178-5194-4abe-b175-d239f12c1ff6","resolution":{"observed_at":"2026-08-03T17:09:23.706315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2512.10607."}