{"as_of":"2026-08-09T14:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:51c66d1b05131770f78e753ea1ceab6b3b2edbfcf2b2b792100b1e816082b7b8","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T19:08:17.594352Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.24016/citation-record","integrity":"/paper/2603.24016/integrity","json":"/paper/2603.24016/citation-record.json","paper":"/paper/2603.24016"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2003.09003","last_updated":"2020-03-19T20:08:24Z","snapshot_observed_at":"2026-08-01T23:12:45.187111Z","submitted_at":"2020-03-19T20:08:24Z","title":"MOT20: A benchmark for multi object tracking in crowded scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.09003","snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Mot20: A bench- mark for multi object tracking in crowded scenes,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"cited_paper":"/paper/2003.09003","citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:5517d3e76fd393bc4ec0a33c77472ca26be653cc397303ef8bf12063eca025dd","observation_id":"624cd9a6-95fc-4e81-8db0-4f4268d79bc9","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Dancetrack: Multi-object tracking in uniform appearance and diverse motion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:f847a58195f25fefcd02762fec5a7729804212c0b5fd25cf61bf0db746894440","observation_id":"2b561ff3-398e-4467-8bdc-b2fc7cea7921","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Vision meets robotics: The kitti dataset,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:ce04b1d29ba3313f44cf8e5aecab9365e2f511b45576240d5c51d60deccf3748","observation_id":"255c5d48-4317-4a19-91b5-dc5199709f74","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Ov- track: Open-vocabulary multiple object tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:672d19e1d02d68387910bc9c8f3a3fe4cb48a4c691d2f0bb3acb8e07e8c4f583","observation_id":"86b84acb-a96e-4aa0-9761-7823dee8102b","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Matching anything by segmenting anything,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:8b716458a8d25eabbdff2a753f46af3fc681b16224effee9c77847424f519233","observation_id":"1b066986-ee02-4374-9d91-7fdd0d41e292","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Slack: Semantic, location, and appearance aware open- vocabulary tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:4d69eb908f68b500d2069e95591cab38638aea6aaa5412d2a46ac4024b230462","observation_id":"aff71c80-71aa-46c4-bcbc-5cf3be356c12","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Open-vocabulary multi-object tracking with domain generalized and temporally adaptive features,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:a64c6f43d4e34ac4031f6a19a999b6042c760e2369c1f45da395fa7af73d6c3a","observation_id":"3cb75861-2579-4685-b990-3eb0d91f98f7","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10616","last_updated":"2025-03-30T17:15:53Z","snapshot_observed_at":"2026-08-07T17:06:12.190642Z","submitted_at":"2025-03-13T17:56:10Z","title":"OVTR: End-to-End Open-Vocabulary Multiple Object Tracking with Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10616","snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Ovtr: End-to-end open-vocabulary multiple object tracking with transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"cited_paper":"/paper/2503.10616","citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:0bb8a188b601e9de19b34c89a550676bc5887d2ba8b175c68c1d044d8994c3ca","observation_id":"9fe8506a-6cbc-45ed-b5db-ca25756b332f","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Attention to trajec- tory: Trajectory-aware open-vocabulary tracking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:0c18f4923bb4129ec46d5954077eec6b76bef37ccdcb29a72ba44ca567eff85f","observation_id":"1cf6866e-9ae6-4839-b319-aaadf2c66add","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Lvis: A dataset for large vocabulary instance segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:32f377bde170435a87021433fc3ecb470430dd88592fd081aa412b0df44cc188","observation_id":"0da93dce-d05b-45a8-bc34-9ebd8908f05b","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:97d6ee4361e90934a435b2e803a1a12cb2e1c2b72088e7d85a6800de4480feca","observation_id":"fcc9df3c-b1cc-4a2f-b505-bc8cc33a405c","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Tao: A large-scale benchmark for tracking any object,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:2f97b78e45f33e8988b77d057b909c8b7df094ef8f69fb1f1e3a9f8de1a1dba1","observation_id":"581ad3fb-a1cf-4a08-9d9f-53c91c1f1f71","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Covtrack: Continuous open-vocabulary tracking via adaptive multi-cue fusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:d800d210faa1b2b8b836fa547dbbb5206b0a19dd1a94d97c96aec4958c8a6646","observation_id":"f1e1c2ce-ccbc-4989-aca9-8df5d4798944","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Bdd100k: A diverse driving dataset for heterogeneous multitask learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:7da9c042fab526a4abfbe60eedb868444c9cfe000152b129a82e21ab744e1025","observation_id":"e6873b2c-a7ef-4e25-b333-500ae5d9e88e","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"People-tracking-by-detection and people-detection-by-tracking,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:56f2127a9e56c19c57e803476359c71bc22730259abbf0c2b1c62059111da0bb","observation_id":"de371686-1e54-4950-8b9b-4a43f9fb5593","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Tracking without bells and whistles,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:dc2a73705de2e2717ab2bef7be3958f0d8555cd82d7f7d4886de3a59158a0bbf","observation_id":"9954662a-a412-4569-af70-6a38c0f88b84","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Qdtrack: Quasi-dense similarity learning for appearance-only multiple object tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:7061d1bd5e544d9471f58c62894a62bad142e12e0455ec7362df9dc1bca387f1","observation_id":"88d5eb37-6f07-43bc-a479-9a896356d0b8","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Learning by track- ing: Siamese cnn for robust target association,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:dc53b0ca81b2f76820ce22605f2427a37106cd0f9d33af73ef9478f59a73d490","observation_id":"96001817-4fce-4ba9-a813-14a0ef1367a6","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Quasi- dense similarity learning for multiple object tracking,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:537881bd96aa744c174d518025cd46bed9e68f265e2a0d52554e5b10ae237409","observation_id":"c5ea66bd-1029-4fe2-988e-090e2053244a","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Tracking the untrackable: Learning to track multiple cues with long-term dependencies,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:bae730a1c7ab4d0cdda215942199a8171f20b264c8a4ee1cf4a3951dfb206c0f","observation_id":"f7a6b980-ef8d-4f32-8be0-4d52a89a7d92","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Simple online and realtime tracking with a deep association metric,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:6e48002ceaa70c30b24a8355e0b93af468e49eed30d4197cdfdafc5bbdd0a518","observation_id":"83182938-cd18-460c-b7f6-1ba9f85b6004","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Memot: Multi-object tracking with memory,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:f58f8cc4a27594e8ad2638155334474fe7b177d1aa17e67170a3b995d76bebad","observation_id":"885250a3-e4bf-4e03-8450-5ad2e717e74f","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Tracking objects as points,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:d392491cf700f045f53e37c90f84b331d08001164abfb4f08e5b32edf3b68cf1","observation_id":"420ad28e-0fc6-4aca-b10c-342f9ad8b55f","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Probabilistic tracklet scoring and inpainting for multiple object track- ing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:e2341d279536cca9b7442f8bd579255053b73d07b748051c6cdd457837926cde","observation_id":"6a73505a-36ec-4f51-a11d-43a238875ab6","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Simple baselines for human pose estimation and tracking,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:143af96bf90b4346f2dec5f15a525010384428b52952f656233045a55240e5e8","observation_id":"4d889eda-4c00-4cc4-a3c6-cdb01ab1a5da","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Motiontrack: Learning robust short-term and long-term motions for multi-object tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:45ad6ba5b6ee018aca885f8aaff3610d40e1c8744161ced445e3c01371a1ae6f","observation_id":"c7ebd12b-21de-4d20-ac4f-9e24034b3e00","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Strong- sort: Make deepsort great again,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:37243748f0a527125356921cdac0b1530c27be099c482fd061dd534ad15ebb19","observation_id":"7edab222-9f87-41da-a6a0-75273640e6da","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Delving into motion-aware matching for monocular 3d object tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:19538e7a16d9ebcca06fbc122073345d30f0bc0dfb2110caa21ecb0f5dff0a63","observation_id":"fcf9e9c8-9b07-4920-94e9-b00ad18a18d6","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Track to reconstruct and reconstruct to track,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:0596c8277015d2cb3b79693959aed999092685cb832cfdcc8a0e2e76c1eff7a1","observation_id":"9d222fce-496e-47c7-90a8-8d520c0b4551","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Camo-mot: Combined appearance-motion optimization for 3d multi-object tracking with camera-lidar fusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:e8d1deff88d6d4a65a4115e398972bce670865bd2960764ed0e5d3f2d454fae3","observation_id":"eac5875b-0cf2-4a0f-b1f0-5730f9794eef","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11978","last_updated":"2024-12-10T19:00:22Z","snapshot_observed_at":"2026-08-08T08:26:49.280774Z","submitted_at":"2024-03-18T17:13:18Z","title":"Pedestrian Tracking with Monocular Camera using Unconstrained 3D Motion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11978","snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Pedestrian tracking with monocular camera using unconstrained 3d motion model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"cited_paper":"/paper/2403.11978","citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:274b324a934aece24858c25f0c372ccad1dce326e3800311d5c478d72f23a732","observation_id":"7c1bf219-c6da-429b-8046-a704688ad696","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Track, then decide: Category-agnostic vision-based multi-object tracking,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:c10fd953b311e872424b92c4ee1661cabcc1069bcf5a064be531872b9fdfced9","observation_id":"c1bf2db8-58eb-4725-b893-d7df25eab388","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Simple online and realtime tracking,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:79a75ecc451c5c7701ab2517c8b63481976f9f93887d0b37c50e936c27adb676","observation_id":"e1405e60-16b1-4034-99d7-d565b91e0056","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Walker: self-supervised multiple object tracking by walking on tem- poral appearance graphs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:adb436c5e97b599dd5add3c71d1007950c094f06b41fa26b4da104162e255307","observation_id":"d345567a-ecf8-416d-86b5-6f36ac7742e7","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Towards real-time multi-object tracking,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:3758910f51ac789e910fa1f2d7a2079577d3a498b5c2e33d14c75ed79ae38b0d","observation_id":"d2a3543b-404d-49e6-a10a-6fbd3e05807a","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Bytetrack: Multi-object tracking by associating every detection box,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:bf366ebc4351647f50d1ccf5a2a8c52e32935424b561ef2c276cd40ad590ce7e","observation_id":"4e2b3632-9f88-4da7-b402-9930d8e1fa69","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Fairmot: On the fairness of detection and re-identification in multiple object tracking,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:217cd7c78c2942eb7bf83eda29f189abde24cac2c240f4f864d413ab745565f6","observation_id":"743c3d5a-df4a-4536-969c-8c27b0a94caf","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Track- former: Multi-object tracking with transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:5011f80ca8f1e1141c29636ab4ea9bf5980cda6816e4858dbbc902eb4010f6f3","observation_id":"bbb80d4a-0c3d-4ede-8f20-b5126e8a85e7","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15460","last_updated":"2021-05-04T15:58:37Z","snapshot_observed_at":"2026-07-06T10:28:58.102232Z","submitted_at":"2020-12-31T06:03:00Z","title":"TransTrack: Multiple Object Tracking with Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15460","snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Transtrack: Multiple object tracking with transformer,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"cited_paper":"/paper/2012.15460","citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:5bcbd4f93354ab697cc3d986b114e46350f4d06e63fd3d98228c9ab9705410ac","observation_id":"d559cf25-8d9d-46b4-a155-53ca95aded7a","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Motr: End-to-end multiple-object tracking with transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:e133027c08da822c7bfd50854725bc1c97454534f3a7a41079d3bd724c8f9604","observation_id":"4f7b43a5-8d44-40cf-b157-a1c316f659ca","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08040","last_updated":"2021-02-01T08:38:31Z","snapshot_observed_at":"2026-08-04T09:11:22.168499Z","submitted_at":"2021-01-20T09:42:32Z","title":"1st Place Solution to ECCV-TAO-2020: Detect and Represent Any Object for Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08040","snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"1st place solution to eccv-tao-2020: Detect and represent any object for tracking,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"cited_paper":"/paper/2101.08040","citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:2b8c62433f2c4cdd36a5728764c2cd8085a5ae49110063b0ab5b1c5e280c3fe6","observation_id":"aa36aa5c-495b-4375-bf73-5fbdbb852db4","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Global tracking transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:330879cf7025fbd921c7a10ed35434a5541a834551d5d40059d5b75d870a9be0","observation_id":"a0ad7293-890b-460c-b7a4-05fb508805e1","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Tracking every thing in the wild,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:c725c1a2ec28162f2c9620b09032f2afab5ba45ec230ccdb725b7941a4414ba9","observation_id":"ed91be52-d5d6-453d-88d2-6d094879e95c","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Taking mobile multi-object tracking to the next level: People, unknown objects, and carried items,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:5baee19943ecafd43d5e001fefbfe3bf0418261c305ce9b851d4cfe482b87d53","observation_id":"ffa9284c-0461-4148-a5e6-078ff2b17713","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Opening up open world tracking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:ddcb5d5c4dfefd0bbd943a2bf4484301bea654a1b074e586ab42c84a7b698be7","observation_id":"b0bb203c-55d1-4ca9-8360-8125d8c42926","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:f79616e9801299ab77786fd8e9e1d126a35769cc90ea83dcb262fbde13c3da64","observation_id":"d21b6cd8-13ec-4d64-9eff-700cce8e893b","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Open-vocabulary object detec- tion via vision and language knowledge distillation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:38193b8fdff1f0638abbc34d6330884c62d9017b787f621c30fb27d640adc01a","observation_id":"b14dd6e2-1f8e-48c9-ace0-afe8bcf54eed","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:c11d1b6a642bc9f21d1a85799b98e8957e9b9a54768b5a1ea574599bc945bfb3","observation_id":"ee2222b7-914c-4c5d-bdbd-587690ea249c","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:08:17.594352Z","title":"Observation- centric sort: Rethinking sort for robust multi-object tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T19:08:17.594352Z"},"links":{"citing_paper":"/paper/2603.24016"},"observation_digest":"sha256:50148246f59b72ce86929704fb99b2ca394c9e2a7cdea9fe6392e4c9165437ce","observation_id":"37a372e5-3a2e-4bff-9da6-ca6e431ee2bb","resolution":{"observed_at":"2026-07-13T19:08:17.594352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.24016","last_updated":"2026-07-02T15:53:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T01:50:44.799253Z","submitted_at":"2026-03-25T07:20:27Z","title":"COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2603.24016."}