{"as_of":"2026-08-18T20:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5b84ce6ff7fdf1cb2c284343d23a37c2fe6d47df904778b2bf0384b96341e15","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:00:25.536019Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.19875/citation-record","integrity":"/paper/2507.19875/integrity","json":"/paper/2507.19875/citation-record.json","paper":"/paper/2507.19875"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-08-18T15:22:56.094984Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-08-15T18:00:25.051633Z","title":"Visual prompting: Modifying pixel space to adapt pre-trained models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.051633Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:e53d66c24ada6982d6fe051a80d016ae6f846b0028ab288a54d83fdbd9526483","observation_id":"7b060917-d2fc-4852-a4e9-0c929326980c","resolution":{"observed_at":"2026-08-15T18:00:25.051633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T18:00:25.057677Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.057677Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:2de8b63898cde2368bc8324d087023637a0d60a913d6f0dc901199780252c23e","observation_id":"2b6168c0-3fd5-451b-91ce-69a90b892be6","resolution":{"observed_at":"2026-08-15T18:00:25.057677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17133","last_updated":"2024-02-13T11:51:07Z","snapshot_observed_at":"2026-08-18T10:57:45.587771Z","submitted_at":"2023-12-28T17:08:11Z","title":"ARTrackV2: Prompting Autoregressive Tracker Where to Look and How to Describe","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17133","snapshot_observed_at":"2026-08-15T18:00:25.062724Z","title":"Ar- trackv2: Prompting autoregressive tracker where to look and how to describe","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.062724Z"},"links":{"cited_paper":"/paper/2312.17133","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:c6ba84d52f1a41941a26165d8b5fc4f0481f02109e45b2d60c6b65b69a55ad8f","observation_id":"feac114b-a727-4bb9-ba01-7b223253147e","resolution":{"observed_at":"2026-08-15T18:00:25.062724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.067661Z","title":"Visual objects in context","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.067661Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:ca4808d40b75dc47ca4d75704fd31909054ff2ec201205366f3b34b624da3686","observation_id":"31ab4e52-3b86-4a21-9c3b-bc1e9f8aaef6","resolution":{"observed_at":"2026-08-15T18:00:25.067661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.072541Z","title":"Fully-convolutional siamese networks for object tracking","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.072541Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:e8ff8e489c51f2d5e3325ac489e5129bed6d53b7f033a8fcad069dfdc43a7176","observation_id":"6dd1badc-254e-41ee-a3ba-7f44c1ff97d2","resolution":{"observed_at":"2026-08-15T18:00:25.072541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02072","last_updated":"2024-04-02T09:00:38Z","snapshot_observed_at":"2026-08-18T07:24:36.042135Z","submitted_at":"2023-11-03T17:54:59Z","title":"HIPTrack: Visual Tracking with Historical Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02072","snapshot_observed_at":"2026-08-15T18:00:25.077398Z","title":"Learning his- torical status prompt for accurate and robust visual tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.077398Z"},"links":{"cited_paper":"/paper/2311.02072","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:e371ce44458192f72034e8bba2fed5880d79ce6f824787e821757d01af9744ea","observation_id":"c458deef-7dc7-4f87-b3d3-1d08557fbc81","resolution":{"observed_at":"2026-08-15T18:00:25.077398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.083037Z","title":"Hiptrack: Visual tracking with historical prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.083037Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:bf83acf155a6c1945d806fc451bc77fbc10fe8d2c13c290ade25625e4ac384c8","observation_id":"d6664951-cb60-4632-94aa-56def1c74905","resolution":{"observed_at":"2026-08-15T18:00:25.083037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.087543Z","title":"Robust object modeling for visual tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.087543Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:1edc89f0ae51f7d741482fbbae2c265596d3fe0a79014bef7483420327911e95","observation_id":"ea980acd-dab8-4366-8809-ccbad76b884d","resolution":{"observed_at":"2026-08-15T18:00:25.087543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.091932Z","title":"The relative con- tribution of scene context and target features to visual search in scenes","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.091932Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:fd83a17b59d4a4326819cba487449e3d579950ec29b233fc78a527128d2840d2","observation_id":"21d8f018-330a-4a16-9f34-107911ef917f","resolution":{"observed_at":"2026-08-15T18:00:25.091932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.097020Z","title":"Back- bone is all your need: A simplified architecture for visual object tracking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.097020Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:f679128f1080344c68a61d213a5c2045fb2e52a91c081ca010465f42c31f6911","observation_id":"8fb728ed-985c-4e69-843e-ca843aeb2b6d","resolution":{"observed_at":"2026-08-15T18:00:25.097020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08972","last_updated":"2024-07-12T03:55:20Z","snapshot_observed_at":"2026-08-16T13:34:53.409009Z","submitted_at":"2024-07-12T03:55:20Z","title":"Revealing the Dark Secrets of Extremely Large Kernel ConvNets on Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08972","snapshot_observed_at":"2026-08-15T18:00:25.101699Z","title":"Revealing the dark secrets of ex- tremely large kernel convnets on robustness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.101699Z"},"links":{"cited_paper":"/paper/2407.08972","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:557a47cda71eb6cd27f95fd73de040d5541f20603f305a4288c09b1cfba1bd89","observation_id":"af9e0079-0496-4bd5-9533-29d214d34c57","resolution":{"observed_at":"2026-08-15T18:00:25.101699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.106886Z","title":"Transformer tracking","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.106886Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:9b682a396bacfaff3b428966a0dcf317f99c572e0a87e3869fb2660cf5fa29f5","observation_id":"173655c0-8471-4ffb-b9c4-7fe625a453d2","resolution":{"observed_at":"2026-08-15T18:00:25.106886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.111506Z","title":"Seqtrack: Sequence to sequence learning for visual ob- ject tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.111506Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:33e4b1647e00ef165858dd8092e88fc8431568c9cc7ef475726296ca908f2c6c","observation_id":"c3e2cd41-3d4d-4834-9634-5aab90328e39","resolution":{"observed_at":"2026-08-15T18:00:25.111506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19138","last_updated":"2024-12-26T09:41:36Z","snapshot_observed_at":"2026-08-18T02:07:11.026888Z","submitted_at":"2024-12-26T09:41:36Z","title":"SUTrack: Towards Simple and Unified Single Object Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19138","snapshot_observed_at":"2026-08-15T18:00:25.115964Z","title":"Sutrack: Towards simple and unified single object tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.115964Z"},"links":{"cited_paper":"/paper/2412.19138","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:c228cd9b5ac10cafff2c4a5bc42a6ba3cd466e10c534b6cf2000064b23335508","observation_id":"5dda1452-603e-469b-9b69-278e31137e65","resolution":{"observed_at":"2026-08-15T18:00:25.115964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.120806Z","title":"Siamese box adaptive network for visual tracking","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.120806Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:87cf293e59009c963ff90312aff5e6d9822510291916fb7e25ff23787a5a830d","observation_id":"43773dbe-f9ec-4cff-909b-deff0e94bff5","resolution":{"observed_at":"2026-08-15T18:00:25.120806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.125439Z","title":"Mixformer: End-to-end tracking with iterative mixed atten- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.125439Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:d1d9df9d5dd6c34a57d3977be2a9d4b8cc060f112ff28d89bea8190001c57e88","observation_id":"68168ffe-117a-40a8-bb38-bf4d6d3509ce","resolution":{"observed_at":"2026-08-15T18:00:25.125439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-15T18:00:25.130259Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.130259Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:a0e6ca70d4ef71f340c20f578ab7ecab446e05580d8cc7b020a0e5afb327b99c","observation_id":"977012a5-2c21-4eb4-a6f9-4e10441ca09e","resolution":{"observed_at":"2026-08-15T18:00:25.130259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.135466Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.135466Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:fc16512cfdf711a02f8be1ec2999497394d3723b0f732c93d7af9d60f7f732cb","observation_id":"6151760b-09d7-454a-9ac1-62b434f780cf","resolution":{"observed_at":"2026-08-15T18:00:25.135466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.139892Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.139892Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:b34b1ccee3734404c4e12da7442ddef47954a709eac43d4ede3cf7f900d4f25f","observation_id":"b59bdd76-e86e-4ee8-b199-040eadc75684","resolution":{"observed_at":"2026-08-15T18:00:25.139892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.144678Z","title":"Lasot: A high-quality large-scale single object tracking benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.144678Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:389f9b768c7fe5bab1efc9c086c601fbd447041c5f9b9916ff189c86ea3fb3f5","observation_id":"9787d40e-5a6e-4c78-81ee-db889399770f","resolution":{"observed_at":"2026-08-15T18:00:25.144678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02048","last_updated":"2021-04-05T18:03:24Z","snapshot_observed_at":"2026-08-13T20:16:29.094509Z","submitted_at":"2019-12-04T15:16:32Z","title":"Siamese Natural Language Tracker: Tracking by Natural Language Descriptions with Siamese Trackers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02048","snapshot_observed_at":"2026-08-15T18:00:25.149355Z","title":"Robust visual object tracking with natural language region proposal network","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.149355Z"},"links":{"cited_paper":"/paper/1912.02048","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:70fe5d1a2f5f357b501675776dac7a671ec15995ac972aaeb59bd4b376bd2bd3","observation_id":"22edd8b8-6ce5-4327-9e52-b260742f54cb","resolution":{"observed_at":"2026-08-15T18:00:25.149355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.154518Z","title":"Real-time visual object tracking with natural lan- guage description","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.154518Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:23bf6f8e3fb0ebbc9cd9e2dd121a40e9fa70eca8501acdc5616eda08c53d0197","observation_id":"097562a7-14eb-456d-9e3d-68b66ceabb53","resolution":{"observed_at":"2026-08-15T18:00:25.154518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.159328Z","title":"Siamese natural language tracker: Tracking by natural lan- guage descriptions with siamese trackers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.159328Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:029ed518f2e7795348b8978c8d7970001aff9c9f663e675402405240a6d5129c","observation_id":"7ba7bb2d-c6ac-44a7-a639-580704c5b823","resolution":{"observed_at":"2026-08-15T18:00:25.159328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19648","last_updated":"2024-12-27T13:54:32Z","snapshot_observed_at":"2026-08-18T16:48:38.402171Z","submitted_at":"2024-12-27T13:54:32Z","title":"Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues","version":1},"cited_work":{"arxiv_id":"2412.19648","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19648","snapshot_observed_at":"2026-08-15T18:00:25.953445Z","title":"Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues","venue":"cs.CV","work_id":"1db05b10-4f3e-40d4-9efd-00b6b64a9663","year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.164615Z"},"links":{"cited_paper":"/paper/2412.19648","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:d70b6fe0f2b50c9b7b44c8b8afd17abf0bc6f3797ce261a3d84df4babf6b46b8","observation_id":"46e13a0a-1579-47ae-a1b5-a1dafd7713b8","resolution":{"observed_at":"2026-08-15T18:00:25.961926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.169975Z","title":"Memvlt: Vision- language tracking with adaptive memory-based prompts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.169975Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:c5b2562955cfe54f119ca20eef4a932a2b4499ce6128392c6ceec55d571cc7cb","observation_id":"5d49d5c0-266c-46aa-9cb6-dab61f2a3a1c","resolution":{"observed_at":"2026-08-15T18:00:25.169975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.174980Z","title":"Narrlv: Towards a comprehensive narrative-centric evaluation for long video generation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.174980Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:b0246bdf8678b11d517dbcb2c35b50a394bc3cec43e4c99fada524417cf52dd2","observation_id":"dfaa284f-62df-4dcf-88c4-6ad7470bb5a4","resolution":{"observed_at":"2026-08-15T18:00:25.174980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19434","last_updated":"2025-05-26T02:53:12Z","snapshot_observed_at":"2026-08-18T08:29:11.898706Z","submitted_at":"2025-05-26T02:53:12Z","title":"CSTrack: Enhancing RGB-X Tracking via Compact Spatiotemporal Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19434","snapshot_observed_at":"2026-08-15T18:00:25.180490Z","title":"Cstrack: Enhancing rgb-x tracking via compact spatiotemporal fea- tures","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.180490Z"},"links":{"cited_paper":"/paper/2505.19434","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:52f9f9d64c752d5cf5b4435a42ef060935fd4d7d77e177758ca5ab5a8c751559","observation_id":"6956bd4c-b23c-4673-b875-76a169d735b7","resolution":{"observed_at":"2026-08-15T18:00:25.180490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.185727Z","title":"Aiatrack: Attention in attention for trans- former visual tracking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.185727Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:275b5b207fe7914e6164fc1cc73d3588433a88c8fa27f37b688ba97505771029","observation_id":"d89e1c7f-6819-40aa-aff1-97aad547f407","resolution":{"observed_at":"2026-08-15T18:00:25.185727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.191737Z","title":"Generalized relation modeling for transformer tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.191737Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:a66d5bb36f3225346f25fab574c66aafe823ba6744a72e5695e33f55e247df40","observation_id":"c33d4be3-f5c2-41f3-b167-71479d44de01","resolution":{"observed_at":"2026-08-15T18:00:25.191737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.196227Z","title":"Divert more attention to vision-language tracking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.196227Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:98e8958437d9a9309531f604b292327da41f14ce88a005a2aa286ee5e2d7ad78","observation_id":"93a04a3d-442f-4d53-ad55-f858ecfda2b4","resolution":{"observed_at":"2026-08-15T18:00:25.196227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02526","last_updated":"2022-01-07T16:22:27Z","snapshot_observed_at":"2026-08-16T17:29:42.233437Z","submitted_at":"2022-01-07T16:22:27Z","title":"Learning Target-aware Representation for Visual Tracking via Informative Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02526","snapshot_observed_at":"2026-08-15T18:00:25.200880Z","title":"Learning target-aware rep- resentation for visual tracking via informative interactions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.200880Z"},"links":{"cited_paper":"/paper/2201.02526","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:85070787772ed697c0fc0791c7cae045c0355e4d617a8818e12bad734b58fb2d","observation_id":"fb14e636-5ffc-410d-b9d1-a77f337883d7","resolution":{"observed_at":"2026-08-15T18:00:25.200880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.205717Z","title":"Onetracker: Unifying visual object tracking with foundation models and efficient tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.205717Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:3edfe925e9c1a3f20b1b7e2c27cb2bc23037b2435bb64b8489a534757963a8af","observation_id":"98daaa08-b2b2-4287-b051-0c2c9679f50c","resolution":{"observed_at":"2026-08-15T18:00:25.205717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.896495Z","title":"A multi-modal global instance tracking benchmark (mgit): Better locating target in complex spatio-temporal and causal relationship","venue":null,"work_id":"4a340194-662f-4e4d-bc71-ef80f2519ce1","year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.210408Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:2a08e3760cb50f64794dbed66cf65adf59b6095f43223860e79cda88bed4117b","observation_id":"a46afc33-de4d-4909-8b30-324264d7ca63","resolution":{"observed_at":"2026-08-15T18:00:26.901630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.880819Z","title":"Global instance tracking: Locating target more like humans","venue":null,"work_id":"f8484ecc-85a3-4954-ae36-611cec549965","year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.215048Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:77def6f924ceb496d00503f44184de644155f07e8681f1231270d5f255046600","observation_id":"b4e30215-6014-4ec2-8208-1f21191831da","resolution":{"observed_at":"2026-08-15T18:00:26.885828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.865503Z","title":"Sotverse: A user- defined task space of single object tracking","venue":null,"work_id":"e84a4df5-5e58-4a45-9b74-e5833cec9cd5","year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.219467Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:d1254a7d9e96dfad6e595b0da4f7d298e335b102702600e4b86981e9e55bdc30","observation_id":"8ce4568f-cf5a-4c12-9e6e-1b97b31b4db1","resolution":{"observed_at":"2026-08-15T18:00:26.870425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.849845Z","title":"Got-10k: A large high-diversity benchmark for generic object tracking in the wild","venue":null,"work_id":"70790aaa-d8a0-42b3-9cfd-ecbbac4deb29","year":2019},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.224012Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:7ae6961b8dafabec53c13b45e49ef67328b6b7ffad1837af26b81ee4729f6786","observation_id":"203bd55e-7cc5-47bf-b790-74b737a99935","resolution":{"observed_at":"2026-08-15T18:00:26.854863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T18:00:25.228732Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.228732Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:bad0d31f6375436d06c199734cc92c78dbb2238e70ce71dc5a9db53b7595af54","observation_id":"ede8583e-037f-423a-b501-d7b53fdacb4f","resolution":{"observed_at":"2026-08-15T18:00:25.228732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-15T18:00:25.233665Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.233665Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:4423717fb49a80c7a2f42db3b2457419c21762ca917e68bb3398d078e80fcd27","observation_id":"2895fd57-2cb0-4fc0-aa7b-2b41d85103f9","resolution":{"observed_at":"2026-08-15T18:00:25.233665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.833433Z","title":"Zoomtrack: Target-aware non-uniform resizing for efficient visual tracking","venue":null,"work_id":"615c1e3b-2009-41a5-b56f-d2e251ae10d8","year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.238682Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:798f0223ad00ef477a09297aa8ffe0f4f11b398f112dea7251dc06d95a7393ea","observation_id":"107088b4-3ab2-4a67-a77a-c34de216eba4","resolution":{"observed_at":"2026-08-15T18:00:26.839119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.817605Z","title":"Multi- modal data fusion: an overview of methods, challenges, and prospects","venue":null,"work_id":"f29cb2da-b6af-424a-a3b4-d3e7858de6d9","year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.243349Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:4713b3dba6ed82d62b5a3ca66c0ab8a14d53e9977dad76a43bb6f3459ef1b9c5","observation_id":"78eb8ad7-c238-4d46-b3f6-3162a9256197","resolution":{"observed_at":"2026-08-15T18:00:26.822966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.802542Z","title":"Cornernet: Detecting objects as paired keypoints","venue":null,"work_id":"4c98461a-e477-44ca-b0e1-cbb6fbcb7985","year":2018},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.247946Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:3644bd2932b4d6c9c16b0fddbccfe4ebd1b5f6600428ac65313040113e8c3898","observation_id":"69bfe300-2ea0-496a-8c69-560bc7703344","resolution":{"observed_at":"2026-08-15T18:00:26.807538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-16T20:01:36.160048Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-15T18:00:25.252699Z","title":"The power of scale for parameter-efficient prompt tuning.arXiv preprint arXiv:2104.08691, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.252699Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:9c7ea2b72b31ae1c593ec3ffd4b481d7b398f3d3d8e8edd937bab9ffa617f579","observation_id":"fb452ae2-f0aa-4952-9742-fc8afed9e0b4","resolution":{"observed_at":"2026-08-15T18:00:25.252699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.787312Z","title":"SiamRPN++: Evolution of siamese visual tracking with very deep networks","venue":null,"work_id":"299cded4-09a4-4645-999a-a5b375836f58","year":2019},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.257482Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:2a2ad8d0e106f1cbc05b6a1ff10c4b0cccfed45207abefd26b977f118fa968c1","observation_id":"bc7645a7-9796-4abd-9f0f-c3940de0187d","resolution":{"observed_at":"2026-08-15T18:00:26.792291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.770416Z","title":"Dtllm-vlt: Diverse text generation for visual language tracking based on llm","venue":null,"work_id":"7004437a-026d-44c9-b41a-b3a6cfec692e","year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.262034Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:45c84cf24b6a74200095cfb6606542bd7f0b8b2c01f294ab94e784dfd2858a48","observation_id":"4a85f1d4-547e-4ebe-bac4-e6fe7aa1de90","resolution":{"observed_at":"2026-08-15T18:00:26.776586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02492","last_updated":"2024-10-09T14:07:15Z","snapshot_observed_at":"2026-08-16T13:12:58.250923Z","submitted_at":"2024-10-03T13:57:07Z","title":"DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02492","snapshot_observed_at":"2026-08-15T18:00:25.267463Z","title":"Dtvlt: A multi-modal diverse text benchmark for visual language tracking based on llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.267463Z"},"links":{"cited_paper":"/paper/2410.02492","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:1ff6cb3ca0b62d47ef92ff9d8ae4bd5822360a91a5811eaaea162f0b47790ea4","observation_id":"9ad79807-54ae-4d3b-bb8e-c58ee2ca8bab","resolution":{"observed_at":"2026-08-15T18:00:25.267463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15600","snapshot_observed_at":"2026-08-15T18:00:25.272754Z","title":"How texts help? a fine- grained evaluation to reveal the role of language in vision- language tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.272754Z"},"links":{"cited_paper":"/paper/2411.15600","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:4cf0da2d86a5b508091d3b0be6ee6e6e82ef8b5a2c4053fca95fd103b6ba1923","observation_id":"c6b60fe2-130c-4dd0-8cfb-129f4d97ab6f","resolution":{"observed_at":"2026-08-15T18:00:25.272754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08887","last_updated":"2024-09-13T14:54:37Z","snapshot_observed_at":"2026-08-16T13:18:46.940318Z","submitted_at":"2024-09-13T14:54:37Z","title":"Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08887","snapshot_observed_at":"2026-08-15T18:00:25.277681Z","title":"Visual language tracking with multi-modal interaction: A robust benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.277681Z"},"links":{"cited_paper":"/paper/2409.08887","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:a91677100c561d58a8cf0baae31c6d3f25422275a6a79962f08a9283172bb4e0","observation_id":"80bed04c-ce88-4da5-a30e-3d7518189832","resolution":{"observed_at":"2026-08-15T18:00:25.277681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.752942Z","title":"Cross- modal target retrieval for tracking by natural language","venue":null,"work_id":"cdd8b35e-f11c-46c5-8160-6410d1a6dd0e","year":2022},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.282504Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:9a1c5334ad5fdc679ed923f51ac1aa246ca60c98ab8f6508a502acca65627e0f","observation_id":"eb33eb2f-f8c4-4151-a44f-ee6ca2229e8d","resolution":{"observed_at":"2026-08-15T18:00:26.759192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.736346Z","title":"Tracking by natural language specification","venue":null,"work_id":"c3249fe6-d9e9-4082-9400-8e61135e0290","year":2017},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.286912Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:c69a4fa12a2caf73272cd6490d3785a52e2b3bfa1993e1f54a281844e05bbcf5","observation_id":"f43e334b-00d2-45f0-a124-e26be12a0705","resolution":{"observed_at":"2026-08-15T18:00:26.741442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.720912Z","title":"Tracking meets lora: Faster training, larger model, stronger performance","venue":null,"work_id":"a4d22b16-f5a0-48de-9e2e-d3873488ab80","year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.291623Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:0145af11ef8bf3ee10a4a9e8b1b92167266e4f9a18036aed87d6c3754804dc3b","observation_id":"a1c4ffdb-d657-4d1d-8c21-1fbbd62da4e5","resolution":{"observed_at":"2026-08-15T18:00:26.725689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10076","last_updated":"2025-03-16T14:50:16Z","snapshot_observed_at":"2026-08-18T13:29:50.352983Z","submitted_at":"2025-03-13T05:54:42Z","title":"VMBench: A Benchmark for Perception-Aligned Video Motion Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10076","snapshot_observed_at":"2026-08-15T18:00:25.296454Z","title":"Vmbench: A benchmark for perception-aligned video motion generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.296454Z"},"links":{"cited_paper":"/paper/2503.10076","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:415d996d6bbd941e7700568f6c81593b560e9c6e7de74296045a0807a249ada8","observation_id":"6714be6a-de44-4d61-903c-ca2ce8887242","resolution":{"observed_at":"2026-08-15T18:00:25.296454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T18:00:25.301341Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.301341Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:e471d475e7f68d1214dbaca8037ee1e6e79c838bdd38788300dc0fba6f675dc8","observation_id":"07a508e4-5330-4201-aa48-0450b0c8fce8","resolution":{"observed_at":"2026-08-15T18:00:25.301341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T18:00:25.306545Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.306545Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:262f1ea4d6c90e9132f9296d5eaf8326ccd09b040f6783286837941accf6b391","observation_id":"11fd7396-2961-4a85-864e-47a3fd4a0165","resolution":{"observed_at":"2026-08-15T18:00:25.306545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.705111Z","title":"Tracking by natural language specification with long short-term context decoupling","venue":null,"work_id":"efad538c-66dc-4dfc-b1a3-aca75c641b27","year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.311253Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:f5132747a58e723b5395e839af7943a1913d40f9ea57ed1d834800cbd1564c9f","observation_id":"2c966cb9-8a2a-48eb-94a5-7cbeec8f84cc","resolution":{"observed_at":"2026-08-15T18:00:26.710708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-15T18:00:25.316004Z","title":"Step-video-t2v technical re- port: The practice, challenges, and future of video founda- tion model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.316004Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:578a21e3fddfd2ad2973f9d481f4e6143e0b8586cb05aa967c8a66f906fa6974","observation_id":"6f8b7738-ada1-479a-9ec6-523f38a3787b","resolution":{"observed_at":"2026-08-15T18:00:25.316004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.687528Z","title":"Unifying visual and vision-language tracking via contrastive learning","venue":null,"work_id":"258306c3-5109-456f-a072-202e525458cd","year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.320855Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:c58fd2be068e84a3cc78becccaa2ec61add78600eb611e6143866261ddd70d8b","observation_id":"d5830c71-77d9-45e3-baba-7c2d3e72a7ea","resolution":{"observed_at":"2026-08-15T18:00:26.692889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.668949Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"05d74a5c-7cb1-49d0-86ae-b81772387855","year":2016},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.325482Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:10048cbbb7a33e7f5012d5e94a097e856ebf896262975b1dc5a2156ab2fbd8ae","observation_id":"0779b1d5-73b4-46c5-8549-6df17a2bbcf1","resolution":{"observed_at":"2026-08-15T18:00:26.675570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.651199Z","title":"Textual tokens classification for multi-modal alignment in vision-language tracking","venue":null,"work_id":"3dbd09aa-77dd-46ec-821b-74a9a818620b","year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.330545Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:e624ccb252bc6c66c46124f1b8dc76469f72eab1726e033dc9fcd0ebbbd7fbf5","observation_id":"79976080-0973-49b3-a477-4f80fd4cab12","resolution":{"observed_at":"2026-08-15T18:00:26.656749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.634834Z","title":"Learning target candidate association to keep track of what not to track","venue":null,"work_id":"7659577c-ec08-4d01-9c91-f516b75d709e","year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.336176Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:c9e699a6c89fbb316fb46f32452310353d2b9db61b6c4d6403898ebbc2f81fdd","observation_id":"fe42269f-44fb-45ca-ac5c-ffc338187d76","resolution":{"observed_at":"2026-08-15T18:00:26.639875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.619799Z","title":"Trackingnet: A large-scale dataset and benchmark for object tracking in the wild","venue":null,"work_id":"f6379415-f721-48cb-98fc-37144a8a1aa7","year":2018},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.341584Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:d921b61f67c7eef141c36dadff7605f1f6f4a8f773831b04afdf06ec972bc72d","observation_id":"4449fdf6-1f5f-4cbe-b041-ec613717c58d","resolution":{"observed_at":"2026-08-15T18:00:26.624769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.604567Z","title":"Vast- track: Vast category visual object tracking.Advances in Neu- ral Information Processing Systems , 37:130797–130818,","venue":null,"work_id":"074f03d9-bd6c-495e-ba85-68fadb1f9091","year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.346874Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:7e663efd6642025654d6e259f7e66a3f9f10e2080b70e5d3e3fc9025a3c0556f","observation_id":"79a5574f-e0ac-48cf-aab0-dda64beee430","resolution":{"observed_at":"2026-08-15T18:00:26.609754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.588228Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"1e7ed140-8a31-47b5-9cb0-c7946f2adebb","year":2015},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.352561Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:8b956751bf8399706811e2d91a814b5ae14affa930bf498b76c69d5057e234a1","observation_id":"c5af3050-d178-473f-89b7-5e73428fbd17","resolution":{"observed_at":"2026-08-15T18:00:26.593658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.357235Z","title":"Generalized in- tersection over union: A metric and a loss for bounding box regression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.357235Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:926795e26cabe42bd0b9396c94182bb615fd9e161e1644e80a7eaad03aa11a89","observation_id":"b391ec34-bb7a-4b16-bc38-97bd873bf123","resolution":{"observed_at":"2026-08-15T18:00:25.357235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.560145Z","title":"Generating semantically precise scene graphs from textual descriptions for improved image retrieval","venue":null,"work_id":"40e08369-e0a5-4efc-ab61-d2b46d19ec44","year":2015},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.362928Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:44d921b3e4713abe202693f17c64b392de5c0bc2d64bd5a188d25358e1f854ca","observation_id":"bc8af11e-9e20-48ea-968c-7be50078ca59","resolution":{"observed_at":"2026-08-15T18:00:26.566625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19975","last_updated":"2024-03-29T04:58:33Z","snapshot_observed_at":"2026-08-16T14:05:17.877697Z","submitted_at":"2024-03-29T04:58:33Z","title":"Context-Aware Integration of Language and Visual References for Natural Language Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19975","snapshot_observed_at":"2026-08-15T18:00:25.367754Z","title":"Context-aware integration of lan- guage and visual references for natural language tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.367754Z"},"links":{"cited_paper":"/paper/2403.19975","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:9e952649bc394392336d841e6f403ab135b23126fc31a8da83aefb641a22d9c7","observation_id":"5c1f058e-025a-4884-80c9-a491e4c32882","resolution":{"observed_at":"2026-08-15T18:00:25.367754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03142","last_updated":"2024-01-06T07:12:07Z","snapshot_observed_at":"2026-08-16T14:29:28.645363Z","submitted_at":"2024-01-06T07:12:07Z","title":"Explicit Visual Prompts for Visual Object Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03142","snapshot_observed_at":"2026-08-15T18:00:25.373163Z","title":"Explicit visual prompts for vi- sual object tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.373163Z"},"links":{"cited_paper":"/paper/2401.03142","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:770b862690955cca1ba8b780295036383d8e948c69408387abae8e1fab70f486","observation_id":"e6bf2372-4fc2-4361-bd35-f84ed6e21c25","resolution":{"observed_at":"2026-08-15T18:00:25.373163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.545470Z","title":"Chat- tracker: Enhancing visual tracking performance via chatting with multimodal large language model","venue":null,"work_id":"81e39d14-56c4-495d-8add-1855c14a68f2","year":2025},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.378218Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:7b88d95f00815064efb5819abecaaac6805af246d8a06d84b7d95a2fec71c564","observation_id":"e7c45bfe-6790-4790-9e82-67358170e76c","resolution":{"observed_at":"2026-08-15T18:00:26.550322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.529876Z","title":"What makes for good views for contrastive learning? Advances in neural informa- tion processing systems, 33:6827–6839, 2020","venue":null,"work_id":"403864c3-3c7f-4979-9216-af3cf2ef96ee","year":2020},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.382961Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:4755bb1967c741b66f806cf64c5374335fca48f475733f80b90856602ba27be8","observation_id":"14d4b30a-8a65-4337-9b36-d4f5e94fa0e5","resolution":{"observed_at":"2026-08-15T18:00:26.535026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.513814Z","title":"Fast-itpn: Integrally pre- trained transformer pyramid network with token migration","venue":null,"work_id":"ebe85492-913c-418c-8db5-085b6d43c81f","year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.387723Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:8c00c0a4c3aa30435e20a4dd911c5ad4c9da83d9d934a3fd3ea197a2f5ac787e","observation_id":"bbbed7b5-4ef0-438f-a903-a55d946ff226","resolution":{"observed_at":"2026-08-15T18:00:26.518967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T18:00:25.392906Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.392906Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:54390f422bee9a69cf1a1dd4d5c86072860ac4c4c9f2975f061a84cb90a3bb0d","observation_id":"dbd7e95f-68fd-44d6-b339-179c6817665e","resolution":{"observed_at":"2026-08-15T18:00:25.392906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.498736Z","title":"Attention is all you need.Proceedings of the Ad- vances in Neural Information Processing Systems, 30, 2017","venue":null,"work_id":"f1a4440f-98d3-41eb-9a8e-9e5bb659d4f2","year":2017},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.398258Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:88a9cab73eb9b2bcdcdb5bb83c3d547539501560a4bc14c3302b05b9a8736890","observation_id":"8bcf2dbb-950a-4d23-8bdf-2636f4cc4953","resolution":{"observed_at":"2026-08-15T18:00:26.503791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.483236Z","title":"Temporal adaptive rgbt tracking with modality prompt","venue":null,"work_id":"c2584c26-c8aa-4022-99bf-3b53bf3274f7","year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.403665Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:de7229abd4cc814a5e6f05e702480cf7006639ed555aa595ce01337508214951","observation_id":"97147d00-61c6-4eb4-b74e-8395c75fa157","resolution":{"observed_at":"2026-08-15T18:00:26.488450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.467155Z","title":"Transformer meets tracker: Exploiting temporal context for robust visual tracking","venue":null,"work_id":"21a8cd2d-54f1-4705-addb-d747df8c2166","year":2021},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.408214Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:c2470562f725ad23150a37cef197b67cc19485155c7f4498931a702343237aae","observation_id":"387deadd-f8dd-4f07-87bb-129b691ca116","resolution":{"observed_at":"2026-08-15T18:00:26.472658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.451719Z","title":"Unified transformer with isomorphic branches for natural language tracking","venue":null,"work_id":"899ded23-25c1-4f1a-941e-645622279f3c","year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.413111Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:84d5b9c9c2f3ceba2836c765b482e84cd4b3c75b0a14fce1aff3ce7b80f50f42","observation_id":"72d0a56c-f80d-4747-a621-668380a7ca51","resolution":{"observed_at":"2026-08-15T18:00:26.457089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10014","last_updated":"2018-11-27T02:54:57Z","snapshot_observed_at":"2026-08-18T14:32:17.777629Z","submitted_at":"2018-11-25T14:00:05Z","title":"Describe and Attend to Track: Learning Natural Language guided Structural Representation and Visual Attention for Object Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.10014","snapshot_observed_at":"2026-08-15T18:00:25.417726Z","title":"Describe and attend to track: Learning natural language guided structural representation and visual attention for object tracking","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.417726Z"},"links":{"cited_paper":"/paper/1811.10014","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:16db03e939a8e755c2733082359cacd1e53331826891798080715f7530522f56","observation_id":"9560beba-56ea-42d6-9f95-9808deaafd35","resolution":{"observed_at":"2026-08-15T18:00:25.417726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.436253Z","title":"Towards more flexible and accurate object tracking with natural language: Algo- rithms and benchmark","venue":null,"work_id":"798e3c12-2d42-494c-aac3-15a615b35686","year":2021},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.422744Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:523209e79a5a54d1a7ecd7fd081a589b3f7254d1275ea2c55604204889ce864a","observation_id":"67692cc2-0fe9-4b8c-bd99-3655fb1e7132","resolution":{"observed_at":"2026-08-15T18:00:26.441493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.421184Z","title":"Autoregressive visual tracking","venue":null,"work_id":"74b0efbf-8085-4a38-ba48-5782f9bd55f6","year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.427440Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:753433e3d7cb0b12648aea6e2d9fe95b9b3da54ad7e7b57348262f50a57ce3f6","observation_id":"c2f82135-bd43-4b95-a14a-0743dd896159","resolution":{"observed_at":"2026-08-15T18:00:26.425576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.406165Z","title":"Dropmae: Masked autoen- coders with spatial-attention dropout for tracking tasks","venue":null,"work_id":"21efed14-e712-4b05-88a1-b5ed3dceacd4","year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.432096Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:fa62aa1cccff1091845aea19a8bd7d07ef60faec9ffc70d33a9425623b522a06","observation_id":"8573aae1-3df1-4911-aebe-395c538b691b","resolution":{"observed_at":"2026-08-15T18:00:26.411229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.391142Z","title":"Object track- ing benchmark","venue":null,"work_id":"7ef0a027-14f8-4a0b-80e0-fd4b5572e62c","year":2015},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.436818Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:6cde00080189c8712353cba94f6935338bd9dcea1e917163886dbaf2f6cde79b","observation_id":"5ec8bf32-ce83-46d2-ad31-8bfc46afd404","resolution":{"observed_at":"2026-08-15T18:00:26.395947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10574","last_updated":"2024-03-15T02:39:26Z","snapshot_observed_at":"2026-08-18T13:55:14.275677Z","submitted_at":"2024-03-15T02:39:26Z","title":"Autoregressive Queries for Adaptive Tracking with Spatio-TemporalTransformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10574","snapshot_observed_at":"2026-08-15T18:00:25.441550Z","title":"Au- toregressive queries for adaptive tracking with spatio- temporaltransformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.441550Z"},"links":{"cited_paper":"/paper/2403.10574","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:d73e3eb549274a1a1a5acd2080eb276b4da4a24c18684f414d791d41b8f0a6c4","observation_id":"f56365bd-fdf5-45de-87c2-ec0588407938","resolution":{"observed_at":"2026-08-15T18:00:25.441550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.375549Z","title":"Less is more: Token context-aware learning for object tracking","venue":null,"work_id":"10d91560-009e-4ee2-afca-8df3a660f284","year":2025},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.446417Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:39333e32c76e0063a42d102130aa241a63eedd99db84e598eae9fe611108e3f9","observation_id":"08292d3a-6347-4310-8ec3-3d7c5a70afef","resolution":{"observed_at":"2026-08-15T18:00:26.380626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.359842Z","title":"Learning spatio-temporal transformer for vi- sual tracking","venue":null,"work_id":"3688bfdf-21ef-46bc-a5ab-61f167db6b6a","year":2021},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.451324Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:a25422ffb244103f043b550b23b93287c5fa4843918e1c287e8de4ecb7bbeabe","observation_id":"f42128ac-9417-4ea7-a6bc-e4398784bd5c","resolution":{"observed_at":"2026-08-15T18:00:26.364736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.343529Z","title":"Learning spatio-temporal transformer for vi- sual tracking","venue":null,"work_id":"49897727-eed7-47cd-b01f-5476eba23fdd","year":2021},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.455733Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:d5cac0a519ced29f56b464cba3f0ddd10b5a3a08b055ee6ef7bc7be8055b5894","observation_id":"04bb95d1-433f-459c-9f04-82d0e2e659da","resolution":{"observed_at":"2026-08-15T18:00:26.348240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.328271Z","title":"Foreground-background distribution mod- eling transformer for visual object tracking","venue":null,"work_id":"24e0be66-080e-4c22-9829-9a6f5f7aa6e5","year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.460077Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:618800b425d8edf84cb1ffea728f598e7bffc47e40df2925596b5d0663017bae","observation_id":"0b4b19a0-230e-43dd-b401-15f565d5fbdd","resolution":{"observed_at":"2026-08-15T18:00:26.333030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.313117Z","title":"Grounding-tracking-integration","venue":null,"work_id":"07e6edcf-5973-4928-b118-a8727371f586","year":2021},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.464646Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:80739e5ca3524834c5897e16430b9ddb13f93bbb3e734c72c2a69fc61e004a52","observation_id":"7d2b5daf-8b45-4459-b1e3-7513d6eb3080","resolution":{"observed_at":"2026-08-15T18:00:26.318160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.298070Z","title":"Joint feature learning and relation modeling for tracking: A one-stream framework","venue":null,"work_id":"98092ca0-7ca2-4e4c-be9f-e838fde3de8c","year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.469358Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:d1c470aa3d6a7bf8e2b87c9a44f4e45d8984840a2079fde3f5cc632743199fa2","observation_id":"014d38a9-b19e-4f0a-9053-f91b3f049817","resolution":{"observed_at":"2026-08-15T18:00:26.302570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.281825Z","title":"All in one: Exploring uni- fied vision-language tracking with multi-modal alignment","venue":null,"work_id":"6e013e67-50fa-4ffb-a2e3-12d2c8ac2543","year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.473993Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:44f2ba69d9ddd11617e2ed03b407806daee79db56e0475fea7ae2f21f36da558","observation_id":"e748ad6f-bcd2-49f6-bea1-79a96bb6bf03","resolution":{"observed_at":"2026-08-15T18:00:26.287233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.265625Z","title":"Beyond accuracy: Tracking more like human via visual search","venue":null,"work_id":"f7860c11-dd07-44e6-b79f-c6ea0bc0dbb5","year":2025},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.478672Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:47e746dfaa2ca9c5607838bd05d646a7f37e5b1561f108db519a6c15a9607452","observation_id":"d0b53a5a-ebf2-45c5-925c-08c7161b930e","resolution":{"observed_at":"2026-08-15T18:00:26.270441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.250719Z","title":"One-stream stepwise decreas- ing for vision-language tracking","venue":null,"work_id":"8b8bcba5-7815-4c06-8aae-0868bb56392d","year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.483392Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:87778728396ce78defb380dbf2de5d07cb78fe81087321ebbd45805fa0159472","observation_id":"3124d896-a416-495f-b9a4-0e8185b6b4d8","resolution":{"observed_at":"2026-08-15T18:00:26.255495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.235423Z","title":"Hivit: A simpler and more efficient design of hierarchical vision transformer","venue":null,"work_id":"bbb0b041-5e8c-4c3d-908e-7e7446040977","year":2022},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.488278Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:967371b70142bb02b3727e04f30352a0e907af8fa9448b7f5bed3a37fd473f0f","observation_id":"ef1aafe4-0de8-4373-8969-a42c6682dad8","resolution":{"observed_at":"2026-08-15T18:00:26.240458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.220736Z","title":"Transformer vision-language tracking via proxy token guided cross-modal fusion","venue":null,"work_id":"faa6c119-8430-427a-b0a4-c6f9d17dac4f","year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.492826Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:e93e9da215578cce5fd89eb90a325e1050896389a18c0fff86c06ea644b7012b","observation_id":"57cc62c4-9c13-4106-8d12-6940d28778dd","resolution":{"observed_at":"2026-08-15T18:00:26.225498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.204748Z","title":"Biodrone: A bionic drone-based single object tracking benchmark for robust vision","venue":null,"work_id":"10887f4e-13c2-4252-ad02-bff6d323a042","year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.497585Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:019085d1dc2cc30f6fb935ba4f38cd0d2987e254dcd5fc0ab1ec521ee99661d9","observation_id":"6194473d-e370-4145-ad3e-3d187e5d9f80","resolution":{"observed_at":"2026-08-15T18:00:26.210101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.502187Z","title":"Leveraging local and global cues for visual tracking via parallel interaction network","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.502187Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:c9c86f55ca7209531eed148c45fcdddc7c3993e66edc7e597c336050ece4c5ad","observation_id":"c4381f3a-f5b6-4ff2-9db2-39b0618eefa4","resolution":{"observed_at":"2026-08-15T18:00:25.502187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.177979Z","title":"Towards unified token learn- ing for vision-language tracking","venue":null,"work_id":"ea594243-b6e0-4af4-a101-7c561646f026","year":2023},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.506485Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:ab5730d26adb9513dc19c02096d3cac32c5f1d45b75dde69554cddc2df5d37b7","observation_id":"d76db66e-8426-42c0-a158-608c8bf3fb62","resolution":{"observed_at":"2026-08-15T18:00:26.183016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01686","last_updated":"2024-01-03T11:44:09Z","snapshot_observed_at":"2026-08-16T20:02:57.439899Z","submitted_at":"2024-01-03T11:44:09Z","title":"ODTrack: Online Dense Temporal Token Learning for Visual Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01686","snapshot_observed_at":"2026-08-15T18:00:25.511264Z","title":"Odtrack: Online dense temporal token learning for visual tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.511264Z"},"links":{"cited_paper":"/paper/2401.01686","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:87baa52f794bc05a476a80054ea19bc796fa74500c36f6a8a9918ee866f20a96","observation_id":"389d8f8b-d52d-450d-99a9-6e2cc63643c2","resolution":{"observed_at":"2026-08-15T18:00:25.511264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.159896Z","title":"Decoupled spatio-temporal consistency learning for self-supervised tracking","venue":null,"work_id":"bdbb4e2b-c591-4fd1-aeba-ee92029c2abe","year":2025},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.516080Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:78cff1344ca46362863008fe33fd00f046b9d204dcefb93027d47d7a041254de","observation_id":"b38f2ec4-7338-43a7-9a17-e75e1816ef5f","resolution":{"observed_at":"2026-08-15T18:00:26.165065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.520680Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.520680Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:93fcb4d2ab8b9aaf5c57dd6b68fc675f09250b925b9bc2c304aee2849bc8717e","observation_id":"e37c8ada-10ed-47b5-8fdd-2a2c58282a59","resolution":{"observed_at":"2026-08-15T18:00:25.520680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.525240Z","title":"Joint vi- sual grounding and tracking with natural language specifica- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.525240Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:783c09f94a5601fab4b48c379bf82f103a45856dc079b11a0c2498f1583ed7fc","observation_id":"2f21eb56-ac82-445b-b26e-0b05d4223b36","resolution":{"observed_at":"2026-08-15T18:00:25.525240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.107888Z","title":"the ironman in red flying in the sky","venue":null,"work_id":"e7e6971a-ab52-4f53-9f5c-77ed841664d4","year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.536019Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:bae2afa7eb4c79e085c1ae979a7b58fb019efa60eb1622e1ec27b52c676aafbf","observation_id":"218710c5-93e8-4ae6-aa17-dbbad206feee","resolution":{"observed_at":"2026-08-15T18:00:26.112817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:26.123348Z","title":"plane”. In the corresponding Attl heatmap, the target word “plane","venue":null,"work_id":"70370e0f-cb28-48d5-bc7d-bc5ce0e3048e","year":null},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.530220Z"},"links":{"citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:acca145a95db2d901f38add8348e33ed7f93bff7d6b87e7b9eb82a1c5cc3b892","observation_id":"d98f2fbd-536a-4b66-a8b2-298adeaa7136","resolution":{"observed_at":"2026-08-15T18:00:26.128639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":1,"verified_fuzzy":48},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 0 inbound Pith citation observations for arXiv:2507.19875."}