{"as_of":"2026-08-18T01:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:783980b6a08df0cf2441b803828ab3f24aec31df159f0113c38f638f3366200a","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:09:18.356984Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:48:47.941164Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:47:30.785940Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15600","snapshot_observed_at":"2026-08-11T00:09:21.137235Z","title":"How texts help? a fine-grained evaluation to reveal the role of language in vision-language tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19648","last_updated":"2024-12-27T13:54:32Z","snapshot_observed_at":"2026-08-16T20:03:35.365305Z","submitted_at":"2024-12-27T13:54:32Z","title":"Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:09:21.137235Z"},"links":{"cited_paper":"/paper/2411.15600","citing_paper":"/paper/2412.19648"},"observation_digest":"sha256:fb90ab9480b6cdca3b372e619562f000fe04d2544a662d15de45b8cf3f66339f","observation_id":"f9b351c5-372e-4071-9993-8bc2101de048","resolution":{"observed_at":"2026-08-11T00:09:21.137235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15600","snapshot_observed_at":"2026-08-16T04:48:47.941164Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00752","last_updated":"2025-05-16T04:42:12Z","snapshot_observed_at":"2026-08-17T15:10:55.566944Z","submitted_at":"2025-05-01T05:24:14Z","title":"DARTer: Dynamic Adaptive Representation Tracker for Nighttime UAV Tracking","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:48:47.941164Z"},"links":{"cited_paper":"/paper/2411.15600","citing_paper":"/paper/2505.00752"},"observation_digest":"sha256:abf1e3796e48045dd808e81db653150ddbb1ef17a7f3030163be1c7de6779993","observation_id":"2c0f1374-5f44-4ad5-bdbc-4b0802bdb424","resolution":{"observed_at":"2026-08-16T04:48:47.941164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15600","snapshot_observed_at":"2026-08-15T18:00:25.272754Z","title":"How texts help? a fine- grained evaluation to reveal the role of language in vision- language tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19875","last_updated":"2025-07-26T09:05:12Z","snapshot_observed_at":"2026-08-16T20:02:55.316953Z","submitted_at":"2025-07-26T09:05:12Z","title":"ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.272754Z"},"links":{"cited_paper":"/paper/2411.15600","citing_paper":"/paper/2507.19875"},"observation_digest":"sha256:4cf0da2d86a5b508091d3b0be6ee6e6e82ef8b5a2c4053fca95fd103b6ba1923","observation_id":"c6b60fe2-130c-4dd0-8cfb-129f4d97ab6f","resolution":{"observed_at":"2026-08-15T18:00:25.272754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"cited_work":{"arxiv_id":"2411.15600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15600","snapshot_observed_at":"2026-07-03T00:47:30.785940Z","title":"How texts help? a fine- grained evaluation to reveal the role of language in vision-language tracking,","venue":null,"work_id":"704d304c-775d-4a8b-9dba-e58bd772acc2","year":2024},"citing_paper":{"arxiv_id":"2606.09167","last_updated":"2026-06-08T08:05:40Z","snapshot_observed_at":"2026-08-12T23:43:39.120516Z","submitted_at":"2026-06-08T08:05:40Z","title":"Vision-Language Guided Hyperspectral Object Tracking via Semantics Fusion and Contextual Template Updating","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T17:00:06.124148Z"},"links":{"cited_paper":"/paper/2411.15600","citing_paper":"/paper/2606.09167"},"observation_digest":"sha256:cd7422f125c07f1ad8f93ad46becdb856fe16f7ddb66c7b79d5acd58f1e879e8","observation_id":"411cef07-8af4-4362-95f6-05eddc97d6ed","resolution":{"observed_at":"2026-07-03T00:47:30.788092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15600/citation-record","integrity":"/paper/2411.15600/integrity","json":"/paper/2411.15600/citation-record.json","paper":"/paper/2411.15600"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.103564Z","title":"Human mem- ory: A proposed system and its control processes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.103564Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:1d09873445ffd6ce9547d0d2c7062dd53140c18f685dc32dfa4f62b13bbf5da3","observation_id":"c691b2e0-3aa4-4517-b7a8-de1014d9f763","resolution":{"observed_at":"2026-08-12T14:09:18.103564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.133692Z","title":"Hiptrack: Visual tracking with historical prompts","venue":null,"work_id":"83a54648-e993-4004-b289-e944ce61ab6b","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.108712Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:ca2213cf1e7e99140306aaf2ad37e5ee7b6cd7d49986ddcbc37a0525308c87cd","observation_id":"881e888d-1078-449b-9ad5-994789e07879","resolution":{"observed_at":"2026-08-12T14:09:19.138491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.114816Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.114816Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:a6bac72db88460a9af2dce21f314068d551b107fdd33d10eca8540dab7eb556c","observation_id":"8a57c619-3fd1-4110-a336-57db4580f668","resolution":{"observed_at":"2026-08-12T14:09:18.114816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.110154Z","title":"Lasot: A high-quality large-scale single object tracking benchmark","venue":null,"work_id":"59d3be10-1a4d-4052-9fe3-b9dd9c406617","year":2021},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.119871Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:92153a9dd85b2bae125989766958401c6fd4ba74f8d60aae3f636d4095fce73c","observation_id":"96076bb1-e19d-486c-a9a0-8fc314c3fd77","resolution":{"observed_at":"2026-08-12T14:09:19.114942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.094934Z","title":"The ther- mal infrared visual object tracking vot-tir2015 challenge re- sults","venue":null,"work_id":"bcba2852-8cd9-4010-8591-e507e5ed086f","year":2015},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.125035Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:ca741da89e38b749b26a4991306b7aea0b03ceb7b6e16dea6ec3449c067c5dc4","observation_id":"f2e1bfc6-d475-4fee-8d92-ffb21e0fc335","resolution":{"observed_at":"2026-08-12T14:09:19.099954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02048","last_updated":"2021-04-05T18:03:24Z","snapshot_observed_at":"2026-08-13T20:16:29.094509Z","submitted_at":"2019-12-04T15:16:32Z","title":"Siamese Natural Language Tracker: Tracking by Natural Language Descriptions with Siamese Trackers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02048","snapshot_observed_at":"2026-08-12T14:09:18.130217Z","title":"Robust visual object tracking with natural language region proposal network","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.130217Z"},"links":{"cited_paper":"/paper/1912.02048","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:2b86ea914a382ad2b59858fac868456d1aa6f830c153ad016b2f38570796669f","observation_id":"3c47da88-d533-4e27-904e-94fd2c4cdf3f","resolution":{"observed_at":"2026-08-12T14:09:18.130217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.079507Z","title":"Real-time visual object tracking with natural lan- guage description","venue":null,"work_id":"2834430e-4cb2-43e1-81c8-82258cb85dbd","year":2020},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.136265Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:e8346ea141c4ca628b9dfe9f876866e9259196a491f1120b557b1924e84ee15e","observation_id":"7ee7f2b0-718e-4e4a-9776-e6151e02ab5b","resolution":{"observed_at":"2026-08-12T14:09:19.084546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.064814Z","title":"Siamese natural language tracker: Tracking by natural lan- guage descriptions with siamese trackers","venue":null,"work_id":"0dec4124-aa20-40e4-a310-d23b231dcc2e","year":2021},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.141139Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:a55199e5d23ec9544759bfbf5ee3c5f65ba93d1a52d9929886df85ef044380d1","observation_id":"44c9f2af-045c-42fa-8a7a-70f844a7e963","resolution":{"observed_at":"2026-08-12T14:09:19.070116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.050737Z","title":"MemVLT: Vision-language tracking with adaptive memory- based prompts","venue":null,"work_id":"4939c7cc-52f9-49fb-8e37-c9431e1cb970","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.146373Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:f4af1df240677e22348cf2536a7729c600b64133eb16d3f1fa23542e3b46fbb1","observation_id":"b761f02c-1fd9-4117-bd35-8f0467b15c93","resolution":{"observed_at":"2026-08-12T14:09:19.055495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.035326Z","title":"Consistencies are all you need for semi-supervised vision-language tracking","venue":null,"work_id":"5de581bf-63b0-46cd-a5ef-4bd0a6f8764b","year":1904},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.151226Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:020361256df609352971e5ec0613db4c1fb2e59af9319f27de5573ddb77d6052","observation_id":"a56339be-e9c9-4f14-b7fe-fbf118c2f054","resolution":{"observed_at":"2026-08-12T14:09:19.040434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.021542Z","title":"Divert more attention to vision-language tracking","venue":null,"work_id":"04ce7c2e-7bd3-4d5f-972a-f347f87136d7","year":2022},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.156126Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:4ca96c4694b1d57791de5e746429d6d759d5557de93eaef4d6df71297cb728bd","observation_id":"782e3fdb-7f13-423c-98a4-8e531c289e26","resolution":{"observed_at":"2026-08-12T14:09:19.026128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:19.007122Z","title":"Divert more attention to vision-language object tracking","venue":null,"work_id":"66ead24a-c245-4138-a2ff-82c1062f94ce","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.160917Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:f02b9c2012b4dcd1131d862f22484bd656cd8b2acc9ee758bd050e1245984f81","observation_id":"a18ba0f9-cb3e-4228-ab3f-d09fe06e99c9","resolution":{"observed_at":"2026-08-12T14:09:19.011993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.992020Z","title":"Global instance tracking: Locating target more like humans","venue":null,"work_id":"cce22695-4f6a-4028-b256-06b8a4a24d65","year":2022},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.165505Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:d237a2e0ed8758a904217a6d843b28093b6b026fd36ebee12a887be2dcbab51d","observation_id":"d4ad2f17-3e36-4606-80ac-d8429d77aba6","resolution":{"observed_at":"2026-08-12T14:09:18.996937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.977103Z","title":"A multi-modal global instance tracking benchmark (mgit): Better locating target in complex spatio-temporal and causal relationship","venue":null,"work_id":"2148c507-da91-4918-9e23-a40d476953e9","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.170815Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:c640e461f9bfb5ed610a91b87a77f3c02c6d3bdf6f3848c1abb29364f312de7c","observation_id":"2d5bd364-cf7e-4c6d-b4c7-e54bbbe5e165","resolution":{"observed_at":"2026-08-12T14:09:18.982423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.963072Z","title":"Sotverse: A user- defined task space of single object tracking","venue":null,"work_id":"97bad116-4068-431e-97e4-342556fd83f6","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.175845Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:af73b4517ba917f178a92c955c698a812ecde46ff73c27cde957511858cf3b2f","observation_id":"e0ff01a6-a8e9-44e1-b151-b84c0f8c54c9","resolution":{"observed_at":"2026-08-12T14:09:18.967890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.948754Z","title":"Rtracker: Recoverable track- ing via pn tree structured memory","venue":null,"work_id":"ead9dd98-597c-411a-81db-8a2afd2bf1e1","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.181623Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:1a97b0a107fb632c3232066699b5651da85b9180bd857a6b0ca5a88ecbe1823a","observation_id":"c4eaebec-61c2-4c42-8e2e-a301cc81fb6e","resolution":{"observed_at":"2026-08-12T14:09:18.953505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.934180Z","title":"The sixth visual object tracking vot2018 challenge results","venue":null,"work_id":"d7735584-70d8-4f5f-9f42-7df14dc74358","year":2018},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.186969Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:4817c0a5c80a773e7c4ac4aa512d23827dc1f7f1b211d43d673375838672b786","observation_id":"0774f916-c945-4e4c-b88a-91f50ef30465","resolution":{"observed_at":"2026-08-12T14:09:18.939065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.919353Z","title":"The seventh visual object tracking vot2019 chal- lenge results","venue":null,"work_id":"9152896d-a010-4c3a-9894-a42fbe7db5fa","year":2019},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.191693Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:093c5c99353340376939050ce13b5a548a58bbad3b8149ac5e88d25dfcb7a366","observation_id":"88220d66-de46-4b7d-9aad-ee7477ba4a0a","resolution":{"observed_at":"2026-08-12T14:09:18.924264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.905026Z","title":"The eighth visual object tracking vot2020 chal- lenge results","venue":null,"work_id":"624b2ed1-f219-4ab7-b2ea-13ba38b1f77a","year":2020},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.196789Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:45455abc742faf7d259649495b1d1b1172379c432aec115a5659b667db9d125c","observation_id":"84d66b3c-cf7b-4fa4-98ab-c437e0f9aa11","resolution":{"observed_at":"2026-08-12T14:09:18.909595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.889400Z","title":"The ninth visual object tracking vot2021 challenge results","venue":null,"work_id":"5db8b205-b7da-4825-8d5a-59c9b5fe7add","year":2021},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.202337Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:ea1d1f4022e12ed8c8e43d2f1ff008fec07b81db8af5262ff7d84b8a0673252e","observation_id":"3a1abc17-5ecc-43e2-aa9f-75e330ec33e5","resolution":{"observed_at":"2026-08-12T14:09:18.894884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.874931Z","title":"The tenth visual object tracking vot2022 challenge re- sults","venue":null,"work_id":"20f69163-68d2-4b55-8710-82d412194522","year":2022},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.206910Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:f784bd51c8cba3335655a70beee0ed2f95e3114c140c7697fa23277a46e66e95","observation_id":"ef392102-65b6-4b4d-a993-46fd01ac911b","resolution":{"observed_at":"2026-08-12T14:09:18.879567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.859624Z","title":"Dtllm-vlt: Diverse text generation for visual language tracking based on llm","venue":null,"work_id":"2e03d1c6-3f42-4ebe-8fdb-efe563465a56","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.211677Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:9e0bd809b7b9cc558296556967b7612e087fcbcfa5968d7495503f804b06ca3e","observation_id":"65bd778c-f33d-452d-8017-040820f4a3a6","resolution":{"observed_at":"2026-08-12T14:09:18.865064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02492","last_updated":"2024-10-09T14:07:15Z","snapshot_observed_at":"2026-08-16T13:12:58.250923Z","submitted_at":"2024-10-03T13:57:07Z","title":"DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02492","snapshot_observed_at":"2026-08-12T14:09:18.216985Z","title":"Dtvlt: A multi-modal 9 diverse text benchmark for visual language tracking based on llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.216985Z"},"links":{"cited_paper":"/paper/2410.02492","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:ebbb121a5dc32247217463b60f3b6dd56bbcca6a5455034eff7d6a6b859def6f","observation_id":"4ad675ef-d0f0-4044-92b5-2b720b9f1a7d","resolution":{"observed_at":"2026-08-12T14:09:18.216985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08887","last_updated":"2024-09-13T14:54:37Z","snapshot_observed_at":"2026-08-16T13:18:46.940318Z","submitted_at":"2024-09-13T14:54:37Z","title":"Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark","version":1},"cited_work":{"arxiv_id":"2409.08887","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.08887","snapshot_observed_at":"2026-08-12T14:09:18.459031Z","title":"Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark","venue":"cs.CV","work_id":"b5140620-846e-4121-869e-8308bd442292","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.222921Z"},"links":{"cited_paper":"/paper/2409.08887","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:4b51c867a385af43fb170ba287707c7fba4129190867c55959cee96310b5f8e8","observation_id":"e2a7c7a5-3c78-46fd-a66b-35eae532892d","resolution":{"observed_at":"2026-08-12T14:09:18.465992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.844736Z","title":"Cross- modal target retrieval for tracking by natural language","venue":null,"work_id":"01a0a740-66d5-4ca2-99aa-a2506cec262c","year":2022},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.227573Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:f37219da6e9fa49ecbb08b9e956fce68fe485ec98b65afbb67c6e78f714b2046","observation_id":"eab50161-26c0-48e1-9d5e-8b3e2f4140b1","resolution":{"observed_at":"2026-08-12T14:09:18.850078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.830535Z","title":"Tracking by natural language specification","venue":null,"work_id":"53353d09-6965-4d10-a0bb-33873c5c6b03","year":null},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.232583Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:6c1f5978c735920d674ff527ae2422c2134d8538bde35385d6315df84b24ecf3","observation_id":"ede48084-bcb6-4c20-8c4b-64a06640b73b","resolution":{"observed_at":"2026-08-12T14:09:18.835221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.816181Z","title":"Unifying visual and vision-language tracking via contrastive learning","venue":null,"work_id":"af86076f-5852-40bc-89f9-5f66a048b219","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.237944Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:21ee75c24347fba02e9c39c5c6f2f2312365e1418c81965d5dad8d813a6a72f6","observation_id":"78a3cc78-8dba-4446-b3ca-29f268e31bd9","resolution":{"observed_at":"2026-08-12T14:09:18.820905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.799898Z","title":"Human memory","venue":null,"work_id":"a9a8ac62-d4b4-4b86-947e-8e47dc7615c0","year":2021},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.242844Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:36161932a8ee2fa50b048ff93da11c44119f7e90a538f2be0a925c5e36f5f8ef","observation_id":"d04315e0-37e9-4afe-8d2f-43569950c657","resolution":{"observed_at":"2026-08-12T14:09:18.804407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.785007Z","title":"The visual object track- ing vot2016 challenge results","venue":null,"work_id":"844fd71b-05fd-44a5-8d19-c91be9a17883","year":2016},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.248344Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:950dacc0f58b71692eae0084da2133324223963692564cb2dcd272ec25692078","observation_id":"b4dba66c-1329-47fb-837d-e88ee4fecaa8","resolution":{"observed_at":"2026-08-12T14:09:18.790519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.769638Z","title":"Context-aware integration of lan- guage and visual references for natural language tracking","venue":null,"work_id":"08e46081-7acf-4129-af72-daa8f08301f3","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.252952Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:9fa592756e28f878e459b58c811adf131f132f48cdd0ac12f772cdb809594486","observation_id":"3ead83b6-0b82-4cca-8684-2b92c2bcecbb","resolution":{"observed_at":"2026-08-12T14:09:18.774118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.755182Z","title":"Explicit visual prompts for visual object tracking","venue":null,"work_id":"11df406b-26ea-429b-acff-660591b949a5","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.257481Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:723421102d2139fe30d1e11b9db9061e76d11e5bc718576a8a29a51f9c37f025","observation_id":"1fe940d1-a924-4644-b23f-b21af2d2134f","resolution":{"observed_at":"2026-08-12T14:09:18.759747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.740627Z","title":"Auditory sensory (”echoic”) memory dysfunction in schizophrenia","venue":null,"work_id":"5e1c67f5-2523-4956-9c89-e88b779ff57c","year":1995},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.261997Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:22d5338ed747fd5e1fbc70b132ac79ccac522620f7f0da22465b01776bfb4703","observation_id":"8c0b6c44-f2b2-4804-b90b-51dc991611d1","resolution":{"observed_at":"2026-08-12T14:09:18.745258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01756","last_updated":"2024-12-16T12:53:25Z","snapshot_observed_at":"2026-08-16T13:03:20.065177Z","submitted_at":"2024-11-04T02:43:55Z","title":"ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01756","snapshot_observed_at":"2026-08-12T14:09:18.267141Z","title":"Chat- tracker: Enhancing visual tracking performance via chat- ting with multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.267141Z"},"links":{"cited_paper":"/paper/2411.01756","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:ae80022f7ef8e3a1790b369489b1a50950821aadfd61fe2a39cb2c42a9cd59f0","observation_id":"5ad3aaec-2001-450f-905c-ef1547a5e252","resolution":{"observed_at":"2026-08-12T14:09:18.267141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.725106Z","title":"Elysium: Exploring object-level perception in videos via mllm","venue":null,"work_id":"a66f33ec-8d9f-4b3f-b37f-d15157887094","year":2025},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.272795Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:194fd03cd9351e6b996d26d5e470a2cbd369ff5dedb065de8e7be7cc126b1d29","observation_id":"917f536b-3295-4830-80a2-8f134fefd9b7","resolution":{"observed_at":"2026-08-12T14:09:18.730119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.710367Z","title":"Semtrack: A large-scale dataset for semantic tracking in the wild","venue":null,"work_id":"a75e7b9f-c8c1-45cd-9866-a74bf74bace5","year":2025},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.277700Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:a0d138f3152fc76a888f7493672a24d64afc2c90c85f35ccf5dc97c78b83b250","observation_id":"db3ba621-7ef0-48be-880f-55a6fcd7fb8f","resolution":{"observed_at":"2026-08-12T14:09:18.715262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.694172Z","title":"Unified transformer with isomorphic branches for natural language tracking","venue":null,"work_id":"cffc7790-af2c-427c-bbcc-189073666b64","year":2023},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.283013Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:af514ea9c664d94f148e365c5e6ec37c42da547ad9da4d1afd80ca1611f8685d","observation_id":"f9e12642-b43f-41b8-bc4f-da8173b7627e","resolution":{"observed_at":"2026-08-12T14:09:18.699411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10014","last_updated":"2018-11-27T02:54:57Z","snapshot_observed_at":"2026-08-14T17:54:08.837658Z","submitted_at":"2018-11-25T14:00:05Z","title":"Describe and Attend to Track: Learning Natural Language guided Structural Representation and Visual Attention for Object Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.10014","snapshot_observed_at":"2026-08-12T14:09:18.288190Z","title":"Describe and attend to track: Learning natural language guided structural representation and visual attention for object tracking","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.288190Z"},"links":{"cited_paper":"/paper/1811.10014","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:b7ac819d00c6c9f719dd1b712b06e0627b21e510f263bed33e35c058c228ec32","observation_id":"4c3a89d1-ed08-496e-be7b-26df92b80bdf","resolution":{"observed_at":"2026-08-12T14:09:18.288190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.679294Z","title":"Towards more flexible and accurate object tracking with natural language: Algo- rithms and benchmark","venue":null,"work_id":"ea39feac-6d4d-4ccc-a6c4-3cbfc055267c","year":2021},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.293346Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:f3ad6b69e0c933b49bcc58cc84177d0097923232cdb492c8101d88cd7b70ae8c","observation_id":"95ea0b52-9fde-4404-a1b7-7259aa545944","resolution":{"observed_at":"2026-08-12T14:09:18.684054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.664679Z","title":"Online object tracking: A benchmark","venue":null,"work_id":"c1f44620-206c-48fc-a520-14bf1edbe238","year":2013},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.298731Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:dbb1e4fa02b70cbe08a642e3fc76012d08f7a0d0a6f597334f143913a13f2ca5","observation_id":"5f28e509-88c0-4f24-b367-0eb9700b0621","resolution":{"observed_at":"2026-08-12T14:09:18.669373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.649775Z","title":"Object track- ing benchmark","venue":null,"work_id":"eb93970f-0761-4a19-b190-d2f3d9995d92","year":2015},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.303585Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:de5faae745ac51667f4b7746c2bcfbd967bc75a5e704f92e9dd016b446fbdc98","observation_id":"dd0a1bfa-3699-45c7-b46c-3a67baf380de","resolution":{"observed_at":"2026-08-12T14:09:18.654849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.634988Z","title":"Autore- gressive queries for adaptive tracking with spatio-temporal transformers","venue":null,"work_id":"aad3f8e0-7783-4c89-8a5e-1748b61ba1db","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.308091Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:ef4c151fcc845c7c15853fba7b99e362358ad0506f69e7c8597fb8476a268bbb","observation_id":"932c0727-fa98-42a7-8928-56e91a12cc20","resolution":{"observed_at":"2026-08-12T14:09:18.639677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.620603Z","title":"Grounding-tracking-integration","venue":null,"work_id":"abcd617d-1c79-4e57-97fd-f1bc2d9071b9","year":2021},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.313353Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:675463d40be9960042e134da159a1394e5ea57e228815f65e0b752fa383ab516","observation_id":"203c9a77-e2b8-470d-be58-cf95dadd2df7","resolution":{"observed_at":"2026-08-12T14:09:18.625256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.603166Z","title":"Webuav- 3m: A benchmark for unveiling the power of million-scale deep uav tracking","venue":null,"work_id":"de02f97e-681e-4ac5-b482-be21456719bf","year":2022},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.318218Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:39441bb16dac7c44bbdd8857f971a7bab501670fa665b39b230f46e0ac765829","observation_id":"0e63a94b-20e4-4cb8-be81-4617b937366e","resolution":{"observed_at":"2026-08-12T14:09:18.609682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16902","last_updated":"2025-05-19T03:40:10Z","snapshot_observed_at":"2026-08-16T13:15:30.456607Z","submitted_at":"2024-09-25T13:10:03Z","title":"Underwater Camouflaged Object Tracking Meets Vision-Language SAM2","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16902","snapshot_observed_at":"2026-08-12T14:09:18.323238Z","title":"Towards underwater camouflaged ob- ject tracking: An experimental evaluation of sam and sam 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.323238Z"},"links":{"cited_paper":"/paper/2409.16902","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:b42b6614e777799c78eb307136b7739d3b808940fa50094a598ce06a61c1ad86","observation_id":"fadae9dd-0be5-411a-94d4-406e88d3823a","resolution":{"observed_at":"2026-08-12T14:09:18.323238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19818","last_updated":"2024-05-30T08:25:21Z","snapshot_observed_at":"2026-08-16T13:47:52.203273Z","submitted_at":"2024-05-30T08:25:21Z","title":"WebUOT-1M: Advancing Deep Underwater Object Tracking with A Million-Scale Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19818","snapshot_observed_at":"2026-08-12T14:09:18.328043Z","title":"Webuot-1m: Advancing deep underwa- ter object tracking with a million-scale benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.328043Z"},"links":{"cited_paper":"/paper/2405.19818","citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:5d78eaa424f3bb8f4b279fd21cedfdfa24f94bdf0fced03f45ef5fd9a923dc8e","observation_id":"321d7609-2b05-4dc8-910f-3087262260bf","resolution":{"observed_at":"2026-08-12T14:09:18.328043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.587702Z","title":"One-stream stepwise decreas- ing for vision-language tracking","venue":null,"work_id":"38ea65dc-7bfc-4761-b586-c144d7117ea2","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.332954Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:38168929ad5d15d714e40f2d0cb1458c1423dcde11f935cea8e29b00c3ecfd61","observation_id":"f272e89d-847a-428a-aaf2-23a903f1fd8c","resolution":{"observed_at":"2026-08-12T14:09:18.592456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.569705Z","title":"One-stream vision-language memory network for object tracking","venue":null,"work_id":"396dc43a-a03f-4275-b6ae-843dab962369","year":2023},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.337812Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:377f4a7dead0d5f4048d1c30756550a031c007b53cabf226fb3c79d379827245","observation_id":"0bd97540-232a-47df-a677-5d2e0d843ae6","resolution":{"observed_at":"2026-08-12T14:09:18.575460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.553267Z","title":"Transformer vision-language tracking via proxy token guided cross-modal fusion","venue":null,"work_id":"c8c52337-0e8a-4e97-a2bb-8852933f8b40","year":2023},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.342232Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:9b61e15506414520de18a1fbeee7ffbabbdbea5ea58ac63b76f620a7577b3ef0","observation_id":"0b10906b-48cd-4c07-9e97-30d1c1fd858d","resolution":{"observed_at":"2026-08-12T14:09:18.558743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.537746Z","title":"Towards unified token learn- ing for vision-language tracking","venue":null,"work_id":"8c25d593-0403-490a-a26d-dffc0a802324","year":2023},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.347565Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:8386d3c28a46d094f72ffd130bbbfa781f68779feb7ac82a85e3bf16d67177e1","observation_id":"7a4a8d23-6730-4448-af42-86aa5cfd59a4","resolution":{"observed_at":"2026-08-12T14:09:18.542702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.521756Z","title":"Odtrack: Online dense temporal token learning for visual tracking","venue":null,"work_id":"c785075a-b6fa-4d2b-9e96-cb25ad07c855","year":2024},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.352182Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:17acfa8b2ddb41d912179c613b1b60ffeec66c270d9a94007f5cd54f3dcaf49f","observation_id":"f05b2deb-bb77-45d7-b166-5feaa4c7c507","resolution":{"observed_at":"2026-08-12T14:09:18.526689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:09:18.506688Z","title":"Joint vi- sual grounding and tracking with natural language specifica- tion","venue":null,"work_id":"7fcb415f-d88e-4cb2-9967-6643247b4d8f","year":null},"citing_paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:09:18.356984Z"},"links":{"citing_paper":"/paper/2411.15600"},"observation_digest":"sha256:8a2dbda08d863768fe4dc95b10db0929961ebb45213b9330011e8ec245de8367","observation_id":"047e5346-a73f-4ae6-b1fe-3a345f869610","resolution":{"observed_at":"2026-08-12T14:09:18.511244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15600","last_updated":"2024-11-23T16:31:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T20:47:31.563476Z","submitted_at":"2024-11-23T16:31:40Z","title":"How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 4 inbound Pith citation observations for arXiv:2411.15600."}