{"as_of":"2026-08-10T04:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:650d1c086e5a5da80b3da0de22ae1a3aa8095523a6a1a321e60a7c0f99dc95de","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:01:38.486514Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:20:07.965249Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T15:20:13.646436Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"cited_work":{"arxiv_id":"2502.06583","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06583","snapshot_observed_at":"2026-08-06T15:20:13.646436Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","venue":"cs.CV","work_id":"e4425109-f42b-446b-a14e-231c5ecf1748","year":2025},"citing_paper":{"arxiv_id":"2507.16191","last_updated":"2025-08-20T02:43:14Z","snapshot_observed_at":"2026-08-09T20:26:19.384761Z","submitted_at":"2025-07-22T03:07:50Z","title":"Explicit Context Reasoning with Supervision for Visual Tracking","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:20:07.965249Z"},"links":{"cited_paper":"/paper/2502.06583","citing_paper":"/paper/2507.16191"},"observation_digest":"sha256:0cdf316c07ac1e0ffd34be2700b9cb8b9c2189e19089f745729f2b40c6b140de","observation_id":"16c70ea3-faff-4ac1-8bd3-9e1cdca7e96a","resolution":{"observed_at":"2026-08-06T15:20:13.728895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06583/citation-record","integrity":"/paper/2502.06583/integrity","json":"/paper/2502.06583/citation-record.json","paper":"/paper/2502.06583"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.192381Z","title":"Backbone is all your need: A simplified architecture for visual object tracking,","venue":null,"work_id":"a8b2c4a6-4480-4884-84b2-98db49934c2f","year":2022},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.256848Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:309910618ed6bce6fb47d7d35251f5de1ba97d99ae8d0d80a2b0755acf01baa6","observation_id":"ae2b2bb3-95cb-4da3-8082-80449fcb96cb","resolution":{"observed_at":"2026-08-08T15:01:39.195544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.182437Z","title":"Mixformer: End-to-end tracking with iterative mixed attention,","venue":null,"work_id":"8cb599d4-21a6-4ae6-bb1a-e3b740bec086","year":2022},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.261223Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:7fe7c0db35463f4867e943b3adafa4dba72453d3b451d1f3dfe459901143da8e","observation_id":"6d37118a-2ee4-416a-bb42-55bddf870ca2","resolution":{"observed_at":"2026-08-08T15:01:39.186036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.173238Z","title":"Joint feature learning and relation modeling for tracking: A one-stream framework,","venue":null,"work_id":"ccff7b4c-ed59-4eff-a471-b7a116b1c1d1","year":2022},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.264760Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:84fe734c42192c51b56a1e970f42f813bca94acdcea76242885da00d831b0f04","observation_id":"774a935a-5458-49a9-9a30-c8e726e2e8e1","resolution":{"observed_at":"2026-08-08T15:01:39.176512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.163238Z","title":"Seqtrack: Sequence to sequence learning for visual object tracking,","venue":null,"work_id":"453fef28-8b0e-41cc-8d9e-1148f46f7a08","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.268681Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:a0eb1cb62b7a8b2547b05874886ea914ad109d572644f4d8e8216b4299e91a30","observation_id":"c616e41c-04eb-485c-b31e-aaf76c4797ad","resolution":{"observed_at":"2026-08-08T15:01:39.166811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.152751Z","title":"Swintrack: A simple and strong baseline for transformer tracking,","venue":null,"work_id":"2cd308eb-1e1a-4071-82a1-b3329be1d328","year":2022},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.272577Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:513a619a651b4e6a4c01b682616d29daeb4d1cd63052debf9e2bcefee19a6831","observation_id":"c4057e42-c032-4133-9eea-38776be93d97","resolution":{"observed_at":"2026-08-08T15:01:39.156677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.142806Z","title":"Autoregressive visual tracking,","venue":null,"work_id":"674cac00-710e-4957-ac56-d44663da86a3","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.276091Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:8e74725f29c0f54c00133159abb7e1705cfbf08c8f242da04cd3b9f17ddcf9d2","observation_id":"f78f198c-5177-40cb-8af0-a877820e7249","resolution":{"observed_at":"2026-08-08T15:01:39.146390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.132376Z","title":"Visual prompt multi- modal tracking,","venue":null,"work_id":"d4be57bd-3e22-4e65-a21f-7375fffa5f8f","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.280162Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:da6e7300f5c43e26de6d031279cc3d2bef0ce1dc78c1aaf31ab08df99ee09165","observation_id":"8108e1d3-9c7a-4079-b285-da49a945e1df","resolution":{"observed_at":"2026-08-08T15:01:39.136277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15851","last_updated":"2024-03-29T12:25:45Z","snapshot_observed_at":"2026-07-06T16:53:05.949503Z","submitted_at":"2023-11-27T14:17:41Z","title":"Single-Model and Any-Modality for Video Object Tracking","version":3},"cited_work":{"arxiv_id":"2311.15851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15851","snapshot_observed_at":"2026-08-08T15:01:38.660488Z","title":"Single-Model and Any-Modality for Video Object Tracking","venue":"cs.CV","work_id":"212e6704-7bae-4066-b4f0-2fcb17ded0c3","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.284479Z"},"links":{"cited_paper":"/paper/2311.15851","citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:72c170ba1e00f40f2a9183e0e6afd98a5c55af7188fb4c40b315781e7bb4340c","observation_id":"f1e2e9a1-1af7-4cef-ac7c-22d2c45659a9","resolution":{"observed_at":"2026-08-08T15:01:38.664936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13611","last_updated":"2024-12-18T08:37:22Z","snapshot_observed_at":"2026-07-06T20:09:05.798010Z","submitted_at":"2024-12-18T08:37:22Z","title":"Robust Tracking via Mamba-based Context-aware Token Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13611","snapshot_observed_at":"2026-08-08T15:01:38.289301Z","title":"Robust tracking via mamba-based context-aware token learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.289301Z"},"links":{"cited_paper":"/paper/2412.13611","citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:6cac43b634a9f0417c82b62fb5ec2df76605c4d53c2866f9b258eedb22a87fc1","observation_id":"e60ec162-1789-4f98-bd54-6dded71c3a08","resolution":{"observed_at":"2026-08-08T15:01:38.289301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15691","last_updated":"2024-12-20T09:10:17Z","snapshot_observed_at":"2026-07-06T20:10:46.746601Z","submitted_at":"2024-12-20T09:10:17Z","title":"Exploiting Multimodal Spatial-temporal Patterns for Video Object Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15691","snapshot_observed_at":"2026-08-08T15:01:38.293522Z","title":"Exploiting multimodal spatial-temporal patterns for video object tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.293522Z"},"links":{"cited_paper":"/paper/2412.15691","citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:0a9ce68211025c960a8955cc508e7870e33aeb3a130bd121f4d2ea3977759fac","observation_id":"dd84f229-f4bd-42ef-aead-49efbf9852fd","resolution":{"observed_at":"2026-08-08T15:01:38.293522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.121344Z","title":"Curricular contrastive regularization for physics-aware single image dehazing,","venue":null,"work_id":"71950ac4-f995-4164-93c5-569254c49fb6","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.297829Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:c5128d2f1ab93aabbc6564f8336e2dc1fe3884da52a5140c9b2afce3f967d550","observation_id":"58b423eb-40aa-447b-b708-d7faf8ac53cf","resolution":{"observed_at":"2026-08-08T15:01:39.125360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.110985Z","title":"Dynamic group difference coding based on thermal infrared face image for fever screening,","venue":null,"work_id":"15e8a7b8-6a4c-495e-b254-39c107cd809a","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.301951Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:352a6345c31aa0e2fcca8004cbc7fb9529d6d259ca39d1ebf30c3acb744745c8","observation_id":"3127b424-4be4-4df1-a08f-b3163a397d14","resolution":{"observed_at":"2026-08-08T15:01:39.114649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.100653Z","title":"Few-shot learning with long- tailed labels,","venue":null,"work_id":"9d8f0919-2585-4f7b-aad1-8474ecba34d0","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.305685Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:b16593cf88d433a181692c179f7eefee94ed474466432b8ad23071aa35f00ae0","observation_id":"3abafafd-98ca-473b-8504-fccd1ef64521","resolution":{"observed_at":"2026-08-08T15:01:39.104340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.090048Z","title":"SHaRPose: Sparse High-Resolution Representation for Human Pose Estimation,","venue":null,"work_id":"114179f8-8ead-48f4-820c-93ae9b2aa1e1","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.309654Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:87b15b8df43ec2e95b5b49fff1add445fa2c41ec56b5af34a2110f919358f9e1","observation_id":"a59b6c1b-ce2c-4e4d-8279-c96f6390d2eb","resolution":{"observed_at":"2026-08-08T15:01:39.093728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.079888Z","title":"An emotion recognition method based on eye movement and audiovisual features in mooc learning environment,","venue":null,"work_id":"5f6be2d2-e616-4fbf-8f76-8e2c311c258d","year":2022},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.313467Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:c65e6970d13f0fe2119d2343528fd8a0e46312c361ca065dc3ea8f0007ab843a","observation_id":"ec604d4e-9319-411b-95c1-ff689e4564bf","resolution":{"observed_at":"2026-08-08T15:01:39.083502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.068552Z","title":"3d- guided multi-feature semantic enhancement network for person re-id,","venue":null,"work_id":"9f8f8441-4561-447f-96b6-bac07dbd252e","year":2025},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.317387Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:9c35d764d4e2e532507da16ec85687e02df53d5c077d5d2940dbdf5add8b64bd","observation_id":"8c5c0319-ada0-4e34-926c-275af4dc4392","resolution":{"observed_at":"2026-08-08T15:01:39.072896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.057827Z","title":"Multi-branch enhanced discriminative network for vehicle re-identification,","venue":null,"work_id":"82975163-a941-4fa3-963a-0f6b7f0b829b","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.321291Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:bd86d29fcaeeab5f705fd48bca54fbd3f63626bec2271fdd2eabb74600e7f117","observation_id":"8bc50acc-e8fb-43fc-99a0-b31dba64f507","resolution":{"observed_at":"2026-08-08T15:01:39.061548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17496","last_updated":"2024-12-24T14:18:19Z","snapshot_observed_at":"2026-08-03T22:30:45.570791Z","submitted_at":"2024-12-23T11:53:06Z","title":"Guided Real Image Dehazing using YCbCr Color Space","version":2},"cited_work":{"arxiv_id":"2412.17496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.17496","snapshot_observed_at":"2026-08-08T15:01:38.622404Z","title":"Guided Real Image Dehazing using YCbCr Color Space","venue":"cs.CV","work_id":"fdc19dc6-73e8-4a9b-a07d-7d54d1ae5895","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.325098Z"},"links":{"cited_paper":"/paper/2412.17496","citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:2b7d0b8841f9d0926c23e57df53ed6d7b406a6ac428dfddddcc6ad56dae33e1d","observation_id":"75e1fd3c-61ea-4eff-8542-49ef97f0067d","resolution":{"observed_at":"2026-08-08T15:01:38.626079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09634","last_updated":"2024-03-14T17:59:13Z","snapshot_observed_at":"2026-08-01T16:54:01.421582Z","submitted_at":"2024-03-14T17:59:13Z","title":"OneTracker: Unifying Visual Object Tracking with Foundation Models and Efficient Tuning","version":1},"cited_work":{"arxiv_id":"2403.09634","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09634","snapshot_observed_at":"2026-08-08T15:01:38.608315Z","title":"OneTracker: Unifying Visual Object Tracking with Foundation Models and Efficient Tuning","venue":"cs.CV","work_id":"f6c1fed9-42a1-408e-9a37-e404b4a8ef82","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.329265Z"},"links":{"cited_paper":"/paper/2403.09634","citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:6f2a6972059c2cec4c2286486209c85344a5fe49eb8df1fca13a427ad083ba3b","observation_id":"b0a3ff3b-19c4-438f-97ed-c9fe611ac37c","resolution":{"observed_at":"2026-08-08T15:01:38.612183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.046995Z","title":"Prompting for multi-modal tracking,","venue":null,"work_id":"ac8e3e77-cba1-4f43-b0bc-1d26b234281d","year":2022},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.333793Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:04a84116f81c7c315fa61e13ad3d6b235ebbb7a900e02af2e823b7305c6ccb5b","observation_id":"b4afefca-df2a-48da-983e-0f1579b8a5fa","resolution":{"observed_at":"2026-08-08T15:01:39.050806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16002","last_updated":"2024-03-28T03:22:52Z","snapshot_observed_at":"2026-07-06T17:49:36.858294Z","submitted_at":"2024-03-24T04:15:50Z","title":"SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking","version":2},"cited_work":{"arxiv_id":"2403.16002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.16002","snapshot_observed_at":"2026-08-08T15:01:38.592233Z","title":"SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking","venue":"cs.CV","work_id":"706ff536-cddd-4357-9e8a-3758f764aec9","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.338768Z"},"links":{"cited_paper":"/paper/2403.16002","citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:a7518ad1f685764a1b8e2d6a9fb3b0f62fbe5102e022e427f0d80a8aed9a85ff","observation_id":"586c5bbc-acf0-469d-a51b-dce848553d4e","resolution":{"observed_at":"2026-08-08T15:01:38.596444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.036965Z","title":"Bridging search region interaction with template for RGB-T tracking,","venue":null,"work_id":"c25182ef-d5c0-4673-925e-f470173394fd","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.343304Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:68d19ea37247805e2f3859c9cca754f6a4ec224044fec483d1849ceb10ccb330","observation_id":"2bc63b7a-a1ee-4a72-9de5-d6e6fbe98bda","resolution":{"observed_at":"2026-08-08T15:01:39.040569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.026880Z","title":"Bi-directional adapter for multi- modal tracking,","venue":null,"work_id":"e47ad9d1-d64b-4acb-8afe-6b76f5b84ee3","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.347554Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:a39b10cc0a042e3f4d552d010b4cb9960354938bef4bec540d78bad43bacb6a7","observation_id":"796e2777-6c9d-4570-bfd0-15090e63e4a1","resolution":{"observed_at":"2026-08-08T15:01:39.029978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.017416Z","title":"Spiking transformers for event-based single object tracking,","venue":null,"work_id":"02947071-5f37-48a2-a3a6-ceede9a5e97c","year":2022},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.351534Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:f1c1dcfd6f87d6bcf682942f370234625fb84d352fecc4e48a87738abc66b298","observation_id":"3ea5e07d-5d7e-4700-92e8-a06ce244ce02","resolution":{"observed_at":"2026-08-08T15:01:39.020710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:39.005642Z","title":"Lasot: A high-quality benchmark for large-scale single object tracking,","venue":null,"work_id":"305b13a4-60e4-46a8-b649-c5a0cfbda49c","year":2019},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.355559Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:26205bc97d4f6eafd6365b09d20547cc9f5cec1dc260d644b83239818cb5eb20","observation_id":"8b1f559c-8ee2-4d90-bea0-50eae7c83025","resolution":{"observed_at":"2026-08-08T15:01:39.009603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.994383Z","title":"Got-10k: A large high-diversity benchmark for generic object tracking in the wild,","venue":null,"work_id":"c2c79c28-4376-47a7-9269-1afa17bda7cd","year":2021},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.359442Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:17bab86ae463c39c5879a7a4de69060d452240ccfcd3f4607d2ec86d69eb1a24","observation_id":"c3d2d9ec-e421-4119-b0ba-26dbeb35d237","resolution":{"observed_at":"2026-08-08T15:01:38.998252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.981816Z","title":"Trackingnet: A large-scale dataset and benchmark for object tracking in the wild,","venue":null,"work_id":"a7b5a441-928e-4c2c-a2af-82d6e75dc37a","year":2018},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.363352Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:94d1bb137ead4e771d0b3d4c62e3a5a4a10065ccf5877099754868f1d62ef794","observation_id":"194a8d21-c048-4cd1-8f62-cf8c9c9d92f2","resolution":{"observed_at":"2026-08-08T15:01:38.986870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.969685Z","title":"Lasher: A large-scale high-diversity benchmark for RGBT tracking,","venue":null,"work_id":"514c2776-b49a-47e8-aa8e-f17ee86439f8","year":2022},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.367242Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:12e344ae030ec914234ef35205c59e0551e172fb1bbaca8b716944e354d38b47","observation_id":"a73088f9-0cc1-41ce-8626-4b00a8f9b49c","resolution":{"observed_at":"2026-08-08T15:01:38.973857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.957476Z","title":"RGB-T object tracking: Benchmark and baseline,","venue":null,"work_id":"3adb8ed7-aef2-44ec-9503-826a9650e6cd","year":2019},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.371104Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:aac4043b5c25cb27d941e8e7fe1be4ee54a5241cfd0ff01d4e1b05e55ad3fb88","observation_id":"96f5ea52-3207-43f2-8308-3c3de07a75ce","resolution":{"observed_at":"2026-08-08T15:01:38.961719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.945160Z","title":"Depthtrack: Unveiling the power of rgbd tracking,","venue":null,"work_id":"78d0d17b-4579-48b2-85ef-049ad369fe23","year":2021},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.374858Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:a253043b3f64a85cadb34e7ac4f446750cb43810ad90e2263c8378764b7d73d4","observation_id":"ab07304f-7740-4ad3-ab8b-7ecb33720098","resolution":{"observed_at":"2026-08-08T15:01:38.949221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.932542Z","title":"The visual object tracking vot2015 challenge results,","venue":null,"work_id":"593f536c-5d35-4c11-8d2d-72a6f8e353cb","year":2015},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.378540Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:644f0984b68444a6fd405ba69c027a007ad2148cee9135271b35b79b64f0db14","observation_id":"3aa9dbad-8a55-40b9-93fd-6f09d8839568","resolution":{"observed_at":"2026-08-08T15:01:38.936593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.920316Z","title":"Visevent: Reliable object tracking via collaboration of frame and event flows,","venue":null,"work_id":"a43a1a39-7a91-4110-8b1b-80e6a600be18","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.382631Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:1dfdd002fa51d3d1b526cf9ff4a80b16ff995d664309d4e69bc85d1f02974a9d","observation_id":"88f7be3a-626a-4d16-8af3-b4b9962248e6","resolution":{"observed_at":"2026-08-08T15:01:38.924562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.386671Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.386671Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:9a9f089ea9329c130d97975fec8aebc105b0a00991d319e2d117c94837cb2500","observation_id":"6115b44c-0ead-413f-9f68-3ca71ac655d3","resolution":{"observed_at":"2026-08-08T15:01:38.386671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.900463Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"9293a9b2-3b9b-4366-be2e-9aab18b12619","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.390455Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:4e6bae41e5017ce47eb63e40b720c8baafd57da89a91357f5383f2dd090e647c","observation_id":"59d77813-4c96-4129-8b07-9a6faae8009e","resolution":{"observed_at":"2026-08-08T15:01:38.904614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14320","last_updated":"2023-09-25T17:45:31Z","snapshot_observed_at":"2026-08-09T18:28:42.728459Z","submitted_at":"2023-09-25T17:45:31Z","title":"MUTEX: Learning Unified Policies from Multimodal Task Specifications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14320","snapshot_observed_at":"2026-08-08T15:01:38.393426Z","title":"Mutex: Learning uni- fied policies from multimodal task specifications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.393426Z"},"links":{"cited_paper":"/paper/2309.14320","citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:acddc198466ba5af0f3585ecaf654c58d86601b96992920657a07eb6ac291827","observation_id":"a63fec7a-da80-4305-abd7-d572bb5a9d0d","resolution":{"observed_at":"2026-08-08T15:01:38.393426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19638","last_updated":"2024-03-28T17:52:24Z","snapshot_observed_at":"2026-08-08T06:06:44.152320Z","submitted_at":"2024-03-28T17:52:24Z","title":"Siamese Vision Transformers are Scalable Audio-visual Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19638","snapshot_observed_at":"2026-08-08T15:01:38.397539Z","title":"Siamese vision transformers are scalable audio-visual learners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.397539Z"},"links":{"cited_paper":"/paper/2403.19638","citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:053b240a09b4130c079a2c4d5249aac76f1224ca122abe0a86b6247685d354f1","observation_id":"766d9f0a-ffd3-4334-8fdf-9469ea52f920","resolution":{"observed_at":"2026-08-08T15:01:38.397539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.886460Z","title":"A unified audio-visual learning framework for localization, separation, and recognition,","venue":null,"work_id":"53f66744-8075-45f4-a579-6bd29e9ef479","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.401184Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:194317b0774859b41d00017d129323e93ce5f7fd7afd5a43d9454d15d6d0a2f2","observation_id":"f2bfc63a-4f65-4813-bcf2-2e19670f1d95","resolution":{"observed_at":"2026-08-08T15:01:38.891981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.873918Z","title":"Learning visual representation from modality-shared contrastive language-image pre-training,","venue":null,"work_id":"abac684c-357b-4a0e-8153-f7b53ded6e4d","year":2022},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.404589Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:19dfff51c36b9ad1a52f5ccb77bfc05da30906917486a95bf3db70a2396a5d04","observation_id":"0c1a4fa6-a92c-4773-85e1-692bb4cdda91","resolution":{"observed_at":"2026-08-08T15:01:38.878140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.862077Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"26f88b49-c2e6-4719-93ff-aab9e01a28ee","year":2018},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.407603Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:f3af216ba270a0dc71e20769b5042691b7c12569ab248917c38c9ce4179d8bac","observation_id":"cdfd3f0b-d730-4075-b0d0-e834ec74cfb6","resolution":{"observed_at":"2026-08-08T15:01:38.866174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.851722Z","title":"Weighted sparse representa- tion regularized graph learning for rgb-t object tracking,","venue":null,"work_id":"8fa3a7bc-207d-488a-b5e2-a4f71ea4f6a9","year":2017},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.410684Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:5e8889a490da27683461878ae511308e95fb660f651c44a681d6be6f77979a34","observation_id":"5942d894-1489-408f-988d-916e45a4d3db","resolution":{"observed_at":"2026-08-08T15:01:38.855104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.841784Z","title":"Generative-based fusion mechanism for multi-modal tracking,","venue":null,"work_id":"7a661e36-23eb-45a5-81b1-eed18f8da1b7","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.413706Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:35ab92cd7152873b384c58b4a9b55c7b8280c368843a22c99196a74c3256d37c","observation_id":"0371c9fe-b5e7-4fc6-856f-357ab1008aa2","resolution":{"observed_at":"2026-08-08T15:01:38.845254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.832067Z","title":"Transformer tracking,","venue":null,"work_id":"c562273d-ec81-4fb4-a576-a95dbcab9bb9","year":2021},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.416861Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:b51a16f73f588b62f6ac7a29182d410f0092f4291412546f24f9c4bc050a0d28","observation_id":"59dbba3c-c935-4ac3-b145-53800b2d829f","resolution":{"observed_at":"2026-08-08T15:01:38.835252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.420525Z","title":"Learning spatio-temporal transformer for visual tracking,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.420525Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:e088b73084297fb13d4e9ad5dd36a0e194912abae66c287b2fbda954c94af3cb","observation_id":"e0c0914f-3e9b-45e1-8846-ba04d4acff3b","resolution":{"observed_at":"2026-08-08T15:01:38.420525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.424619Z","title":"Aiatrack: Attention in attention for transformer visual tracking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.424619Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:f31819bd8c7932f6d1c208f628ec37b55f2a2c2e031db4b91490b9fee7933568","observation_id":"e4ff1443-2a31-4fbf-be4a-4dacc6dfc7e1","resolution":{"observed_at":"2026-08-08T15:01:38.424619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.808276Z","title":"Rgbd1k: A large-scale dataset and benchmark for rgb-d object tracking,","venue":null,"work_id":"3345e2f3-3fb5-4931-bb8f-845cb75bcb48","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.428469Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:c63b18b7c8146ef41942a56790e0634610b57e89ee2426165cedb1aab0de4d6f","observation_id":"8e89baee-71c9-431c-8944-3a5acd28a9be","resolution":{"observed_at":"2026-08-08T15:01:38.812467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.432244Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.432244Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:31618c5ddd9612662477ca8402d77474e3d17cb71c37d6b14399714f832191d6","observation_id":"b0677cfa-d238-45bc-aacf-7fea2b8c6926","resolution":{"observed_at":"2026-08-08T15:01:38.432244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.790046Z","title":"Generalized intersection over union: A metric and a loss for bounding box regression,","venue":null,"work_id":"54101c56-d2c6-4940-b17f-b5707e56b4d2","year":2019},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.436214Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:a03a5012b9d21064cf4decd89c56c7501b114cc01bf8e5211891ad9a59425108","observation_id":"823456f3-4507-4856-9a7e-96e38f8ab8fb","resolution":{"observed_at":"2026-08-08T15:01:38.794074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.778170Z","title":"Depthtrack: Unveiling the power of RGBD tracking,","venue":null,"work_id":"d00f3b07-7f40-4a86-a94d-a3b91859d394","year":2021},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.440102Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:ad489fa7961a7d6e248ff0658efebf5695f53aa8943fa3d89afe3664c89530be","observation_id":"daa29079-8457-4bd8-9f6c-50806d158431","resolution":{"observed_at":"2026-08-08T15:01:38.782160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.766407Z","title":"Transformer tracking via frequency fusion,","venue":null,"work_id":"5da69cd2-e436-4b38-80a4-aaa3e1927152","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.443660Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:7de31f70aa8fc7e90bbd99cb626be1b0a7d29c880b8860d2dd3e8acfb34fe265","observation_id":"d5690a09-d456-4f20-ab09-aecd738e4914","resolution":{"observed_at":"2026-08-08T15:01:38.770507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.754573Z","title":"Multiple source domain adaptation for multiple object tracking in satellite video,","venue":null,"work_id":"f5c9b05f-283f-4ce5-8872-ada757c8ce76","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.447390Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:4b280e97eeaf6b03c889deb3a1a97c5be837607e2bb7406ccead50ab46f18d06","observation_id":"33dce51f-e2f7-4125-a47a-ad004815f6a1","resolution":{"observed_at":"2026-08-08T15:01:38.758488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.743277Z","title":"Explicit visual prompts for visual object tracking,","venue":null,"work_id":"6d468ee5-3792-4dc5-8336-d21391b17e90","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.451209Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:3ba0c2a16c57e395068839d4f86e150e59f7f5fd2d012cbd2e4a783607d54e9f","observation_id":"7dd02a68-a0b1-451a-9eea-7850cf970597","resolution":{"observed_at":"2026-08-08T15:01:38.747050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.455226Z","title":"Autoregressive queries for adaptive tracking with spatio-temporal trans- formers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.455226Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:ad9af7b296fe4abaad43f2e7753c79207c0f06983a49194ba0c2be572dfd78a8","observation_id":"6b9fe4db-d580-487f-96d2-73ff40e0dd65","resolution":{"observed_at":"2026-08-08T15:01:38.455226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.722192Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"cb23bbff-c6f0-44a9-92ce-5e2c7b0c783b","year":2021},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.458954Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:a51a1472c9e778dfd7b9202f52b872e6014c4ba2c79940a84aba3fb68dbfc939","observation_id":"fcdd4def-e275-4da9-9e85-5a9eeb715089","resolution":{"observed_at":"2026-08-08T15:01:38.726920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.709951Z","title":"Towards modalities correlation for rgb-t tracking,","venue":null,"work_id":"843edb22-01b2-4937-90d4-2423e0db7842","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.462662Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:0ef39380a20dace9970981f64ff5e2963ee193dd34e6076a4b1e45b70a298756","observation_id":"83c21fd7-bdef-41bb-8554-d16961611ed2","resolution":{"observed_at":"2026-08-08T15:01:38.713885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.698110Z","title":"RGBD1K: A large-scale dataset and benchmark for RGB-D object tracking,","venue":null,"work_id":"3755067c-dc7c-4704-8b9d-ada2453db690","year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.466373Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:0fa7e722e9a6e932c899a9eb14d1571b1c3fffbf63022b6f526115acfb292514","observation_id":"d9553625-d158-4c93-a018-9920580c311d","resolution":{"observed_at":"2026-08-08T15:01:38.702132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.685901Z","title":"Siamban: Target-aware tracking with siamese box adaptive network,","venue":null,"work_id":"52978908-73c3-4667-965b-18c9291e439c","year":2022},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.470170Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:b54a233ca5160b6559452ea9b244f043c707e8280cf66a7600d1d55a5818a890","observation_id":"64227ba3-8b07-4445-96dc-68280b42ce2f","resolution":{"observed_at":"2026-08-08T15:01:38.689883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17903","last_updated":"2024-05-28T07:24:56Z","snapshot_observed_at":"2026-08-05T16:58:30.709024Z","submitted_at":"2024-05-28T07:24:56Z","title":"Reliable Object Tracking by Multimodal Hybrid Feature Extraction and Transformer-Based Fusion","version":1},"cited_work":{"arxiv_id":"2405.17903","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17903","snapshot_observed_at":"2026-08-08T15:01:38.553210Z","title":"Reliable Object Tracking by Multimodal Hybrid Feature Extraction and Transformer-Based Fusion","venue":"cs.CV","work_id":"0246fc79-866a-4920-bffd-439d50334f52","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.473979Z"},"links":{"cited_paper":"/paper/2405.17903","citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:2817150010ccc27fadd613a2726d7f3ce21a6dc8d947c28e2239e2be86ec5067","observation_id":"f0f4888b-998b-4d60-ac2b-34faa6667c2a","resolution":{"observed_at":"2026-08-08T15:01:38.557849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:01:38.673273Z","title":"Depthrefiner: Adapting rgb trackers to rgbd scenes via depth-fused refinement,","venue":null,"work_id":"a13c7b02-498d-4f90-a1de-bfc6076543b9","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.478408Z"},"links":{"citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:bc967e10357574affdff203746d9540ca10d061ab2444636ab3cef52532cfacc","observation_id":"63703f02-2ee1-466c-a648-9804ce6f755a","resolution":{"observed_at":"2026-08-08T15:01:38.677307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02222","last_updated":"2024-08-05T03:54:40Z","snapshot_observed_at":"2026-08-03T18:37:59.781297Z","submitted_at":"2024-08-05T03:54:40Z","title":"Cross-modulated Attention Transformer for RGBT Tracking","version":1},"cited_work":{"arxiv_id":"2408.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02222","snapshot_observed_at":"2026-08-08T15:01:38.532462Z","title":"Cross-modulated Attention Transformer for RGBT Tracking","venue":"cs.CV","work_id":"28838fd8-307c-45c3-b879-eb24a8e03b74","year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.482277Z"},"links":{"cited_paper":"/paper/2408.02222","citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:00b8c57065e529c4b1f666ee066665524423ef9e2390fbf382a78fe0c1f4f58b","observation_id":"1ab43ecb-3c4d-4d1e-b0cb-799a3e344e0e","resolution":{"observed_at":"2026-08-08T15:01:38.539120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08827","last_updated":"2024-12-29T07:59:42Z","snapshot_observed_at":"2026-07-06T19:01:36.868186Z","submitted_at":"2024-08-16T16:22:34Z","title":"RGBT Tracking via All-layer Multimodal Interactions with Progressive Fusion Mamba","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08827","snapshot_observed_at":"2026-08-08T15:01:38.486514Z","title":"Rgbt tracking via all-layer multimodal interactions with progressive fusion mamba,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.486514Z"},"links":{"cited_paper":"/paper/2408.08827","citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:f1c0b2cccac3ffcdd949a75c7b21930af561c78123af065552eabca67c75e9ca","observation_id":"876085fb-394e-4348-8dda-c6647c7db7cc","resolution":{"observed_at":"2026-08-08T15:01:38.486514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":6,"verified_fuzzy":44},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2502.06583."}