{"as_of":"2026-08-22T11:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8ab38ec690ff5a5ada9dabaeb63ce8c209bba023f7713a7d7ef8ea64e0e1b4d","coverage":[{"denominator":106,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:11:15.127792Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19990/citation-record","integrity":"/paper/2505.19990/integrity","json":"/paper/2505.19990/citation-record.json","paper":"/paper/2505.19990"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:05.671157Z","title":"Tao: A large-scale bench- mark for tracking any object.European Conference on Computer Vision, pages 436–454, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:05.671157Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:d4a970a0963dcd88e91fdb77a7842dd30ae35ab428393af49222d7adad699ba4","observation_id":"b0c84543-f663-451a-b429-6ef9aff5b0e6","resolution":{"observed_at":"2026-08-07T14:11:05.671157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:05.728102Z","title":"Revisiting neural scaling laws in language and vi- sion.Advances in Neural Information Processing Systems, 35:22300–22312, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:05.728102Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:0e20daeeaad4b641866e987c7de0e41603795835f8ef23cb51984654feb18885","observation_id":"325a880c-0327-4032-a1a0-0350fcc62133","resolution":{"observed_at":"2026-08-07T14:11:05.728102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:05.785966Z","title":"Getting vit in shape: Scal- ing laws for compute-optimal model design.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:05.785966Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:afa0d08899a7a8378b06a7a6b5873be312282a7e93a6bb007877a40e1e833090","observation_id":"37ab9bb2-c3c5-4aac-9793-43432a617450","resolution":{"observed_at":"2026-08-07T14:11:05.785966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17133","last_updated":"2024-02-13T11:51:07Z","snapshot_observed_at":"2026-08-20T20:46:39.059075Z","submitted_at":"2023-12-28T17:08:11Z","title":"ARTrackV2: Prompting Autoregressive Tracker Where to Look and How to Describe","version":3},"cited_work":{"arxiv_id":"2312.17133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.17133","snapshot_observed_at":"2026-08-07T14:11:17.028369Z","title":"ARTrackV2: Prompting Autoregressive Tracker Where to Look and How to Describe","venue":"cs.CV","work_id":"c30c500b-7821-4dfc-aac4-a252de73f116","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:05.837761Z"},"links":{"cited_paper":"/paper/2312.17133","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:65305f41e76506194741f1901efa3853604492af59eccd68b9223491fb983b65","observation_id":"ab48a6d1-9b0e-424f-8a3d-5193a37fddb1","resolution":{"observed_at":"2026-08-07T14:11:17.061778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:05.901251Z","title":"Ar- trackv2: Prompting autoregressive tracker where to look and how to describe","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:05.901251Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:5973c8e662cc9d19c28e276da434faca36656fa618590327b091ca09f6cbba3b","observation_id":"85545810-1af6-436f-8d63-a35dea06a219","resolution":{"observed_at":"2026-08-07T14:11:05.901251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:05.961880Z","title":"Fully-convolutional siamese networks for object tracking","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:05.961880Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:57bdaf1fdcf1b0e53fb0a3377601b4a1f05ead825e887cf2b691dcd1811786c3","observation_id":"f7775140-9941-4576-bc16-2a3b4380a34f","resolution":{"observed_at":"2026-08-07T14:11:05.961880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.118001Z","title":"Learning discriminative model prediction for tracking","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.118001Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:6ffba3cc75344bc0b80e8351f07291b089873d82349159cc61d5d5dfcb4b6af7","observation_id":"e15b4302-9f8a-449c-9a9e-2588f135665a","resolution":{"observed_at":"2026-08-07T14:11:06.118001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.200784Z","title":"Visual object tracking using adaptive corre- lation filters","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.200784Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:1ebb8cf0653e1f0bc49c45944ad47be56e19a11b99fd0f4b4aa83bef7f205064","observation_id":"8573ed09-0f62-4d10-bf81-c26f0a6df091","resolution":{"observed_at":"2026-08-07T14:11:06.200784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T14:11:06.260989Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.260989Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:2b03364f4237b3a787880b4d7957459d6250462c8a9a756ebbad47be25253215","observation_id":"6fd7e908-e700-42a6-9460-e172aa2d65c8","resolution":{"observed_at":"2026-08-07T14:11:06.260989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.324897Z","title":"Smpler-x: Scaling up expressive human pose and shape estimation.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.324897Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:65a4001d5002e43eb8b49894f5cc3d4304102b1dd9459f44ffee8dce54885492","observation_id":"14c25b1f-eff0-4316-a75c-d2ad0b5e2a00","resolution":{"observed_at":"2026-08-07T14:11:06.324897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.380660Z","title":"Back- bone is all your need: A simplified architecture for visual object tracking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.380660Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:e0f84f6df48972765111059d6f2afff11f422da87269f97a88372d10b45f211c","observation_id":"e6424aee-b368-4e82-a185-e356dac8ee3d","resolution":{"observed_at":"2026-08-07T14:11:06.380660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.458349Z","title":"Deepdriving: Learning affordance for direct percep- tion in autonomous driving","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.458349Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:096cd12bfa1d0a8840f23a02da8be09c784fe60834721cd721e0c97145429976","observation_id":"439e4df4-3cd9-4a57-94c4-53ff4e097bda","resolution":{"observed_at":"2026-08-07T14:11:06.458349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.521868Z","title":"Transformer tracking","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.521868Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:37d05e7557ff9fcbc9df13dfbeb705533775ded57e4e22580d898ac5e456d0ef","observation_id":"fc2b4dc0-1c61-441e-b1e8-7de28fd4108c","resolution":{"observed_at":"2026-08-07T14:11:06.521868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.583095Z","title":"Seqtrack: Sequence to sequence learning for vi- sual object tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.583095Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:bb1ec98d8c884f5ed67b8dc69cc130f6a8d0288ca3881ac2c93287251e7801ce","observation_id":"2cba22f2-772d-4c8e-a7e9-35e767cb3052","resolution":{"observed_at":"2026-08-07T14:11:06.583095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.656905Z","title":"Siamese box adaptive network for visual tracking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.656905Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:8e346fde352751b3df8f17dcbca527cd1eafb8fbcd12296f3883c3dfd5e5b718","observation_id":"78620551-f482-4e15-877d-f41107e07b0e","resolution":{"observed_at":"2026-08-07T14:11:06.656905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.714740Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.714740Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:a5f010b727619151d8d9a17d6bde19db2262c73a9b0a1d3818a438dcc79ec4f2","observation_id":"e5bddf16-675f-42bd-a6a1-d04291b8d73d","resolution":{"observed_at":"2026-08-07T14:11:06.714740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.837921Z","title":"Mixformer: End-to-end tracking with iterative mixed atten- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.837921Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:8bed1e129000afd542a63c662dc1e51baecf8b571853880632aca81acb16bbc9","observation_id":"73975dcd-ae63-4411-8293-7b88be74023d","resolution":{"observed_at":"2026-08-07T14:11:06.837921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.937379Z","title":"Sportsmot: A large multi-object tracking dataset in multiple sports scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.937379Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:a6ed6702f82aa268353df86ae6afd415b1ccf2d31332f34726d46df238d6bad7","observation_id":"c55e1cdb-79a1-48f1-9990-f69ced688fc8","resolution":{"observed_at":"2026-08-07T14:11:06.937379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.011198Z","title":"Mixformerv2: Efficient fully transformer tracking.Ad- vances in Neural Information Processing Systems, 36,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.011198Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:a2c9a018bf76578b72e9ff614e87b8ef677add3f86f4d1b18630df404545cd42","observation_id":"ed58ac3a-73dd-4615-8484-8526574bc4e4","resolution":{"observed_at":"2026-08-07T14:11:07.011198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.116721Z","title":"High-performance long- term tracking with meta-updater","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.116721Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:6fd59ef3764ab1f15e9ae68d62201ca84c82b6045a5bfe4e6904087921dadd8d","observation_id":"828ed16f-3cdc-4a28-8c73-fe5ef0a63682","resolution":{"observed_at":"2026-08-07T14:11:07.116721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.218986Z","title":"Atom: Accurate tracking by overlap maximization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.218986Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:4f790b0a537dedca92b59e311c41c029e0d23291cb9a80fd8d7f5b6d2d7fe004","observation_id":"d6b075ac-a197-43cd-aa7d-bec7e95d1bba","resolution":{"observed_at":"2026-08-07T14:11:07.218986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.321335Z","title":"Scaling vision transformers to 22 billion pa- rameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.321335Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:1648e2aaeb3ad97b68552fc1a35f3d891356f25de214ca72aac4260aa9a36895","observation_id":"13def0ab-151d-4a2f-b5d0-838ca3d1b0c5","resolution":{"observed_at":"2026-08-07T14:11:07.321335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.09003","last_updated":"2020-03-19T20:08:24Z","snapshot_observed_at":"2026-08-10T18:10:19.092488Z","submitted_at":"2020-03-19T20:08:24Z","title":"MOT20: A benchmark for multi object tracking in crowded scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.09003","snapshot_observed_at":"2026-08-07T14:11:07.390614Z","title":"Mot20: A benchmark for multi object tracking in crowded scenes.arXiv preprint arXiv:2003.09003, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.390614Z"},"links":{"cited_paper":"/paper/2003.09003","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:423c5c5ac95187e9b0e9cc2ece1af5cf8462164afc1bd4d4d24ee3515f8b5c39","observation_id":"fb07304c-61c7-4a05-81e3-b8440489d16c","resolution":{"observed_at":"2026-08-07T14:11:07.390614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.477722Z","title":"Motchallenge: A benchmark for single- camera multiple target tracking.International Journal of Computer Vision, 129:845–881, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.477722Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:ed27fd0fc95bc0399ecc0f2158e4a454a4494d3f7203b87b3c74aa27863df3cb","observation_id":"7b4bcecd-2b5d-4e3f-a612-7e12e67ed092","resolution":{"observed_at":"2026-08-07T14:11:07.477722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.551199Z","title":"Mose: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.551199Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:98827664a42569f1667aa1e9d0145625646a3b1b914ff6182564c3773c717df6","observation_id":"f37dddb6-f352-4493-bd69-e456f5a3c4a5","resolution":{"observed_at":"2026-08-07T14:11:07.551199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T14:11:07.621557Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.621557Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:1d8467ef1db49a09cfc7bf4eb76bef27da12b88996cf531fec7b644053831e22","observation_id":"b17745da-39e5-40f1-960f-88236e737404","resolution":{"observed_at":"2026-08-07T14:11:07.621557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.710058Z","title":"The unmanned aerial vehicle benchmark: Ob- ject detection and tracking","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.710058Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:c3e83ade1598c4a234247d27b3c8b28c88f6913095de263acbaaf0df3c6e36f6","observation_id":"1f0e7ccf-6ad9-4a62-a1bb-3148bc3869a1","resolution":{"observed_at":"2026-08-07T14:11:07.710058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.783874Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.783874Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:d3b1e78e3ba01516804cf6daef26820d6a9e7d65d3f9fa8815ca058b3112573f","observation_id":"3fa62bd5-7f55-4de5-b289-1ac1368906f4","resolution":{"observed_at":"2026-08-07T14:11:07.783874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.904001Z","title":"Data determines distributional robustness in contrastive lan- guage image pre-training (clip)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.904001Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:bd6815215f8dcca623a26dca66556f06d45808b6a5f1bdcf52b656bfc0e62cd4","observation_id":"39aabe07-19c8-4993-8cc7-4629f148d016","resolution":{"observed_at":"2026-08-07T14:11:07.904001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18835","last_updated":"2023-11-30T18:59:51Z","snapshot_observed_at":"2026-08-19T15:53:43.246445Z","submitted_at":"2023-11-30T18:59:51Z","title":"InstructSeq: Unifying Vision Tasks with Instruction-conditioned Multi-modal Sequence Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18835","snapshot_observed_at":"2026-08-07T14:11:08.003956Z","title":"Instructseq: Unifying vision tasks with instruction- conditioned multi-modal sequence generation.arXiv preprint arXiv:2311.18835, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.003956Z"},"links":{"cited_paper":"/paper/2311.18835","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:98f56795e4148fceac60d59d9b4a32e22d87cb5c1bbf4628bbbb7a6f9e99e8a8","observation_id":"e1f29e1b-1d99-4539-ab8e-1bd3c5a34a20","resolution":{"observed_at":"2026-08-07T14:11:08.003956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:27.655798Z","title":"Gener- alized relation modeling for transformer tracking","venue":null,"work_id":"5cf594e5-4e5c-4557-bbf6-41b920c32541","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.074895Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:e806003e79867f62ed731c3f767d0fba8aff2a75958e08236aee1fd727f6c5ce","observation_id":"463ce8bb-58c2-4e39-970e-adcaf90e2ffe","resolution":{"observed_at":"2026-08-07T14:11:27.809220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:27.507864Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":"57c1cbe6-6d34-4414-8511-4f6db2dd7225","year":2012},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.178079Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:4bbede355383a07ed0a2d60b1bb940b33539a4ca7e0266a8d8371ac4b65bec28","observation_id":"5880ff38-302d-471a-a60d-699ebc55da1f","resolution":{"observed_at":"2026-08-07T14:11:27.565772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:27.381359Z","title":"Separable self and mixed attention transformers for efficient object track- ing","venue":null,"work_id":"cfc65e83-2a1d-4e40-9e1f-e6aa77488120","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.263792Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:04a5f55d9f82398acb1069aea373dc1b5379c435de6400ab50eb7ece8a00b50d","observation_id":"1ace0fba-e6e9-4e6b-b5f3-ae181f8d3c4b","resolution":{"observed_at":"2026-08-07T14:11:27.444923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:27.103346Z","title":"High-speed tracking with kernelized correlation filters.IEEE transactions on pattern analysis and machine intelligence, 37(3):583–596, 2014","venue":null,"work_id":"c2e92c8f-3b66-4a7e-bde5-99930b9e464e","year":2014},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.367001Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:fff3aee74024015cf26c33869b55fa941f1b9055b0c9586f92903a6228b4b0d7","observation_id":"69491299-1226-48a1-af28-76e63a5ec0a2","resolution":{"observed_at":"2026-08-07T14:11:27.244702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-14T02:46:56.838057Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-07T14:11:08.467790Z","title":"Deep learn- ing scaling is predictable, empirically.arXiv preprint arXiv:1712.00409, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.467790Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:f96e7601dc9ba2cb5c2b6b6db3d83a0d63e15baf1e9941175e9ba8e0e6548649","observation_id":"66be9cc3-e7fd-4dd5-8e72-e99dd2e25253","resolution":{"observed_at":"2026-08-07T14:11:08.467790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-21T02:12:10.329412Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T14:11:08.548933Z","title":"Training compute-optimal large language mod- els.arXiv preprint arXiv:2203.15556, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.548933Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:beba0ffa85c2e39b349058df7dd1026c65500071ce89b26ce61361aca1c9306d","observation_id":"f1020365-bcba-4fcf-a0c4-d6101b8a283c","resolution":{"observed_at":"2026-08-07T14:11:08.548933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-08-12T16:10:35.170069Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-07T14:11:08.621260Z","title":"Worldsense: Evaluating real-world omni- modal understanding for multimodal llms.arXiv preprint arXiv:2502.04326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.621260Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:586a3416c9fe03be6c4e8e741540325849770cb6cf5fb4851f6be7f92fa10691","observation_id":"1ec78105-c4c0-4cd0-843f-4b62eb2acb1b","resolution":{"observed_at":"2026-08-07T14:11:08.621260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17564","last_updated":"2025-06-28T08:38:59Z","snapshot_observed_at":"2026-08-21T19:26:10.484694Z","submitted_at":"2024-09-26T06:27:15Z","title":"General Compression Framework for Efficient Transformer Object Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17564","snapshot_observed_at":"2026-08-07T14:11:08.722019Z","title":"General compression framework for efficient transformer object tracking.arXiv preprint arXiv:2409.17564, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.722019Z"},"links":{"cited_paper":"/paper/2409.17564","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:2e3058602ff015254e217a23437187114d8e4dcf55ac514ce795a68fadc7f2c1","observation_id":"47caee20-2549-495e-9791-e205cde956ec","resolution":{"observed_at":"2026-08-07T14:11:08.722019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:26.896268Z","title":"Onetracker: Unifying visual object tracking with foundation models and efficient tuning","venue":null,"work_id":"fba352f0-5a6a-46eb-9bee-0bd1f44c5560","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.796852Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:fd2d01e08996d48ca67c5e626dc3afeabe031b5690608e235d8c8bf675eafcc0","observation_id":"99a4104d-73c1-473a-9175-7061c8e5b8a7","resolution":{"observed_at":"2026-08-07T14:11:26.994050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:26.790948Z","title":"Global instance tracking: Locating target more like hu- mans.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(1):576–592, 2022","venue":null,"work_id":"e7e204e6-f723-4ff8-b863-8fd19b6c25aa","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.843394Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:9eed9c471cecfc41f1f1a8f259e72668408c118c0324378cb72a6d9bc77447e9","observation_id":"2b0b0e74-f144-49ce-a464-8acc58e4c7e5","resolution":{"observed_at":"2026-08-07T14:11:26.835598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:26.667075Z","title":"Got-10k: A large high-diversity benchmark for generic object track- ing in the wild.IEEE transactions on pattern analysis and machine intelligence, 43(5):1562–1577, 2019","venue":null,"work_id":"ebf806f1-bd9b-4535-b8cf-987d11ba3d7b","year":2019},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.886428Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:5ca59295dad0a6bcb9d8aea92a8c2834a96f8b3d66b778ea78b725d2acf4fb07","observation_id":"fac914fa-d0d4-4ad5-9034-3319b0b77551","resolution":{"observed_at":"2026-08-07T14:11:26.718740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:26.548322Z","title":"Automatic foveation for video compression us- ing a neurobiological model of visual attention.IEEE trans- actions on image processing, 13(10):1304–1318, 2004","venue":null,"work_id":"f5ee2122-b77a-4f46-b83c-fac8ef43ac30","year":2004},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.937316Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:fb59dc894d1a79e872859315c5115f2a7d6eb3b61b909cde48474f08f5ff0a05","observation_id":"b5e034d3-d5fd-4746-a1cd-fcbd94eb42eb","resolution":{"observed_at":"2026-08-07T14:11:26.592445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:26.404701Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"206b7af6-8796-4d96-9e5b-04a50970d646","year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.983535Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:c66f635da02b46a5ffd7901d736ad58fe0d88bc9922e3dba5a0d1b4aae306cde","observation_id":"f4febe26-9316-4bcf-b31e-03cca17cfc57","resolution":{"observed_at":"2026-08-07T14:11:26.486789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:26.256545Z","title":"Exploring lightweight hierarchical vision transformers for efficient visual tracking","venue":null,"work_id":"4858e066-25f2-4dd6-9ca1-cc937a10a134","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.039466Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:ec0d932b89d51d65f5b5545f1f4e5ce9c2ff45779ba727ad171307dddb7f5d86","observation_id":"ca0d12e8-a484-4a23-9ffe-55126cf7b70f","resolution":{"observed_at":"2026-08-07T14:11:26.329962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T14:11:09.098348Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.098348Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:706ed2dedd6d2e150b863221a31986fab9ae3ca96e4a772e067cb6a04d4836d0","observation_id":"388594c3-ce0b-45fd-acc6-c1d918cc4409","resolution":{"observed_at":"2026-08-07T14:11:09.098348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:25.878698Z","title":"Big transfer (bit): General visual representation learning","venue":null,"work_id":"47082152-51a8-436e-82b2-a6d43c856659","year":2020},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.143091Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:20ff2d6b916f0fdd77550ac46728ef501ea9280228acc85203ccb67461a8ffc2","observation_id":"7a5896fd-6ce1-4d4d-994d-f5af05601251","resolution":{"observed_at":"2026-08-07T14:11:26.199747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:09.215204Z","title":"High performance visual tracking with siamese region pro- posal network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.215204Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:3180472eafb004443081b87e8d74ee7508de31158a2fa1cd66acfaa50ebabd77","observation_id":"a8422727-7309-4d8c-af1b-1c51e224e583","resolution":{"observed_at":"2026-08-07T14:11:09.215204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:24.495555Z","title":"Siamrpn++: Evolution of siamese vi- sual tracking with very deep networks","venue":null,"work_id":"2d011e3b-b33f-4de0-b73c-5c54ad5d6212","year":2019},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.281106Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:f342ab19c506e8a018176073176108829d1b5cfae77d93937eb7041778b947b3","observation_id":"1de2b632-910a-44b8-b048-7232cf44bfd4","resolution":{"observed_at":"2026-08-07T14:11:25.457948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:22.405571Z","title":"Lasher: A large-scale high-diversity benchmark for RGBT tracking.IEEE Trans- actions on Image Processing, 31:392–404, 2021","venue":null,"work_id":"e542071b-a069-427c-a7c3-6b58613810bd","year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.324431Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:3454e89c071b8f9e1889ab352ca7e63c1f9c213ebbd28f2212cb4b446901417e","observation_id":"2ab73e29-2745-4420-b7be-6cd9c38b8cda","resolution":{"observed_at":"2026-08-07T14:11:22.975617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:22.155209Z","title":"Tracking meets lora: Faster training, larger model, stronger performance","venue":null,"work_id":"48667459-ee11-43a9-b1a2-75facdd66585","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.365264Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:b140937c81fc02098d7ea1070b3e4201f71d2381343229b27abe78ee4560ddcd","observation_id":"581a6ceb-97a1-49f4-a78f-96f42e459432","resolution":{"observed_at":"2026-08-07T14:11:22.221739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.979942Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"e519db65-87af-4bc0-934d-70e9f75ea636","year":2014},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.389735Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:151213dfe50c2b9628b4c115c65a6ef383e93ec5b83b3e2e93db06af8b2066e5","observation_id":"9972f88c-c76e-4bd1-86ce-ec799893529c","resolution":{"observed_at":"2026-08-07T14:11:22.063708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02054","last_updated":"2024-11-30T01:55:11Z","snapshot_observed_at":"2026-08-16T14:21:55.144545Z","submitted_at":"2024-02-03T06:17:21Z","title":"Towards Neural Scaling Laws on Graphs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02054","snapshot_observed_at":"2026-08-07T14:11:09.438355Z","title":"Neural scaling laws on graphs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.438355Z"},"links":{"cited_paper":"/paper/2402.02054","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:6b308fa9a213e1efea415c655759e28f71bb2625d6b6d845b9958b95675805b2","observation_id":"6ad1204f-04b0-4268-bae1-4bf0d17431e3","resolution":{"observed_at":"2026-08-07T14:11:09.438355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T14:11:09.535348Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.535348Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:671600d971c398381af9b2560a4ba1430eb822d51e43c7411da3b154f3cf7d4b","observation_id":"e81e1570-30a4-4f3c-84e8-668d2b27ba6a","resolution":{"observed_at":"2026-08-07T14:11:09.535348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11795","last_updated":"2025-04-06T18:52:08Z","snapshot_observed_at":"2026-08-19T03:30:08.772254Z","submitted_at":"2024-08-21T17:36:37Z","title":"EE-MLLM: A Data-Efficient and Compute-Efficient Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11795","snapshot_observed_at":"2026-08-07T14:11:09.592996Z","title":"Ee-mllm: A data-efficient and compute- efficient multimodal large language model.arXiv preprint arXiv:2408.11795, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.592996Z"},"links":{"cited_paper":"/paper/2408.11795","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:72d83b3279ced8ae7daee0a412d2b74ff51acb55c338479fc2defce6f3e0c571","observation_id":"008b2fb9-ad13-4f06-bd4a-2096d909047c","resolution":{"observed_at":"2026-08-07T14:11:09.592996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.818105Z","title":"Be- yond sot: Tracking multiple generic objects at once","venue":null,"work_id":"bed62ca7-d9ed-44b5-a477-6c52ce3422ec","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.657828Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:d04277796b8416126442347094ce36019e38557e8a3d81656d6da65d8c8bde3a","observation_id":"0a50eaea-c597-4f47-945a-712fd0fb5a8d","resolution":{"observed_at":"2026-08-07T14:11:21.889954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.00831","last_updated":"2016-05-03T23:55:38Z","snapshot_observed_at":"2026-08-14T22:07:48.478216Z","submitted_at":"2016-03-02T19:07:56Z","title":"MOT16: A Benchmark for Multi-Object Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.00831","snapshot_observed_at":"2026-08-07T14:11:09.753966Z","title":"Mot16: A benchmark for multi-object tracking.arXiv preprint arXiv:1603.00831, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.753966Z"},"links":{"cited_paper":"/paper/1603.00831","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:c805f99c4eaf3ad551773c14a275120cb0edf833061e1a3ad90a4a40b72bb70c","observation_id":"8b0543d0-4feb-4d10-9dc4-09564cd5b4c7","resolution":{"observed_at":"2026-08-07T14:11:09.753966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.670997Z","title":"Scaling open-vocabulary object detection.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"049068d5-32f8-433f-b4e6-96c221a8ca0a","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.811009Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:6d4e392df34ea881d020c95739136479ac4a956ac2dec282160111ed71f2ea72","observation_id":"25982780-d3af-4014-b664-dbbb811fc100","resolution":{"observed_at":"2026-08-07T14:11:21.750740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.526085Z","title":"A benchmark and simulator for uav tracking","venue":null,"work_id":"915b81af-6703-404c-ad02-c335a105b506","year":2016},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.854510Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:4f49bcc3daecbfe7ac613409eab84e6366ed1eaa7c4d580021362a86b5a5daf3","observation_id":"3809393e-ff96-415e-9f6b-6805f533df05","resolution":{"observed_at":"2026-08-07T14:11:21.591079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.380416Z","title":"Trackingnet: A large-scale dataset and benchmark for object tracking in the wild","venue":null,"work_id":"b27004ba-8b12-4cd3-aafa-505a102cf203","year":2018},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.946386Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:cd35430e9b69a6b5f092a8169bf930ab0e506d9693ae9d6fe07c1d638a7cd7dc","observation_id":"582ce037-bb9f-4bf9-87c3-4428f3280a54","resolution":{"observed_at":"2026-08-07T14:11:21.460727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.220707Z","title":"Learning multi- domain convolutional neural networks for visual tracking","venue":null,"work_id":"25751e0d-8919-4958-bbe1-88bad873f2f8","year":2016},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.018907Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:53649ae536c65b5db7f0c5750c78601e1bf81cfd6cd15f1dc9adbbebbd333ea2","observation_id":"3a890487-6c62-44a3-ac54-946f30bdb9b6","resolution":{"observed_at":"2026-08-07T14:11:21.298148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06888","last_updated":"2022-08-14T17:49:37Z","snapshot_observed_at":"2026-08-17T08:57:35.940611Z","submitted_at":"2022-08-14T17:49:37Z","title":"AVisT: A Benchmark for Visual Object Tracking in Adverse Visibility","version":1},"cited_work":{"arxiv_id":"2208.06888","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06888","snapshot_observed_at":"2026-08-07T14:11:16.666649Z","title":"AVisT: A Benchmark for Visual Object Tracking in Adverse Visibility","venue":"cs.CV","work_id":"6a5439fa-e160-4c03-aac2-049413dabd00","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.105328Z"},"links":{"cited_paper":"/paper/2208.06888","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:1a6b2d28f1cf3791b6e69be801dd3dadd123dafaa9c248c81c48298db4299a47","observation_id":"b9a31104-6462-43b8-9139-e377714e8f41","resolution":{"observed_at":"2026-08-07T14:11:16.732957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:10.204342Z","title":"Combined scal- ing for zero-shot transfer learning.Neurocomputing, 555: 126658, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.204342Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:f12aadd9b6f6be233085b1b6b20e56ce9f9d31297f6007c4c49094bb2272f674","observation_id":"820c7a6c-6bf4-49c3-8c1c-d08e7c4c1f41","resolution":{"observed_at":"2026-08-07T14:11:10.204342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.061014Z","title":"Occluded video instance segmentation: A benchmark.International Journal of Computer Vision, 130 (8):2022–2039, 2022","venue":null,"work_id":"58863b7c-5d32-4b72-b918-d94d0ba996d0","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.323451Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:768e87b592a2bde47f09e9bd910906f340c12a7b63076c9ae57b8b4321884044","observation_id":"d8104714-1b02-484f-b5b5-6384f289b449","resolution":{"observed_at":"2026-08-07T14:11:21.116546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:10.462504Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.462504Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:12d66e68adb8c6c3ca2c8c7ffe2e771e209b84a3871cfe51672ddc47ad118fa4","observation_id":"7d656761-af20-4509-af35-642ee983bdf1","resolution":{"observed_at":"2026-08-07T14:11:10.462504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T14:11:10.538543Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.538543Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:6266199216fc878d46863225b848c362670802ff4e3d28e0e2b185e1a384b187","observation_id":"250477b0-ced0-4fc4-89ee-bb40a79f47b2","resolution":{"observed_at":"2026-08-07T14:11:10.538543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:20.933723Z","title":"Scaling vision with sparse mix- ture of experts.Advances in Neural Information Processing Systems, 34:8583–8595, 2021","venue":null,"work_id":"b1a83068-84fd-4a5c-a889-45490d260d88","year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.650455Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:6ad1ff88201150c64c565f034cb02324c798f5df0327454e6f051c5a3f8d73ab","observation_id":"67acdf1f-c9b4-48b8-904e-2ac3ee8142ca","resolution":{"observed_at":"2026-08-07T14:11:20.982040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:10.730778Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.730778Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:9aed3e1be21cb002f63775990f94d1b46bd6810febe2b0d6fe4825c651ed1bdb","observation_id":"833b0817-3c99-458a-b9b4-74c64dfa6a58","resolution":{"observed_at":"2026-08-07T14:11:10.730778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:20.768862Z","title":"Hoot: Heavy occlusions in object tracking benchmark","venue":null,"work_id":"f8c2310e-3230-4d99-887b-bdab4cab1266","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.881836Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:174aa8e807c3593e648d5eb231d1041e7276f1492429fd10bb21dbbfbae53d4b","observation_id":"351099dd-0616-4ff4-b9b6-75a3dfb30acd","resolution":{"observed_at":"2026-08-07T14:11:20.835727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:10.954145Z","title":"Revisiting unreasonable effectiveness of data in deep learning era","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.954145Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:e2e1a84c8856aa186001dad8a09e9395322dd4b31fbbf2c843ec45cc251d9e4e","observation_id":"7e24302c-080a-4a48-8037-34dcb7315ee6","resolution":{"observed_at":"2026-08-07T14:11:10.954145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:20.595517Z","title":"Dancetrack: Multi-object track- ing in uniform appearance and diverse motion","venue":null,"work_id":"fff51fa9-4bcf-484c-9dcc-e69a50338670","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.067310Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:6a199af4d7abdd2029e34393b5dbc7b7fdadca6fbf18f70d61be3993918d21ff","observation_id":"dd4e06d8-03c6-4169-a8a2-451fc002c34c","resolution":{"observed_at":"2026-08-07T14:11:20.672675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-08-18T01:20:02.705818Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-07T14:11:11.182755Z","title":"Scale ef- ficiently: Insights from pre-training and fine-tuning trans- formers.arXiv preprint arXiv:2109.10686, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.182755Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:9fa7fd8d8583ade6f7746084cf8e094a95077d16aadfaa5aa4963086ab109e1c","observation_id":"61d5f9ca-7202-40c5-8fdd-4c14bb08c6b2","resolution":{"observed_at":"2026-08-07T14:11:11.182755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:20.412544Z","title":"Robust and ef- ficient foreground analysis for real-time video surveillance","venue":null,"work_id":"327c92d8-ac25-4211-824d-871a29c30602","year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.312057Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:c82c0f6d43885318ab1f3e3690e200077b38f72a97122353d54d7b8689fccbe3","observation_id":"04ee4c0c-f4bc-465b-a931-57df3a702f89","resolution":{"observed_at":"2026-08-07T14:11:20.514123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:11:11.428186Z","title":"Llama: Open and efficient foundation language mod- els.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.428186Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:fc1aa872c4efaf7a20e4ec2743930511cfeeb442eba2e1b4cd30d8f352535f1c","observation_id":"beba9e49-fc01-4502-b104-362ddd37f498","resolution":{"observed_at":"2026-08-07T14:11:11.428186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:20.241548Z","title":"Image captioners are scalable vision learners too.Advances in Neural Infor- mation Processing Systems, 36, 2024","venue":null,"work_id":"6d7cad22-74a5-4154-a49f-a19ccad66da8","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.528673Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:0f04d96f4cd113692028b22fd1902df57cbf86489d0dc57cf054659be6d0d7a4","observation_id":"028d4226-7067-4f4b-84f1-3591e4b933ca","resolution":{"observed_at":"2026-08-07T14:11:20.319634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:20.104278Z","title":"Siam r-cnn: Visual tracking by re-detection","venue":null,"work_id":"de7b92c0-e85c-4cf0-bf05-452f7b0b6660","year":2020},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.670796Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:19bfb6f79df87aa36e8cea1dd0e4141eb03b861b272b36549fe2e0e371696508","observation_id":"a6fa363b-2751-4629-8a16-1f008a343d4b","resolution":{"observed_at":"2026-08-07T14:11:20.162266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:19.922672Z","title":"Unidentified video objects: A benchmark for dense, open- world segmentation","venue":null,"work_id":"8917837d-2663-4c1b-a419-df818581ae0a","year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.811255Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:00cefa1db832d41da9e6a62c90b55b806dee378b82354f66e18f0b3cfdd14d32","observation_id":"5db176de-e473-4904-b05c-fc2ce3ab9c32","resolution":{"observed_at":"2026-08-07T14:11:20.009861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05015","last_updated":"2023-09-21T06:50:36Z","snapshot_observed_at":"2026-08-16T18:03:56.772567Z","submitted_at":"2021-08-11T03:55:12Z","title":"VisEvent: Reliable Object Tracking via Collaboration of Frame and Event Flows","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.05015","snapshot_observed_at":"2026-08-07T14:11:11.960802Z","title":"Vi- sevent: Reliable object tracking via collaboration of frame and event flows.arXiv preprint arXiv:2108.05015, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.960802Z"},"links":{"cited_paper":"/paper/2108.05015","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:e6c6994d5b12beb20d842e557558a9cd7355cad7fc4f49bbeab7799ae0653d8d","observation_id":"a2341e73-f97f-4bd6-aade-16a9cdea6a61","resolution":{"observed_at":"2026-08-07T14:11:11.960802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:19.750125Z","title":"Towards more flexi- ble and accurate object tracking with natural language: Al- gorithms and benchmark","venue":null,"work_id":"a708103d-0ff3-4496-97ad-163da1b1e888","year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.120700Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:34bfbc59e1da5f78b9fa63117cc43c216a4a07d22dca9d9e06f3228f1fe97a1d","observation_id":"d6ca3a14-467f-4b50-a6a6-cec5e6550884","resolution":{"observed_at":"2026-08-07T14:11:19.841374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:19.600353Z","title":"Autoregressive visual tracking","venue":null,"work_id":"8c82dbf5-e964-4ae6-aa87-7fa654ebf7e0","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.216817Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:bd6e19f829f35c15f93c7a7913685a566dd8bbcdda51349e6c289a6d7328f564","observation_id":"89991292-e120-4337-90ba-638a77bb50c4","resolution":{"observed_at":"2026-08-07T14:11:19.659956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:19.408643Z","title":"Online ob- ject tracking: A benchmark","venue":null,"work_id":"40e743d9-ea9b-4138-8ea5-2e6a34bc607d","year":2013},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.354364Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:36669956c0adacd667192a5638f0994d68f0af3ae019439792c2fd38b63e1e06","observation_id":"1aeb69b1-99c8-4d26-b969-a360435423ab","resolution":{"observed_at":"2026-08-07T14:11:19.484663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10700","last_updated":"2024-08-20T09:57:13Z","snapshot_observed_at":"2026-08-21T08:38:46.595671Z","submitted_at":"2024-08-20T09:57:13Z","title":"AnyGraph: Graph Foundation Model in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10700","snapshot_observed_at":"2026-08-07T14:11:12.458637Z","title":"Anygraph: Graph founda- tion model in the wild.arXiv preprint arXiv:2408.10700,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.458637Z"},"links":{"cited_paper":"/paper/2408.10700","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:8e826a23fe4bf63681b6446bc3e2f5b52b8026c415c688a3aaa80badae9f7654","observation_id":"b5d00a26-edf3-462e-a609-01423de1939e","resolution":{"observed_at":"2026-08-07T14:11:12.458637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:19.246031Z","title":"Attribute-based progressive fusion network for RGBT tracking","venue":null,"work_id":"0617e56b-8bdd-4644-8072-06225fde45cd","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.574632Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:3d9cdebaae24bce1e0f22bd4a0f471a3f1c506bfc0a6d80c157772b5475d3f94","observation_id":"5ff27371-0898-4021-810d-4951296920fc","resolution":{"observed_at":"2026-08-07T14:11:19.317940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16404","last_updated":"2025-01-27T09:10:06Z","snapshot_observed_at":"2026-08-15T19:24:48.064460Z","submitted_at":"2025-01-27T09:10:06Z","title":"DynaPrompt: Dynamic Test-Time Prompt Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16404","snapshot_observed_at":"2026-08-07T14:11:12.691354Z","title":"Dynaprompt: Dynamic test-time prompt tuning.arXiv preprint arXiv:2501.16404, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.691354Z"},"links":{"cited_paper":"/paper/2501.16404","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:59b67d6bb3a7f9cec9e2bf50025668152c66e995d5fcced5f3a2b3974b7571ff","observation_id":"dc880ee5-80cb-4f2b-94a3-4dd6e096e861","resolution":{"observed_at":"2026-08-07T14:11:12.691354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:19.100303Z","title":"On data scaling in masked image modeling","venue":null,"work_id":"9cccf126-8d46-4999-a623-ebdd1559260a","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.806476Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:e101d8ec3645f26c11169ca19c93bb9e5e709db6787d872eff05185d422ded6e","observation_id":"41e4dccc-e382-4997-9bd6-477808365a31","resolution":{"observed_at":"2026-08-07T14:11:19.164676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.953489Z","title":"Multi- ple human tracking based on multi-view upper-body de- tection and discriminative learning","venue":null,"work_id":"79b0403d-7a35-4162-8644-eaf9d23ca825","year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.956635Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:7d62fad8da15d9febabe97e23bf9bb849e11db37cc8c64eb831a7e6ff2b65f09","observation_id":"f48876ef-0884-458a-b7fe-f1bf83b4f35a","resolution":{"observed_at":"2026-08-07T14:11:19.027097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.807406Z","title":"Learning spatio-temporal transformer for vi- sual tracking","venue":null,"work_id":"b50169f4-2d86-42c7-9014-287ca7e642ef","year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.041797Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:a9c7eb9835a84a03e4af0cfdc08a61bfbc56d4a8c89341a13733feb1c441156f","observation_id":"8ff38503-aaf1-4417-ae37-7975eeb39966","resolution":{"observed_at":"2026-08-07T14:11:18.869743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.669753Z","title":"Depthtrack: Un- veiling the power of RGBD tracking","venue":null,"work_id":"e2fa990b-ebda-49db-b6c0-70a11905a56a","year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.126007Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:c56f7d3319fcbcfe430c3f68c2e8c5b012c6782c789f35a3a108c19d4c062004","observation_id":"30394d7d-6492-4c32-bda4-09fb85670623","resolution":{"observed_at":"2026-08-07T14:11:18.732897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.505754Z","title":"Depthtrack: Un- veiling the power of rgbd tracking","venue":null,"work_id":"9682d679-a542-4563-a05b-caecb1e68890","year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.215773Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:b07fc98547aa72950dfdd216d2eb5564e22b4f7b63d8f0d4a472d73826363dd8","observation_id":"31830219-47b8-4dab-b1ac-630953df496f","resolution":{"observed_at":"2026-08-07T14:11:18.581390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19435","last_updated":"2025-02-15T16:01:36Z","snapshot_observed_at":"2026-08-18T14:59:59.053013Z","submitted_at":"2024-06-27T17:59:49Z","title":"A Sanity Check for AI-generated Image Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19435","snapshot_observed_at":"2026-08-07T14:11:13.416233Z","title":"A sanity check for ai-generated image detection.arXiv preprint arXiv:2406.19435, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.416233Z"},"links":{"cited_paper":"/paper/2406.19435","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:b70c8af01fa38d00014a9824232093a902e5f477badcc0cbbbc716471cdd6e04","observation_id":"c7fb0d3d-5705-4dfe-ac00-9f7ef9b4cb84","resolution":{"observed_at":"2026-08-07T14:11:13.416233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.316558Z","title":"Panovos: Bridging non-panoramic and panoramic views with trans- former for video segmentation","venue":null,"work_id":"10acd9ad-ef8d-4cd4-ba6a-956977ab161a","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.601820Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:925fc83cfc343477fb1a9c913397f812f30683b3442fbee4897fcb9bedb48168","observation_id":"30519972-212d-4ded-b247-c0a446c5df05","resolution":{"observed_at":"2026-08-07T14:11:18.391038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.173735Z","title":"Referred by multi-modality: A unified tem- poral transformer for video object segmentation","venue":null,"work_id":"cd00dfa5-4fe5-41ed-b2bc-1f07a78d0aa2","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.726872Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:c5877ae1039d24cf23091434204b6ec106bcc3a915f6b612833d0979cab1e5e2","observation_id":"45c86d4c-d730-48bd-b1c3-9f836b8df932","resolution":{"observed_at":"2026-08-07T14:11:18.239241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:13.877323Z","title":"Crosslmm: Decoupling long video sequences from lmms via dual cross-attention mechanisms.arXiv preprint arXiv:2505.17020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.877323Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:ad9fff8b411640aa7f65f66550c215532eed425cba2652489ae22f6aa7c63ac5","observation_id":"4a0582bd-6854-4368-9832-49a679522113","resolution":{"observed_at":"2026-08-07T14:11:13.877323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.063266Z","title":"Prompting for multi-modal tracking","venue":null,"work_id":"2bc25bdf-00e4-44ac-8fea-63b3b133e25f","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.048167Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:52c27fc064b152c6b1c25699a71b12030bb708dfb054a595f0f75af467a2297b","observation_id":"75c35112-90a3-4fa0-8d4c-4451f91033f1","resolution":{"observed_at":"2026-08-07T14:11:18.123367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:17.918647Z","title":"Joint feature learning and relation modeling for tracking: A one-stream framework","venue":null,"work_id":"10d55eb9-b184-4a21-b21c-75eaaf02a73e","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.193531Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:123235a29b888aa6407a3d2af1b346997567d55127fc9b07ddb55d6b61847543","observation_id":"299446c9-7081-4843-934a-abec4bb631ae","resolution":{"observed_at":"2026-08-07T14:11:17.980467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-07T14:11:14.323400Z","title":"Coca: Con- trastive captioners are image-text foundation models.arXiv preprint arXiv:2205.01917, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.323400Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:2eb339f5cd880de6678c4803ef1ad2c4eb0a136d851d60db861910b99272b0d7","observation_id":"81ed8623-a944-4ff3-83d6-d8f8973908be","resolution":{"observed_at":"2026-08-07T14:11:14.323400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:17.777915Z","title":"Scaling vision transformers","venue":null,"work_id":"e6f381fa-5a52-456f-93af-5d22ae859f4d","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.461770Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:9af1c0f268521202c2147fe878171347b92480f5f80ccbfce7e4c36e7c7a48f3","observation_id":"b4bfb68e-5c40-47ab-b39a-af0d8bc56c05","resolution":{"observed_at":"2026-08-07T14:11:17.847892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:17.663818Z","title":"Instance- level segmentation for autonomous driving with deep densely connected mrfs","venue":null,"work_id":"90b76a2c-e495-4df1-acbd-9407f27edb8a","year":2016},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.589844Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:47edbcc3e4f80bfc934cd28345ff5c1e1eaaab87d0c3f00ac874a164f9f7a31f","observation_id":"8dc40d3c-e89a-4740-9ab4-fb2c3f51062b","resolution":{"observed_at":"2026-08-07T14:11:17.707588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:17.497983Z","title":"Ocean: Object-aware anchor-free tracking","venue":null,"work_id":"5ae518db-40fd-4d6c-8b05-be03857d1d34","year":2020},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.781227Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:41fcf59673078c71baf05022e0f74139d64bf728ecba1c33b071415dc954682c","observation_id":"20975c95-2d98-461f-b3b7-9ace2f27d3a8","resolution":{"observed_at":"2026-08-07T14:11:17.576605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:17.373863Z","title":"Reading rele- vant feature from global representation memory for visual object tracking.Advances in Neural Information Process- ing Systems, 36:10814–10827, 2023","venue":null,"work_id":"89282cd6-1003-458d-b66f-54dd432d966c","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.974228Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:38cf7839ea88be941426ce397b950cb2774197ce70ec747932d163a56597127b","observation_id":"b645f6a8-82c4-4e98-a902-ca526d8c78ce","resolution":{"observed_at":"2026-08-07T14:11:17.431236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02467","last_updated":"2025-01-05T07:28:50Z","snapshot_observed_at":"2026-08-16T12:59:42.416520Z","submitted_at":"2025-01-05T07:28:50Z","title":"DeTrack: In-model Latent Denoising Learning for Visual Object Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02467","snapshot_observed_at":"2026-08-07T14:11:15.127792Z","title":"Detrack: In-model latent denoising learning for visual object track- ing.arXiv preprint arXiv:2501.02467, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:15.127792Z"},"links":{"cited_paper":"/paper/2501.02467","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:a2495b4237da10f97d2da94a4936e62d574634d9339652160a77d756b06c2955","observation_id":"1a8f47a5-92dd-4196-baa0-52bace9ec2c0","resolution":{"observed_at":"2026-08-07T14:11:15.127792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T03:39:12.624268Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":2,"verified_fuzzy":45},"total_outbound_references":106},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 100 of 106 outbound references and 0 inbound Pith citation observations for arXiv:2505.19990."}