{"as_of":"2026-08-16T02:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bdb573b959464802c8e860327dabf7a644589f21730dd9b12ead565cb264ed8","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:38:09.895402Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13626/citation-record","integrity":"/paper/2411.13626/integrity","json":"/paper/2411.13626/citation-record.json","paper":"/paper/2411.13626"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:11.102322Z","title":"Vivit: A video vi- sion transformer","venue":null,"work_id":"55d4852f-18b2-4af9-abba-463b47a44624","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.538275Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:e7c471970398a215e7ed4ef7a61a207cfd1993e35db4b5f5a101447020ac60be","observation_id":"5a99891b-2e49-4489-8005-51c9dc53d51a","resolution":{"observed_at":"2026-08-12T16:38:11.107604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05095","last_updated":"2021-06-09T14:48:13Z","snapshot_observed_at":"2026-08-13T20:17:16.277117Z","submitted_at":"2021-02-09T19:49:33Z","title":"Is Space-Time Attention All You Need for Video Understanding?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05095","snapshot_observed_at":"2026-08-12T16:38:09.546390Z","title":"Is space-time attention all you need for video understanding? ArXiv, abs/2102.05095, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.546390Z"},"links":{"cited_paper":"/paper/2102.05095","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:3a0b9ad732297d2fba7b4a79c33db0b69cba734f2d93680c2673074e29bdfd62","observation_id":"c9348b78-6a67-4449-bb64-609cc30b4912","resolution":{"observed_at":"2026-08-12T16:38:09.546390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.554368Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.554368Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:c202f243cad24f42460f05c17f2bfa27db191a4adb157fb90680cdb3b0c768f0","observation_id":"49cabee7-aefe-4090-8476-4ad7f9bdc92f","resolution":{"observed_at":"2026-08-12T16:38:09.554368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:11.069418Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":"20c880c4-aade-4858-92db-0805ce638019","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.561593Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:adba54c2777f9c00d8b0392e912a1f9e456e4cb2eb2ce18d9e97d56f4d51e813","observation_id":"81fd44e9-98bc-428e-9fa7-c3e18c494187","resolution":{"observed_at":"2026-08-12T16:38:11.075015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:11.043790Z","title":"Revisiting the” video” in video-language understanding","venue":null,"work_id":"d1c9556f-60fb-418b-a10e-959ddb9d8547","year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.568188Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:4fd03c1f5a6daa6d8d16409e8887c1bfaac7496857223e1928f13d5eddc6d8e5","observation_id":"42b7f1f4-3f60-4fac-a742-73a4fe5dc6ef","resolution":{"observed_at":"2026-08-12T16:38:11.052252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:11.024916Z","title":"Space-time mixing attention for video transformer","venue":null,"work_id":"66d1fe0e-1dcd-4210-b168-ea1f9ae8eaf6","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.584966Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:b211bc77b30c78fa4d2e0b707eb28f2d59b06d933bc8bb54d0ed5ff7cf25a3be","observation_id":"9651a4fb-f220-45f0-8ef8-75e05b8d0472","resolution":{"observed_at":"2026-08-12T16:38:11.031143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.595147Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.595147Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:fc3e938c3638d6a2c5cc2208b68827011a25a5ad5afc05ecd785bcc3b7168add","observation_id":"fabe6ce3-449a-4b92-b86a-857a4caa921e","resolution":{"observed_at":"2026-08-12T16:38:09.595147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.995344Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"b43357bf-5133-4491-88ff-55b6b1e2235a","year":2017},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.609017Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:6def6c408f416b19cfa9b815831e5bed40e570d3287c2dda624c727bcbf91445","observation_id":"e9612554-9565-471e-920a-d940a518b9df","resolution":{"observed_at":"2026-08-12T16:38:11.001220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.975387Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024","venue":null,"work_id":"ab1ada4b-6ebc-4ee8-8f38-e876a482254b","year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.615828Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:3b2db01c8112ccf02ec447aeaf688eda2d70de206866fabc05aaf03835fa0e75","observation_id":"a852fa36-f5f0-458f-bc78-b053c27ab8f5","resolution":{"observed_at":"2026-08-12T16:38:10.981335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.954755Z","title":null,"venue":null,"work_id":"a89f1aa2-f978-41a9-b0be-8819ad5deeb0","year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.622145Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:b5f4d66e47a8ea8addb949d0db10058284dd3409d2fd8f5c15867eedd015f97a","observation_id":"25b26d8c-8dc3-44cb-bad3-b381833ec000","resolution":{"observed_at":"2026-08-12T16:38:10.960743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.934688Z","title":"Prune spatio-temporal tokens by semantic-aware temporal accumulation","venue":null,"work_id":"332740f2-c106-475c-8fb2-2b601fa421f2","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.629775Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:1e969b84ec948988211734e0622370161afb2bd1e992fa0ecc91c4142afcc269","observation_id":"47cf182b-374d-48fe-93a6-9457ea518760","resolution":{"observed_at":"2026-08-12T16:38:10.941052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.635930Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.635930Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:8d6056a2c048afba6c746657ac13db8b095d815b82266f6416f6ca1a4607a710","observation_id":"ff94fd5d-3e5c-40e1-83de-4cce007a8738","resolution":{"observed_at":"2026-08-12T16:38:09.635930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.903998Z","title":"Multiscale vision transformers","venue":null,"work_id":"5671e000-705c-42e5-bba6-4f6193cb8de3","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.643481Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:922102b9f35095b5f9c2cde83a81ca4399bb989eb428c133fb5ca45b7edb077f","observation_id":"5b345fdf-3da9-4331-a4cc-dd588465739c","resolution":{"observed_at":"2026-08-12T16:38:10.910305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.884315Z","title":"X3d: Expanding architectures for efficient video recognition","venue":null,"work_id":"89d8c59b-73e6-4db9-8cbc-ff0e9dc7be67","year":2020},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.649118Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:a242df4ec7c404e7fbca610e80b46eba8fc6e31cb605376a56081af69875c338","observation_id":"48f3a647-1921-41d7-8c5e-859bf389090c","resolution":{"observed_at":"2026-08-12T16:38:10.890972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.658326Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.658326Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:68408462b2605e6a4a2d921c24087373c26858ca0f4eb0f29241990ab7e9e42b","observation_id":"0bd73605-a781-43b2-ac83-0abdbf5e436a","resolution":{"observed_at":"2026-08-12T16:38:09.658326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.845417Z","title":"Efficient video transformers via spatial-temporal token merging for action recognition","venue":null,"work_id":"5863aa88-0abf-4522-a8b7-67ae4f941689","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.664529Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:b576b84c8be4fe1a89a81a254779015c123eed6542955ae48795e92ecf327dda","observation_id":"a7ea3224-d89b-494d-a436-a9a769696a5a","resolution":{"observed_at":"2026-08-12T16:38:10.851935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.670309Z","title":"Smart frame selection for action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.670309Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:f4f85344a0e1450bd9535f86d6da3f05924dbdbbf416b116cc2eb1e8e2502149","observation_id":"ec917cda-c365-402b-a165-4e86a39f60ab","resolution":{"observed_at":"2026-08-12T16:38:09.670309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06522","last_updated":"2024-09-17T14:30:04Z","snapshot_observed_at":"2026-08-15T10:18:16.552537Z","submitted_at":"2023-10-10T11:08:31Z","title":"Watt For What: Rethinking Deep Learning's Energy-Performance Relationship","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06522","snapshot_observed_at":"2026-08-12T16:38:09.676924Z","title":"Watt for what: Rethinking deep learn- ing’s energy-performance relationship","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.676924Z"},"links":{"cited_paper":"/paper/2310.06522","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:a47e1622d6a58475c2ffe024f53f1815873110bd3b598fe57cd6d35205ae54d6","observation_id":"a3eeda23-3d4a-4dea-9fd3-c64001b2df71","resolution":{"observed_at":"2026-08-12T16:38:09.676924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.805896Z","title":"Optimizing factorized encoder models: Time and memory reduction for scalable and efficient action recognition","venue":null,"work_id":"5f050c28-2cba-46d7-86f1-b603898a73d9","year":2025},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.684927Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:5f68fae6799f9cf5c6d5792d663b9bda97ae3f95d44ae8ba74b79cebfa9e102c","observation_id":"bb986a7b-b58f-402c-a25d-1fc5628338a2","resolution":{"observed_at":"2026-08-12T16:38:10.812740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.781316Z","title":"something something","venue":null,"work_id":"74de16ca-d4f8-4aef-847d-60799d2b9e07","year":2017},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.691332Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:03ea3ac1568465bcb0faf6cb9785c89796075ae372b9da1a7656cf074c9f74ce","observation_id":"2edfc8e9-b2ce-4bce-a2eb-53498af96b52","resolution":{"observed_at":"2026-08-12T16:38:10.787929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.697107Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.697107Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:81dc9f59afea2d63ec83447e8e6f7ad55cb3c4fc38d386bb2679e73cb5566d0e","observation_id":"c0a9017a-ad20-4001-8630-4e55eef1602e","resolution":{"observed_at":"2026-08-12T16:38:09.697107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.746563Z","title":null,"venue":null,"work_id":"c1f0c5b8-0cdf-4774-8902-a7812e3bb807","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.702748Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:d6889f1ae80b0026a65c3dc054309326c8437a1e0c85f97624749510257ac0d1","observation_id":"adfa02c1-ed9d-4c8d-90f7-a8970e545584","resolution":{"observed_at":"2026-08-12T16:38:10.753008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12753","last_updated":"2024-07-17T17:22:43Z","snapshot_observed_at":"2026-08-12T23:20:10.521449Z","submitted_at":"2024-07-17T17:22:43Z","title":"LookupViT: Compressing visual information to a limited number of tokens","version":1},"cited_work":{"arxiv_id":"2407.12753","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12753","snapshot_observed_at":"2026-08-12T16:38:10.112527Z","title":"LookupViT: Compressing visual information to a limited number of tokens","venue":"cs.CV","work_id":"ce2d81eb-6b3d-431c-8cf0-a8674a993a6a","year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.707821Z"},"links":{"cited_paper":"/paper/2407.12753","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:79943797f14a730dd64b8b99e54912ac2bdf873799a2c3e0ddfdb95c4e924dd2","observation_id":"cfa34fc8-2a72-4cc2-8ae8-ac1bf3f41028","resolution":{"observed_at":"2026-08-12T16:38:10.119977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.714750Z","title":"Revisiting token pruning for object detection and instance segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.714750Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:8a1041d74e502b67936e837d4f030ee8ba4d90ae310076e6f308d2d7e8dd943f","observation_id":"ecbcfb01-bc9f-473c-92a5-b1b7cdfe0ec4","resolution":{"observed_at":"2026-08-12T16:38:09.714750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.711184Z","title":"Swin transformer: 9 Hierarchical vision transformer using shifted windows","venue":null,"work_id":"861f948b-3305-442b-86ad-28eab87cc366","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.720206Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:c0860c5f78991bf6b138abdb27baa88f8a278456a8b0872f021d1f50706f67b2","observation_id":"602013d9-90ab-49bc-873f-38010dd65c0a","resolution":{"observed_at":"2026-08-12T16:38:10.718586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.686397Z","title":"Video swin transformer","venue":null,"work_id":"598a283d-81a7-4a32-b7b6-eb2b2963cccc","year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.725399Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:88c1cf6e90c75d43c5ffc5c3ccde00b77a2833112467e433bdaae00e5951d145","observation_id":"1340edae-8416-4d56-8865-ae5b6f5ede89","resolution":{"observed_at":"2026-08-12T16:38:10.695342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.662915Z","title":"Video transformer network","venue":null,"work_id":"abc79da2-ef2c-44de-99ab-24099b6e0f28","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.732078Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:1db73a9fdfb07a3c6cdbd4e9985871c4403a4a00426029246db6b90d167e00d9","observation_id":"59cbb268-d70c-42cd-975b-dc68b59c9c99","resolution":{"observed_at":"2026-08-12T16:38:10.671573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.737194Z","title":"Expanding language-image pretrained models for gen- eral video recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.737194Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:5379abd1a65e43c57e10ac4a372fb1cf63e8183a3dcca258f8cc342597d9d888","observation_id":"6bb2d98a-286b-487b-8c46-1544f41c56a2","resolution":{"observed_at":"2026-08-12T16:38:09.737194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.744700Z","title":"St-adapter: Parameter-efficient image-to-video transfer learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.744700Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:ad8dcd579308ab5eabc668c954dd51b5a0379cff14361090260cf4b55ea75a26","observation_id":"d0797f54-8feb-45a7-8fdf-0511431ca87b","resolution":{"observed_at":"2026-08-12T16:38:09.744700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.619343Z","title":"K-centered patch sampling for efficient video recognition","venue":null,"work_id":"5f776812-331e-4fa5-897c-bb2d1e73ccdb","year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.750699Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:894c668df3c67a7d81476e5b206900ca12a68f86d461544535520adb0f4c76b7","observation_id":"a513123d-c351-407e-95d4-8c80f29e1fa2","resolution":{"observed_at":"2026-08-12T16:38:10.624875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.595432Z","title":"Asano, Is- han Misra Florian Metze, Christoph Feichtenhofer, Andrea Vedaldi, and Jo ˜ao F","venue":null,"work_id":"878fe0a0-8c97-4a04-8cd2-302a7927d71b","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.756350Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:2e3e020053fc3f6444bec15fa2f746ca9c679eb14db9181afd59ea3498a44a03","observation_id":"34fbc06d-8cd9-44a6-8a19-3d578edff604","resolution":{"observed_at":"2026-08-12T16:38:10.602725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.570660Z","title":"So, Maud Texier, and Jeff Dean","venue":null,"work_id":"311cbd1f-5e83-4ad8-bb60-8986a0ceea63","year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.761549Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:b5d4b884cf6b882e655efd9a6ab00b946a0dc501ffce2b3fbd4ce0669966b6d9","observation_id":"d5be688a-fbbc-48ed-862b-48795aed311f","resolution":{"observed_at":"2026-08-12T16:38:10.578776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06005","last_updated":"2024-01-11T16:07:58Z","snapshot_observed_at":"2026-08-14T11:17:41.128996Z","submitted_at":"2024-01-11T16:07:58Z","title":"How does the primate brain combine generative and discriminative computations in vision?","version":1},"cited_work":{"arxiv_id":"2401.06005","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.06005","snapshot_observed_at":"2026-08-12T16:38:10.077806Z","title":"How does the primate brain combine generative and discriminative computations in vision?","venue":"q-bio.NC","work_id":"3e12601a-e677-42a4-87e1-4b808e2e7da9","year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.767230Z"},"links":{"cited_paper":"/paper/2401.06005","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:e9a2da2516f073e2365ce87a4b75b0fa33c9c5c8aa5c0a24a22569fd1f7bfcb0","observation_id":"89f85019-3d55-4d11-a005-a117a8eef86b","resolution":{"observed_at":"2026-08-12T16:38:10.086545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.773955Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.773955Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:b7eddbb1bcef300039bdbc0f2effa5a71279958702d06db85ea4d785776efa4e","observation_id":"afecf784-5a76-4a59-b954-f984930b3757","resolution":{"observed_at":"2026-08-12T16:38:09.773955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-08-13T18:59:40.015343Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-08-12T16:38:09.781891Z","title":"Tokenlearner: What can 8 learned tokens do for images and videos? arXiv preprint arXiv:2106.11297, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.781891Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:b815bc4cd4c3da34acb8b723857ec2951685de789dc7a1f7450049fdb6c8c95f","observation_id":"c6e191aa-4563-456b-9d38-200a2507f493","resolution":{"observed_at":"2026-08-12T16:38:09.781891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.524383Z","title":"Selvaraju, Abhishek Das, Ramakrishna Vedantam, Michael Cogswell, Devi Parikh, and Dhruv Ba- tra","venue":null,"work_id":"9b80409d-946f-4bfe-9e7d-6f7f448beffb","year":2016},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.788899Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:9f360cc2a468a1ebb28dfdab2e85ed6d86a1c8b08725f05072893630e7d9a6bb","observation_id":"c64056be-71b2-4f73-a879-28f300e8441f","resolution":{"observed_at":"2026-08-12T16:38:10.531612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.497616Z","title":"Only time can tell: Discovering temporal data for temporal modeling","venue":null,"work_id":"88423a01-7449-48c6-85a4-4213941cd4dd","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.795722Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:cd134abe146a06550447ba5d04749fe39c928754099e916a61f7645cc0c2daca","observation_id":"253eb58c-3783-48b2-8a40-03be771481f6","resolution":{"observed_at":"2026-08-12T16:38:10.507034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-15T13:34:03.745436Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-12T16:38:09.801167Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.801167Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:b9926eb0cb4ab08c1e16703beeacfeb952aee4cc420c8d1642fef927e13584ff","observation_id":"d826674c-9cc0-4f29-8b22-2b105315db20","resolution":{"observed_at":"2026-08-12T16:38:09.801167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-12T16:38:09.806583Z","title":"Videomae: Masked autoencoders are data-efficient learn- ers for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.806583Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:59f4525d060eb858fd58392681c4bfd51cf62a67eb27e6392cd9482bda4956c0","observation_id":"74e6b19c-f94e-4ecb-9e89-7e5ed0031801","resolution":{"observed_at":"2026-08-12T16:38:09.806583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.812884Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.812884Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:acbd693729e00efa419cbf23d4c058e9dd6a8f7df3d132211eeca10437fed91c","observation_id":"db30876b-61c8-4e75-900b-c2afe0611f5f","resolution":{"observed_at":"2026-08-12T16:38:09.812884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.453486Z","title":"Attention is all you need","venue":null,"work_id":"62c363e8-de31-486e-95ae-89a90875492c","year":2017},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.818358Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:89ddac6112b7ef0a43278f187038cab59c3a2d81d5033ebfbcdb2dcae8547d86","observation_id":"42879cc2-add6-46c6-ae1a-77b6447084ba","resolution":{"observed_at":"2026-08-12T16:38:10.463112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.419637Z","title":"Efficient video transformers with spatial- temporal token selection","venue":null,"work_id":"55d4fcac-d346-4582-9350-1d80335f3886","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.823324Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:b2257148b58ea69ea8e22dc2f5b2c64ba2775f59bb90a1d139ee01e9d452c600","observation_id":"723c88fb-5569-4fa7-b021-9037e90ce588","resolution":{"observed_at":"2026-08-12T16:38:10.430041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.392193Z","title":"Actionclip: Adapting language-image pretrained models for video action recognition","venue":null,"work_id":"56848e29-494b-4809-a58a-b187880a30ba","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.829073Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:bccc861b73aed57fbbb0c096d200c79c3b55f7eee664e2063050892eb5a5e22c","observation_id":"dffe762e-8325-4ff8-993b-c2834b93bc77","resolution":{"observed_at":"2026-08-12T16:38:10.405228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.368562Z","title":"Vila: Efficient video-language alignment for video question answering","venue":null,"work_id":"f3fbf7dd-bb40-417f-9ab0-843afbe6141c","year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.833947Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:f28eccf5bc621858fe72a9c421faf0541319b741ca8ff60228ef57a99a3795fd","observation_id":"17e7c3c5-5d9f-40c0-8763-a95ada95aafc","resolution":{"observed_at":"2026-08-12T16:38:10.378103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.338614Z","title":"Video-focalnets: Spatio-temporal focal modu- lation for video action recognition","venue":null,"work_id":"663d54a4-cf4e-4c2f-b7c1-d2db72c3dff2","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.841034Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:ecfcceee4bacba7589444f1b5866b1e7ae6a97848b62c6b2f18293717f72667d","observation_id":"84b220ef-6547-4687-ac53-421d9391f825","resolution":{"observed_at":"2026-08-12T16:38:10.351817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.319486Z","title":"Manmatha, Alex Smola, and Philipp Kr¨ahenb¨uhl","venue":null,"work_id":"4af1193f-91f4-4e87-83c4-9e2f94c0dd63","year":2018},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.847893Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:be5366f494e77768419d41212e98c3fba61620a6e89c12311dff6d66552f3935","observation_id":"665eb6e4-ab17-43a3-b74d-afbf74dd7766","resolution":{"observed_at":"2026-08-12T16:38:10.325086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.300244Z","title":"Memvit: Memory-augmented multiscale vision transformer for efficient long-term video recognition","venue":null,"work_id":"e2d232a8-e4d1-499b-a592-842685698b80","year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.853463Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:6a74070f2374c67e044a7e1f6c038d3ee2e43baa3b743316671415841eab88a5","observation_id":"7b6373a5-13ef-4083-b0ba-fab7f0b5b684","resolution":{"observed_at":"2026-08-12T16:38:10.306355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.859186Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.859186Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:1f3c8f74d99ad8fdab92e995b4fcaebb33f4464b8164d42b08afd43e5bae3e1b","observation_id":"79bb0272-bd07-4e33-93ce-2f1be485168c","resolution":{"observed_at":"2026-08-12T16:38:09.859186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.265098Z","title":"Aim: Adapting image models for effi- cient video action recognition","venue":null,"work_id":"f63b08a2-70ef-47e3-a00c-23ba49c356e0","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.865766Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:92eda0cb4304ec6bc369f391ba728d7f1012f192b9ac076f38e20572585c51c3","observation_id":"d5201b10-1d8b-4aa0-a730-2072546fec75","resolution":{"observed_at":"2026-08-12T16:38:10.271496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.247590Z","title":"A-vit: Adap- tive tokens for efficient vision transformer","venue":null,"work_id":"a2211cbe-3eea-4a36-90b3-23584b8270ac","year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.872069Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:8dd4872f6ac6f5bf18a88a4160dc89e18da38608a5e620ca31d47562fde956e1","observation_id":"7768a25e-84b1-41fe-a56b-15c65398e260","resolution":{"observed_at":"2026-08-12T16:38:10.253123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.229193Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"956bfc4a-694c-47f1-8ca5-9b153a197d23","year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.877725Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:e46d9f51af2e81faee2b3859944afa0dc85942d5c8286593de9d68f3eee4a8df","observation_id":"a7ba7476-5d2f-4e15-8c85-82037d865916","resolution":{"observed_at":"2026-08-12T16:38:10.235125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.211288Z","title":"Pyramid feature attention net- work for saliency detection","venue":null,"work_id":"4ffb5cea-152d-4d08-a847-63d82461613d","year":2019},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.883184Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:cb3104aaf9d07d1acccfe4c1d9e36265253837ac8bbb3241d859340340e715fc","observation_id":"6f62fb58-6e13-44f0-b29d-15c2176a3f41","resolution":{"observed_at":"2026-08-12T16:38:10.217473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.187609Z","title":"How can objects help action recognition? 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 2353–2362, 2023","venue":null,"work_id":"9aee6845-baf1-4995-b099-557500116c29","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.889971Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:8cda11c1316cafb845fb94c15bd77f937d4a29556f4da34af17befa679fb3026","observation_id":"c2c53224-c922-44fb-bbfc-34ab9845defc","resolution":{"observed_at":"2026-08-12T16:38:10.197334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09066","last_updated":"2018-05-07T09:46:08Z","snapshot_observed_at":"2026-08-14T19:22:32.330936Z","submitted_at":"2018-04-24T14:30:56Z","title":"ECO: Efficient Convolutional Network for Online Video Understanding","version":2},"cited_work":{"arxiv_id":"1804.09066","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.09066","snapshot_observed_at":"2026-08-12T16:38:09.946149Z","title":"ECO: Efficient Convolutional Network for Online Video Understanding","venue":"cs.CV","work_id":"2c925ec6-c79a-46c9-8d5a-4caccfeba473","year":2018},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.895402Z"},"links":{"cited_paper":"/paper/1804.09066","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:2aa3f4310b020ed1ee6928578d3723c7e826b5b837f1bf3f6c86cbfba76339e4","observation_id":"95ba41bf-3a83-443d-8bac-6c62795b021e","resolution":{"observed_at":"2026-08-12T16:38:09.954883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":3,"verified_fuzzy":32},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2411.13626."}