{"as_of":"2026-08-10T18:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92075cc14989bfc48d2f6f9df429e3460cc1d3505b3b93043bd8cd081e1b5842","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:28:48.407448Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:57.309052Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:5e9ae383f293b7008ca4f4d343abd6f0d41a4f11e44bc9911a21c8ba8c413926","observation_id":"f5d6fb1a-b50a-43e6-b7e3-d0504daab814","resolution":{"observed_at":"2026-05-16T09:38:09.558580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:f9972a8e026b07241a0c675083e2161fe7a1283e710c93ef07943c25cec2d4db","observation_id":"30516c5a-679c-47c5-afd6-0be2ed571833","resolution":{"observed_at":"2026-05-10T22:29:30.012482Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-08-09T18:28:48.407448Z","title":"Tokenlearner: What can 8 learned tokens do for images and videos? arXiv preprint arXiv:2106.11297, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.407448Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:d0a2d9c5399e90ebcca4af161692a0e00dfc17d075a758fd4d080b72e449d75d","observation_id":"c39a0be2-f050-43b9-b048-64ff5f04c902","resolution":{"observed_at":"2026-08-09T18:28:48.407448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2505.23617","last_updated":"2026-05-10T04:23:42Z","snapshot_observed_at":"2026-08-03T01:40:18.134653Z","submitted_at":"2025-05-29T16:25:35Z","title":"One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:31.765909Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2505.23617"},"observation_digest":"sha256:5d1a0b5ec09aa3ae5d53f928d8e8ff782ef68c78cc4090cc77a226fba94d1a5f","observation_id":"faa12944-ddd0-4c44-b1b4-c285d500fa91","resolution":{"observed_at":"2026-05-19T12:57:17.864851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-08-06T19:06:10.126258Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06603","last_updated":"2025-08-01T08:19:46Z","snapshot_observed_at":"2026-08-06T18:57:01.949640Z","submitted_at":"2025-07-09T07:22:54Z","title":"Cross-Modal Dual-Causal Learning for Long-Term Action Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:10.126258Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2507.06603"},"observation_digest":"sha256:c99ae71522881648260fac35b26b6df7e958525d872858551868bcba714f6c97","observation_id":"20eb1f78-df11-452c-8d85-d2e28be4e7f5","resolution":{"observed_at":"2026-08-06T19:06:10.126258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-08-06T05:44:19.783785Z","title":"Tokenlearner: What can 8 learned tokens do for images and videos? arXiv preprint arXiv:2106.11297 , 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01385","last_updated":"2025-08-02T14:28:57Z","snapshot_observed_at":"2026-08-07T22:18:21.940432Z","submitted_at":"2025-08-02T14:28:57Z","title":"Lightweight Backbone Networks Only Require Adaptive Lightweight Self-Attention Mechanisms","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:19.783785Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2508.01385"},"observation_digest":"sha256:c4b2627408730ac1bab4ded523634328f37c94d5c54ca81912556c5f94e3be20","observation_id":"43973908-3670-483a-aa6a-24b75984db3a","resolution":{"observed_at":"2026-08-06T05:44:19.783785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-08-04T14:43:15.404908Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.23876","last_updated":"2026-07-04T08:20:05Z","snapshot_observed_at":"2026-08-07T20:39:02.578525Z","submitted_at":"2025-09-28T13:33:49Z","title":"Rethinking Visual Autoregressive Sampling with Information-Grounding Guidance","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:15.404908Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2509.23876"},"observation_digest":"sha256:18b7a3c600cb9f3106d64886d5acc6bbf3f68894a3fcbbe1f0d43fa94ecec92b","observation_id":"fbe25348-7814-438d-8213-2927ef1591f0","resolution":{"observed_at":"2026-08-04T14:43:15.404908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-08-03T21:31:35.530259Z","title":"Tokenlearner: What can 8 learned tokens do for images and videos?arXiv preprint arXiv:2106.11297, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.15098","last_updated":"2026-06-21T15:38:16Z","snapshot_observed_at":"2026-08-03T21:31:33.690337Z","submitted_at":"2025-11-19T04:13:36Z","title":"A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T21:31:35.530259Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2511.15098"},"observation_digest":"sha256:c0644523bb3db4e0bcd9b6a85d26bc7f261732808a3759a733f9cf91c2ec2968","observation_id":"3f421aac-06a1-4aea-b0b3-ee1b5bee056f","resolution":{"observed_at":"2026-08-03T21:31:35.530259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-08-03T03:56:05.496346Z","title":"S., Piergiovanni, A., Arnab, A., Dehghani, M., and Angelova, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.496346Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:55c73f7f9a84bf0eb6a354e29d0c4e8932075184ab07a1a7ae6748843fb822f6","observation_id":"a4b86630-081a-4e87-b794-675d41d62a52","resolution":{"observed_at":"2026-08-03T03:56:05.496346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-13T23:00:31.128534Z","title":"Tokenlearner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.17720","last_updated":"2026-07-01T05:08:44Z","snapshot_observed_at":"2026-08-09T21:37:45.555205Z","submitted_at":"2026-03-18T13:40:24Z","title":"VolumeDP: Modeling Volumetric Representation for Manipulation Policy Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T23:00:31.128534Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2603.17720"},"observation_digest":"sha256:f9488dc9d0d0ce8330eeac55f23bcb243fbc5b387a101ce933bd5df0fe250d20","observation_id":"165234c0-d7f8-4856-8725-9299041fa718","resolution":{"observed_at":"2026-07-13T23:00:31.128534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2604.16745","last_updated":"2026-04-17T23:26:27Z","snapshot_observed_at":"2026-07-31T08:40:36.667404Z","submitted_at":"2026-04-17T23:26:27Z","title":"Why Training-Free Token Reduction Collapses: The Inherent Instability of Pairwise Scoring Signals","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-10T07:59:10.678150Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2604.16745"},"observation_digest":"sha256:e676a25381e45419cdcfdfdc8593fa38782215980346710cdb5f8a3679cd3dda","observation_id":"4406e2e2-1d2a-4158-b0ea-ec86cfa3b9d9","resolution":{"observed_at":"2026-05-10T08:02:25.416558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2605.07766","last_updated":"2026-05-08T14:07:10Z","snapshot_observed_at":"2026-07-31T22:27:20.343973Z","submitted_at":"2026-05-08T14:07:10Z","title":"Head Similarity: Modeling Structured Whole-Head Appearance Beyond Face Recognition","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-11T02:54:58.288120Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2605.07766"},"observation_digest":"sha256:176c6480fa23ff54f0c1eca6cfec4dde817df6b38740120b0a5b729bb24f7760","observation_id":"2fef50d5-e49b-4462-81b9-bd9f7a21d282","resolution":{"observed_at":"2026-05-11T02:55:52.997875Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2606.00620","last_updated":"2026-05-30T08:51:28Z","snapshot_observed_at":"2026-07-06T23:41:19.955034Z","submitted_at":"2026-05-30T08:51:28Z","title":"FlowNar: Scalable Streaming Narration for Long-Form Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T19:08:36.655886Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2606.00620"},"observation_digest":"sha256:fcca46da4f0633f4fa75e96fea06ebeb86ac8c420cda4179a37dbbf53acab47e","observation_id":"febe5295-0f6b-4e26-9148-b2cca8ad8efd","resolution":{"observed_at":"2026-06-28T19:12:34.739821Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2606.02735","last_updated":"2026-06-08T17:19:24Z","snapshot_observed_at":"2026-08-04T14:14:05.900644Z","submitted_at":"2026-06-01T18:02:07Z","title":"See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T14:04:43.270155Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2606.02735"},"observation_digest":"sha256:ae7d19fb866f7e56d666f863e97a79f35dae39371e5d8ed29648f5e42ac1f29e","observation_id":"fa4617a4-e2da-43c2-a07c-c1e12f017da7","resolution":{"observed_at":"2026-07-01T23:36:24.027110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2606.19932","last_updated":"2026-06-18T08:31:11Z","snapshot_observed_at":"2026-08-02T12:17:27.130385Z","submitted_at":"2026-06-18T08:31:11Z","title":"Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T17:53:38.503877Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2606.19932"},"observation_digest":"sha256:ce33efb7ca485c6e461fb91ceb48d9e0b58176b58333be9ea930c5f8104bac11","observation_id":"48025284-28ab-4294-8957-8eccd88a7b8f","resolution":{"observed_at":"2026-07-04T03:39:29.530970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2606.24422","last_updated":"2026-06-23T10:59:25Z","snapshot_observed_at":"2026-08-08T18:07:02.107336Z","submitted_at":"2026-06-23T10:59:25Z","title":"EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T00:26:33.306128Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2606.24422"},"observation_digest":"sha256:615060a32a54e05758fe2e1df6ae16ef03817772cdba55cfc81df3daccb90952","observation_id":"b1d9f042-20ba-47ca-b090-35e5a176ecdb","resolution":{"observed_at":"2026-07-04T16:39:57.310471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2606.26398","last_updated":"2026-06-30T17:31:21Z","snapshot_observed_at":"2026-08-06T01:07:08.432058Z","submitted_at":"2026-06-24T21:31:13Z","title":"DinoLink: A Token-Centric Representation Compression Framework for Bandwidth-Constrained Collaborative V2X Perception","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T01:19:37.860746Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2606.26398"},"observation_digest":"sha256:edc971ddd234b48ac3c0945f83217837e52ac8c227caf341d6f2799275dc9035","observation_id":"f721aee8-9c59-4278-b5f7-33c600d4a454","resolution":{"observed_at":"2026-07-04T15:49:57.573225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2606.26398","last_updated":"2026-06-30T17:31:21Z","snapshot_observed_at":"2026-08-06T01:07:08.432058Z","submitted_at":"2026-06-24T21:31:13Z","title":"DinoLink: A Token-Centric Representation Compression Framework for Bandwidth-Constrained Collaborative V2X Perception","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T06:24:11.726818Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2606.26398"},"observation_digest":"sha256:4d4f93b481e91624da0f9a97e0f07ae1a0eddf60ec2a7f46290523231f72c0d2","observation_id":"b299ec41-e64c-4819-94c5-0e0e881431e2","resolution":{"observed_at":"2026-07-01T09:35:40.915278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-12T01:55:58.109603Z","title":"Tokenlearner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03520","last_updated":"2026-07-03T17:47:43Z","snapshot_observed_at":"2026-08-03T05:06:28.327712Z","submitted_at":"2026-07-03T17:47:43Z","title":"ATS-ToDMA: Adaptive Token Selection and Token-Domain Multiple Access for Cross-Modal Semantic Communications","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T01:55:58.109603Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2607.03520"},"observation_digest":"sha256:8fd3d58dbae8b8ac9e5a4f339b4d25ca7de74f93761c2be6bae8716cb7e6af19","observation_id":"e59ce50a-90e3-4220-a333-c8ae05a661d9","resolution":{"observed_at":"2026-07-12T01:55:58.109603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-08-01T17:32:32.351486Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-07T15:23:14.031727Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:32.351486Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:9cdb6b631a80342c76a0248b85696668fdc6874878edd9219cee6a7ee1ccc42e","observation_id":"4d53f9a7-1533-4aa6-8abd-329d56327106","resolution":{"observed_at":"2026-08-01T17:32:32.351486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2106.11297/citation-record","integrity":"/paper/2106.11297/integrity","json":"/paper/2106.11297/citation-record.json","paper":"/paper/2106.11297"},"outbound":[],"paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2106.11297."}