{"as_of":"2026-08-19T19:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:106b04e8a8cd2eaf03442450fa1a8969c23bf376e157ac5b273039dcd68dac1d","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:18:49.027719Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:51:26.993426Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:51:30.627840Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"cited_work":{"arxiv_id":"2411.19460","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19460","snapshot_observed_at":"2026-08-07T11:51:30.627840Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","venue":"cs.CV","work_id":"0548de81-786c-4c66-ae8d-86de275fdc87","year":2024},"citing_paper":{"arxiv_id":"2506.01274","last_updated":"2026-06-11T17:06:50Z","snapshot_observed_at":"2026-08-10T04:03:56.011290Z","submitted_at":"2025-06-02T03:08:07Z","title":"ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:26.993426Z"},"links":{"cited_paper":"/paper/2411.19460","citing_paper":"/paper/2506.01274"},"observation_digest":"sha256:435e54bf329727fc19d6a1761cf272b1c160b5761a3f41fe8f47be29e466b487","observation_id":"183b11b8-f18f-4977-97fe-0a930ed3a14f","resolution":{"observed_at":"2026-08-07T11:51:30.674736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.19460/citation-record","integrity":"/paper/2411.19460/integrity","json":"/paper/2411.19460/citation-record.json","paper":"/paper/2411.19460"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T10:18:48.804862Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.804862Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:1521d8f2eaf8c171b9c867dd05f34572d59a796e5a9bae3bc79060f9dfb11602","observation_id":"9db3598f-9853-47f7-92c4-d2fc54454efe","resolution":{"observed_at":"2026-08-12T10:18:48.804862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:48.810075Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.810075Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:20263637d56700842742b3d8570dc8f26bf8515ffa066cbf33867b5185a5e164","observation_id":"72076b41-50c3-43a2-94c9-56dab3c8f539","resolution":{"observed_at":"2026-08-12T10:18:48.810075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:48.814804Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.814804Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:2df16a4d483c002a053961bd0030c9da628de486a7e12ee742f236ea63ca57dc","observation_id":"2fe1f85c-45f4-4158-8036-90da990e5da3","resolution":{"observed_at":"2026-08-12T10:18:48.814804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-12T10:18:48.819643Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.819643Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:53366e4870573528f3745d7e3e7d95b8993d473e4af90f78805f2807027998d0","observation_id":"130a81ae-75d5-47e6-afa2-7b1689c72968","resolution":{"observed_at":"2026-08-12T10:18:48.819643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-08-16T11:24:28.964729Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-12T10:18:48.825125Z","title":"Extending context window of large language models via positional interpolation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.825125Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:889f614717306e97c30f6f41a061aa0de46cbcf50ebe0e4698eefca0d6cde180","observation_id":"b75fc56b-087f-48ca-b8c9-02b5f4d8cfaa","resolution":{"observed_at":"2026-08-12T10:18:48.825125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T14:33:36.303679Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-12T10:18:48.830334Z","title":"Training deep nets with sublinear memory cost","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.830334Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:84e3e8ee3385a5c7b2d1d7c1ceca5fb0a9d17aab724d38d69b1a3c5c4e81955f","observation_id":"032fbfcd-72d3-44fc-b461-348aa8ea2cd9","resolution":{"observed_at":"2026-08-12T10:18:48.830334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-12T10:18:48.835878Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.835878Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:2c870871dc17ab70863fdd126b00a3e76a96f2f24f1f57a52b6175959435a2fd","observation_id":"4f3e0c6f-df85-4f9e-afcf-ca4858684ca2","resolution":{"observed_at":"2026-08-12T10:18:48.835878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:48.841017Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.841017Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:af6a2c0f63711b9b5c5965932e4e37450e8e30064773dcff048c020501ee6f80","observation_id":"f87afc0f-a902-4040-b83e-2ccdf8d83d17","resolution":{"observed_at":"2026-08-12T10:18:48.841017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.705685Z","title":"InstructBLIP: Towards general-purpose vision- language models with instruction tuning","venue":null,"work_id":"d835cace-10b0-4813-9bc9-fe7f46740c41","year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.846792Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:7639d9c64e9b1cf9dd779031bdd28cb4422455a343225d24bd2ed7ee80e056de","observation_id":"5d8c4342-707f-48ec-afd4-dd58f7a92bda","resolution":{"observed_at":"2026-08-12T10:18:49.709411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.692789Z","title":"Carbonell, Quoc V","venue":null,"work_id":"ee95ad85-cc4f-45b4-927c-57d63b0e0742","year":2019},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.852157Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:64dd8ea7ba27f9270c70203a3cd7710c57c196f78c6c0e8eef5fb5f927e93191","observation_id":"d39ef85d-e66a-4939-93b6-be7430344979","resolution":{"observed_at":"2026-08-12T10:18:49.696856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-12T10:18:48.856760Z","title":"Transformers are ssms: General- ized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.856760Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:e0f7bc03f726ceba6d44f59c988c36edf9ef04fd37362572174c2eacaaf172ca","observation_id":"ef8deede-0ef0-4dda-a51f-c4880bb54a2a","resolution":{"observed_at":"2026-08-12T10:18:48.856760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.678971Z","title":null,"venue":null,"work_id":"08877d08-e408-4304-bfb2-9dbd2ce6c4dd","year":1990},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.861579Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:3d40c3917180e759e4e9c2f70995ebc3a76123d2a01221e4f8edf25c0d32d152","observation_id":"1c7e8b83-a8d7-49c5-af49-4116617ec714","resolution":{"observed_at":"2026-08-12T10:18:49.683720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-12T10:18:48.866004Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.866004Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:84841c5295f1a1d087f25d91d91fbe6611174219593d587af2b3b5a63fc7db29","observation_id":"0254b474-b400-4efc-b41a-b0ad6926d13f","resolution":{"observed_at":"2026-08-12T10:18:48.866004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.664019Z","title":"Gemini, 2023","venue":null,"work_id":"2d0ea051-e59d-4453-9761-116267c31e09","year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.870798Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:fa4b638b45153f1b61ab3101e857838c7c42f3bd75514d8435d5ca5c136edc36","observation_id":"59ba5ba2-f4bf-4df5-8c52-ed6ab6216899","resolution":{"observed_at":"2026-08-12T10:18:49.668616Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-12T10:18:48.874459Z","title":"Mamba: Linear-time sequence mod- eling with selective state spaces","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.874459Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:cddee83a087479003785fc9df628ff5c77287432d059872cade2eb5a61537744","observation_id":"c7812791-c6a1-431b-9757-69c4bd574e66","resolution":{"observed_at":"2026-08-12T10:18:48.874459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.648534Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"c0a7cfcd-df91-47b6-98c2-8f229a8d148e","year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.879095Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:aa92ef62685024c7c2e7f258197231addb9d6a2a37e61af1a90c71c5dae093d7","observation_id":"702511e1-4a83-4f5a-a365-e04a74162392","resolution":{"observed_at":"2026-08-12T10:18:49.653153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T10:18:48.883094Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.883094Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:bb1aab6b47c79f56a0dafee13cc5b300011cbb65c28c6eaab498a81d3f8664c3","observation_id":"26554f67-49de-4f01-982e-89072e98f455","resolution":{"observed_at":"2026-08-12T10:18:48.883094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.633265Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video un- derstanding","venue":null,"work_id":"0d5925f4-3948-4566-98b3-6298108e6e24","year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.886856Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:ac6628b509ca4aa2100f668a1a9cca1baba2c3c0b268d59bc8d199f29b059fc2","observation_id":"f403274c-bd80-484f-b457-a47c2170bd8c","resolution":{"observed_at":"2026-08-12T10:18:49.638726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16173","snapshot_observed_at":"2026-08-12T10:18:48.890691Z","title":"Sa- lova: Segment-augmented long video assistant for targeted retrieval and routing in long-form video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.890691Z"},"links":{"cited_paper":"/paper/2411.16173","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:d1373e347b7d964be958dc35ef9626111a5a7d80f6c4c92f0b894c0396ccd294","observation_id":"e2fbcb1b-fc7c-481e-ad04-a3026aca8db2","resolution":{"observed_at":"2026-08-12T10:18:48.890691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T10:18:48.894912Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.894912Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:3e2c6b242e0f9e4c491952e1a247ee96fc4934647122e62dd4cf6241530ffd7f","observation_id":"3f4ece90-3024-4099-abc0-e2a9c28d6972","resolution":{"observed_at":"2026-08-12T10:18:48.894912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.618064Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"7cfd2d10-3082-463f-af16-6931c0a5f78f","year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.899206Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:c0761fe3e2325bf2404cff4be3c5a7e1f412416ad8bd486f8b58e36bfdb683a1","observation_id":"3c10b7af-dae0-447f-8b34-e5e2ff668878","resolution":{"observed_at":"2026-08-12T10:18:49.623640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.604435Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"ca2270da-ea11-459a-8901-f89b11f5bf59","year":2025},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.903388Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:d3faa5cac92a06197fdeb875295761b1126880b5ca831a364f15e9b5882fdd02","observation_id":"b12c7654-61c5-473a-b9b6-a37441062a41","resolution":{"observed_at":"2026-08-12T10:18:49.608876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T10:18:48.907774Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.907774Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:ee6187db2d6e660e0fe494f8cf194f8591e4791ad10c189525d8e73a16c65623","observation_id":"72dbc329-34c5-40b9-9250-cf6f1d7c0ab2","resolution":{"observed_at":"2026-08-12T10:18:48.907774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:48.912065Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.912065Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:2e49fca625519bafde72d5de6ca40890673db1a98671572d51fcbcc5a779a165","observation_id":"60fa7ac8-2a5b-4a0c-be7c-00968b382655","resolution":{"observed_at":"2026-08-12T10:18:48.912065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-12T10:18:48.916464Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.916464Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:a3e011b0e2e0ed0c76202d3679040d5a356ba8d317579711459afadb5c526fdf","observation_id":"24f6934b-25ae-4e31-8863-b41f7f2144b4","resolution":{"observed_at":"2026-08-12T10:18:48.916464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.580968Z","title":"Visual instruction tuning","venue":null,"work_id":"cceca62c-179a-4a22-b3fe-9ad395064bc5","year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.921543Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:855e6f826bd0f6eeef616439b2ea7fb16a64325edb810597c3c340db92a51cf3","observation_id":"6cc0fa21-6e0e-4470-add8-3ec019072f18","resolution":{"observed_at":"2026-08-12T10:18:49.585250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.566891Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"3cf233f1-3e5c-43ca-bd42-65c03d7b5a74","year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.926840Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:f415b4ec867f2e4e7ab9fb9620a2e0d39df5647ce1c491ca3a87f58d52f1298b","observation_id":"375c1fb3-0bd4-4be5-a08e-3478fb860253","resolution":{"observed_at":"2026-08-12T10:18:49.571689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.551691Z","title":"St-llm: Large language models are effective tem- poral learners","venue":null,"work_id":"5fd6476d-86a2-48bb-9798-20714b684ea4","year":2025},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.930923Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:7e6d62f9427c4fa0b7ea18de7a17455eb2d1c8a9005baa740a5d566a346d4d61","observation_id":"d22fb7ad-5e82-4d75-9f09-38732f86db06","resolution":{"observed_at":"2026-08-12T10:18:49.556981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-12T10:18:48.935134Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.935134Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:a6c0f3a4954a041b4db4ead980352a5c904756b9f80c6f8e57395bcf6cc0a606","observation_id":"df05a570-1c62-4d11-b7ad-2696d90c3d61","resolution":{"observed_at":"2026-08-12T10:18:48.935134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.536333Z","title":null,"venue":null,"work_id":"381c5221-652d-436e-8a6b-b5f6b0e0fc8e","year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.939475Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:f48584ecd7d250fecb85db385fa4fd1fc3d2dde0b3f697a3daa464c6a45ca56f","observation_id":"84a7696c-fb1a-49f3-8dae-f8e67e313c6c","resolution":{"observed_at":"2026-08-12T10:18:49.540791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.523378Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":"89f632b2-6425-457c-908c-32b78a6673e4","year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.943464Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:c35a3ff1efc7b9e00b45860076392b8a718de7851b570f76e98eb960c91c0197","observation_id":"318d6140-e45d-4adf-8505-73b2dc1ca5e3","resolution":{"observed_at":"2026-08-12T10:18:49.527375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.510209Z","title":"GPT-4V(ision) System Card, 2023","venue":null,"work_id":"d7346cd5-322e-457e-bc9c-3adeba6eb684","year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.947683Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:cf1d2a040b1c2f15e3591d82640e8e5b5fadd3cb962f8a925bcb0773cab69823","observation_id":"a05b3b41-1cc9-46d1-8e1e-ac0d238245fa","resolution":{"observed_at":"2026-08-12T10:18:49.514325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.496038Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":"0740d46d-ecbd-464b-bf52-4b4f230cb54a","year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.952650Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:570550ba4f755103337a37a3c9c0f0298a76f895ab0c5ef5ca6b346e6984c306","observation_id":"0b310332-44b2-44df-9697-3ab7728a8237","resolution":{"observed_at":"2026-08-12T10:18:49.500726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.481399Z","title":"Per- ception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"053e1568-1fed-4d5e-a1ce-a29b4187dda6","year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.957475Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:1c87b93eecd9ccc860aab4d0784e7cceb61b9c1d391a55bbbda41ee070dc8c84","observation_id":"d7e09123-524b-4721-ab18-e10a330f4c1f","resolution":{"observed_at":"2026-08-12T10:18:49.486239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-12T10:18:48.961665Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.961665Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:87db7cf2640af032652f4248fb4cdd38c70674d7969b42fba993e9724e9899c6","observation_id":"09d38a4e-fc63-47d0-abeb-2b0ef6059c06","resolution":{"observed_at":"2026-08-12T10:18:48.961665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:48.966731Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.966731Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:660f9366adfabebb6a15b0e73319046ad1269c20911e206000d1c6892e65458e","observation_id":"c7364031-9522-42c9-bd11-01cc2acc7562","resolution":{"observed_at":"2026-08-12T10:18:48.966731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:48.970446Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.970446Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:1e3458c19457989ced2f1216fc6014f93d80022b692c56ae0860ddb4bf3a0cba","observation_id":"d5fe7973-96b5-444b-9284-9a4716d729d0","resolution":{"observed_at":"2026-08-12T10:18:48.970446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T10:18:48.974203Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.974203Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:373cc03b15900cb0c8e9589ae3b8f86cb549af6d800dc2e08076ac60ef22dd86","observation_id":"789174ea-bc8d-40b0-ae0a-b48751e13b74","resolution":{"observed_at":"2026-08-12T10:18:48.974203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.448989Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"e0da11ef-9275-4c76-83ce-e9a1d1bb5c4b","year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.978180Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:074acf7bff64c099dfd29a60cd8a23ba63460b577e0e8ee411178afeb6c06e67","observation_id":"d3890664-597c-4466-b583-b757d81a20a9","resolution":{"observed_at":"2026-08-12T10:18:49.453690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-12T10:18:48.981971Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.981971Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:4b0f609b62f528d07a15d9593a3f1e7262f657bd814c56b43bfae11991899632","observation_id":"ba598f2d-d3f2-4e3f-aefa-3cf25108b366","resolution":{"observed_at":"2026-08-12T10:18:48.981971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T10:18:48.986058Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.986058Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:fc8cacfa83649671569954a876fb5c183f78e6def2986e538c2d7196a0c2f81f","observation_id":"38878d5f-5a09-4f6b-8070-c769f23e7f2a","resolution":{"observed_at":"2026-08-12T10:18:48.986058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:48.990518Z","title":"Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.990518Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:4488d1bbdfddf7f6338a0ce389ec53252a3e78922072b29285157ea47d62c677","observation_id":"def39225-2242-4f4b-bb55-28bd1a1a49ca","resolution":{"observed_at":"2026-08-12T10:18:48.990518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-15T01:28:11.776642Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-12T10:18:48.994759Z","title":"Longvideobench: A benchmark for long-context inter- leaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.994759Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:e3b5b872f223d2904ab0f56e8dc77ec0c46a190634347b51688120209c24e075","observation_id":"19b2aced-f036-4763-b2fc-8a0db721a5dd","resolution":{"observed_at":"2026-08-12T10:18:48.994759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.423603Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"7791d469-1853-43c6-adce-8de641238b7a","year":2021},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.999110Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:cc97c88fd6cef669cb5e86e24498c96ebf0d50218374d1715b5dce04183c4bc0","observation_id":"0a3a4d02-a354-4c08-bae7-3a324569d062","resolution":{"observed_at":"2026-08-12T10:18:49.428747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-12T10:18:49.003350Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:49.003350Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:f9e6cd272e7d4d0e4c2da03721dcaccd53bf5d2db6afbf7364a42eaf8d46d6e0","observation_id":"d15fe8d8-4572-4417-b33e-e6dc7cc13461","resolution":{"observed_at":"2026-08-12T10:18:49.003350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:49.406222Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"71165ed4-527d-4eff-9901-202b5d3caa29","year":2019},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:49.008889Z"},"links":{"citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:5bc2dfa0fe3b274b8c733acfdc41ad15319011618dfaa3477d6a9658b80d6271","observation_id":"249bb2d6-462a-4700-affa-8237952600de","resolution":{"observed_at":"2026-08-12T10:18:49.413523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T10:18:49.013908Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:49.013908Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:7dd9faf7d2666dc451594e81b480afb966a4e856e6496884e8242714b54afacb","observation_id":"ea51b055-9ed7-4a4e-8877-40140064e02c","resolution":{"observed_at":"2026-08-12T10:18:49.013908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-12T10:18:49.018500Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:49.018500Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:12d1de9260874e6b95f149571cbc9d20a49bbcf9b27dc19d92c3c026336cea6f","observation_id":"014dcff1-068b-4b01-aed4-565e544efa92","resolution":{"observed_at":"2026-08-12T10:18:49.018500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-12T10:18:49.023170Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:49.023170Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:0b3d043cb544b25817d044a5a9919dd56713764b6712e310f529f154e9c78214","observation_id":"a2145f0f-e25a-4d12-88ab-d7495dd6e669","resolution":{"observed_at":"2026-08-12T10:18:49.023170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-16T13:43:37.776811Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-12T10:18:49.027719Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:49.027719Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:c21efa95fc33be7795897089306d489413d68f99d254cb48209bd97f9b748577","observation_id":"6e61ed9f-6618-42e0-922a-6d32942ed904","resolution":{"observed_at":"2026-08-12T10:18:49.027719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":33,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2411.19460."}