{"as_of":"2026-08-10T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4cb5bf51d5702e994f18f181f848a8c0f1248e84410c2ba2e59472234abb3b44","coverage":[{"denominator":120,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:29:56.537267Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:57:29.171219Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02591","snapshot_observed_at":"2026-08-03T14:57:29.171219Z","title":"Auroralong: Bringing rnns back to efficient open-ended video understanding.arXiv preprint arXiv:2507.02591, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.18735","last_updated":"2026-05-25T12:55:14Z","snapshot_observed_at":"2026-08-07T05:11:54.627363Z","submitted_at":"2025-12-21T13:50:26Z","title":"$M^3-Verse$: A \"Spot the Difference\" Challenge for Large Multimodal Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T14:57:29.171219Z"},"links":{"cited_paper":"/paper/2507.02591","citing_paper":"/paper/2512.18735"},"observation_digest":"sha256:4fdd25d920476516eb7c5036e33408d8022e63b9caed31fa9fd3507f8fc1efe3","observation_id":"908cfaf1-2bcd-40b4-8f85-5f8f63e346e6","resolution":{"observed_at":"2026-08-03T14:57:29.171219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02591/citation-record","integrity":"/paper/2507.02591/integrity","json":"/paper/2507.02591/citation-record.json","paper":"/paper/2507.02591"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:29:47.170619Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:47.170619Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:06b5037ad47bc615fdc4826a405aaae35833f51b88e8b885bfb7a583356347bd","observation_id":"fd7260af-fe08-4fda-8399-745342c69b9c","resolution":{"observed_at":"2026-08-06T20:29:47.170619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10945","last_updated":"2024-12-25T01:27:01Z","snapshot_observed_at":"2026-08-08T00:42:57.985115Z","submitted_at":"2024-08-20T15:34:27Z","title":"HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10945","snapshot_observed_at":"2026-08-06T20:29:47.222083Z","title":"Hired: Attention-guided token dropping for efficient inference of high-resolution vision-language models in resource-constrained environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:47.222083Z"},"links":{"cited_paper":"/paper/2408.10945","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:6c5bf83db0b1739f3b9b6e551e4998338cf2b781eac618ee045fff601e536471","observation_id":"26ac5815-ddda-4ff1-8f70-55b952b16ead","resolution":{"observed_at":"2026-08-06T20:29:47.222083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:47.286948Z","title":"In- finibench: A comprehensive benchmark for large multi- modal models in very long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:47.286948Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:c5939311523499b4a43dd41941b875e1e1a19196513c556ec8fe76eaf6d18d31","observation_id":"6e71df41-cddb-4ed0-9cba-c88cf129020e","resolution":{"observed_at":"2026-08-06T20:29:47.286948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:29:47.428876Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:47.428876Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:11ca2e98810c94b831fb17a563adad6eaee6859286129e71b212c99219305a06","observation_id":"050ede92-a899-4723-9dfa-8c1005e9b05d","resolution":{"observed_at":"2026-08-06T20:29:47.428876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-06T20:29:47.584546Z","title":"Paligemma: A versatile 3b vlm for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:47.584546Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:9579143828e1c050f4af86670b77039a1ca0d6cf632c9d108f3d689afd0236dc","observation_id":"82ac5bc2-d64c-4066-bf61-72049155ccc7","resolution":{"observed_at":"2026-08-06T20:29:47.584546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10326","last_updated":"2025-03-24T20:26:56Z","snapshot_observed_at":"2026-08-10T13:04:19.472766Z","submitted_at":"2024-06-14T17:59:01Z","title":"VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10326","snapshot_observed_at":"2026-08-06T20:29:47.711985Z","title":"Vane-bench: Video anomaly evaluation benchmark for conversational lmms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:47.711985Z"},"links":{"cited_paper":"/paper/2406.10326","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:cd4020a828ec1df496631735237fa547d5dc267b4872a8f0f96745e91ff88de1","observation_id":"86aa583b-e38f-4500-9435-3eea1cb6fa26","resolution":{"observed_at":"2026-08-06T20:29:47.711985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:47.814996Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:47.814996Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:df1d5b1aa1ac3aeb5da43ff07b566febd101fdfac2b4318d00c6bd66e5c4e681","observation_id":"400a4ef2-710e-4470-b21a-1d604f15c3cb","resolution":{"observed_at":"2026-08-06T20:29:47.814996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:47.918119Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:47.918119Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:b386209665279de87fb33eef782148b9bbb139657331dfaa60bf4cde6d575070","observation_id":"7fb399f3-d917-44ac-88d5-35187acd98c2","resolution":{"observed_at":"2026-08-06T20:29:47.918119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17430","last_updated":"2024-07-29T17:59:28Z","snapshot_observed_at":"2026-08-10T13:02:49.707705Z","submitted_at":"2024-05-27T17:59:56Z","title":"Matryoshka Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17430","snapshot_observed_at":"2026-08-06T20:29:47.998290Z","title":"Matryoshka multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:47.998290Z"},"links":{"cited_paper":"/paper/2405.17430","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:140f0cdb2fa3e8cd82a3f341a38bea9f04c3a9a527b448a310c237de3ae91c44","observation_id":"0f3e4acc-c4f0-4034-9e3f-43b4e2628177","resolution":{"observed_at":"2026-08-06T20:29:47.998290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:48.089471Z","title":"View transformer layers from online optimization perspective, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:48.089471Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:a324cd7c184a678d605238a82946653cdd0435281c3fa9138c23b121c0fb0662","observation_id":"6eb9324b-c854-49d8-9a63-c23479ecc6c8","resolution":{"observed_at":"2026-08-06T20:29:48.089471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-10T13:01:50.105472Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-06T20:29:48.227081Z","title":"Auroracap: Ef- ficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:48.227081Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:95bb85f5d77cf9c0ac4d639f88de84af63c5b64c0b95af3624c343a0e2a5a8d5","observation_id":"7b21e852-8f3b-4f2d-9372-9a4dce0f8077","resolution":{"observed_at":"2026-08-06T20:29:48.227081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09626","last_updated":"2024-03-14T17:57:07Z","snapshot_observed_at":"2026-08-10T10:51:01.342823Z","submitted_at":"2024-03-14T17:57:07Z","title":"Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09626","snapshot_observed_at":"2026-08-06T20:29:48.369805Z","title":"Video mamba suite: State space model as a ver- satile alternative for video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:48.369805Z"},"links":{"cited_paper":"/paper/2403.09626","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:3f5e4fe47fd38175573fd3cd71f73ea4c69f6b6c91e183fe61c38bf440892b8c","observation_id":"05cfcee0-61aa-4dad-95f3-7633ca240c40","resolution":{"observed_at":"2026-08-06T20:29:48.369805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T20:29:48.489965Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:48.489965Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:af8bad8ec70a2bd35990b0ef053ef32d88c470d199869b323fd24030715af607","observation_id":"67515cb2-5b29-4a06-be65-585b37f24353","resolution":{"observed_at":"2026-08-06T20:29:48.489965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-08T22:33:21.852107Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-06T20:29:48.568606Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:48.568606Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:94163d2837e22cd48b4043fe688aa5978c0f1e0d0985f6e53813690be26657e2","observation_id":"eef22555-b744-4038-8e00-8a46b63f3888","resolution":{"observed_at":"2026-08-06T20:29:48.568606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20340","last_updated":"2024-05-30T17:59:50Z","snapshot_observed_at":"2026-08-09T07:42:51.616278Z","submitted_at":"2024-05-30T17:59:50Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20340","snapshot_observed_at":"2026-08-06T20:29:48.674994Z","title":"Motion- llm: Understanding human behaviors from human motions and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:48.674994Z"},"links":{"cited_paper":"/paper/2405.20340","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:ded29c244b54d7ea327d0ed68eba20695b308580e5ad001c496a441e89b50881","observation_id":"54b94232-4936-4c5b-83ae-3360eb5bea48","resolution":{"observed_at":"2026-08-06T20:29:48.674994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:48.973755Z","title":"Stuffed mamba: State col- lapse and state capacity of rnn-based long-context model- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:48.973755Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:a88d74ef0a78d3c17b0a41c4ec63dde5c925c96a067faf440de5a554e2063d0e","observation_id":"518e2809-35a0-4685-8c4c-de6170ccf924","resolution":{"observed_at":"2026-08-06T20:29:48.973755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-06T20:29:49.077308Z","title":"InternVL: Scaling up vision founda- tion models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:49.077308Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:c99712ed137961d05db6007fbcbb28e0c3ccc926c7da9e4ce5b3b1f892d550d5","observation_id":"658d614a-3946-4d30-b409-c44a47429924","resolution":{"observed_at":"2026-08-06T20:29:49.077308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T20:29:49.151067Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:49.151067Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:705ae11e3b10b19ddf01934bef4df3298839460bc1d708f6999bf570c851779f","observation_id":"2159393d-359b-4bf4-b3c1-2c44b1b3c8ca","resolution":{"observed_at":"2026-08-06T20:29:49.151067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T20:29:49.254227Z","title":"How far are we to gpt-4v? clos- ing the gap to commercial multimodal models with open- source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:49.254227Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:d9d7586690c1083ccbb2b0d8072ce9d00f02ec306b45917663b10e2e77aa1cc4","observation_id":"5125826a-e05b-44f4-8e0e-d056a65494fe","resolution":{"observed_at":"2026-08-06T20:29:49.254227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T20:29:49.334244Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:49.334244Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:a74615db696d2ad5d3cb0444ea41699a821d7019374ec1e71eb5d60ac1dce245","observation_id":"e5c1393e-2194-4f0a-9adc-f040f4e1f40c","resolution":{"observed_at":"2026-08-06T20:29:49.334244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-06T20:29:49.455631Z","title":"Transformers are ssms: Gener- alized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:49.455631Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:52b70cdcc57a18d69512301e52dd81ba850e865dd498eac06e06590367e6576f","observation_id":"f7e63bfc-07a6-4c67-a0fe-1cbf2929b32e","resolution":{"observed_at":"2026-08-06T20:29:49.455631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-06T20:29:49.624319Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models.arXiv preprint arXiv:2402.19427, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:49.624319Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:4bed11a5f099489a763c38eb887842d1e3e2357f6520108b60e553486b018d51","observation_id":"889cdfca-77ea-444e-be11-5f1d974dba96","resolution":{"observed_at":"2026-08-06T20:29:49.624319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:49.743701Z","title":"Gate-variants of gated re- current unit (gru) neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:49.743701Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:aa0d0355465a625bbf8f42bf07704fdfec6d9295ba3fd605c5edf56ae6c30ceb","observation_id":"d6032bc0-b3ab-48ea-937f-15b7b414e895","resolution":{"observed_at":"2026-08-06T20:29:49.743701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14129","last_updated":"2024-06-20T09:14:19Z","snapshot_observed_at":"2026-08-10T13:04:19.608928Z","submitted_at":"2024-06-20T09:14:19Z","title":"Towards Event-oriented Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14129","snapshot_observed_at":"2026-08-06T20:29:49.820033Z","title":"Towards event-oriented long video under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:49.820033Z"},"links":{"cited_paper":"/paper/2406.14129","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:970f5b50ead611acd8d202b39ff7f958c8a743a7ac6d133966b0b7de1b224c12","observation_id":"864436db-4c6d-4a50-bea4-c18eb3217e64","resolution":{"observed_at":"2026-08-06T20:29:49.820033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02308","last_updated":"2025-03-31T06:14:48Z","snapshot_observed_at":"2026-08-10T09:03:08.430176Z","submitted_at":"2024-03-04T18:46:20Z","title":"Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02308","snapshot_observed_at":"2026-08-06T20:29:49.891728Z","title":"Vision-rwkv: Efficient and scalable vi- sual perception with rwkv-like architectures.arXiv preprint arXiv:2403.02308, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:49.891728Z"},"links":{"cited_paper":"/paper/2403.02308","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:96a7488cb16e1c05e902440e7104ca1643128194f4d3163a79655f6498293bc0","observation_id":"67b408c5-29ca-49df-a29c-9846938969cd","resolution":{"observed_at":"2026-08-06T20:29:49.891728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:50.028784Z","title":"Videoagent: A memory-augmented mul- timodal agent for video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:50.028784Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:abd3709d66e8ee3cc63af9e86eabeb2e3dbabce4f8b01dd5423a9d3d5093b278","observation_id":"7adf30ca-8359-47d1-833d-9416aa5f6e3c","resolution":{"observed_at":"2026-08-06T20:29:50.028784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01201","last_updated":"2024-11-28T07:10:33Z","snapshot_observed_at":"2026-08-10T13:02:51.863154Z","submitted_at":"2024-10-02T03:06:49Z","title":"Were RNNs All We Needed?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01201","snapshot_observed_at":"2026-08-06T20:29:50.131873Z","title":"Were rnns all we needed? arXiv preprint arXiv:2410.01201, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:50.131873Z"},"links":{"cited_paper":"/paper/2410.01201","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:50093bbc783ba276bbea53bfc15e06b40e9cd097be28ea1666ae5d6d68e87b25","observation_id":"cad1da19-64d5-40e3-9867-bd0534405420","resolution":{"observed_at":"2026-08-06T20:29:50.131873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T20:29:50.229493Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:50.229493Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:91322a15c71a29b81f8bcb9b1bc013582a36d032dbdb8b528972d192760fa687","observation_id":"7568dce7-d255-4613-9cc3-9f90767b4b4c","resolution":{"observed_at":"2026-08-06T20:29:50.229493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:50.302154Z","title":"Long short-term memory","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:50.302154Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:5e9342b43aa6e98cb3e520464e74ef3c501ed18353e049f4ada9cd308313f613","observation_id":"bc7552e6-52e4-4ee8-971f-3618e1c7ba2d","resolution":{"observed_at":"2026-08-06T20:29:50.302154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-06T20:29:50.386856Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:50.386856Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:0d4ea99ba3c9c72fd5f65ad71af25f5333f2a35358592935d5ca0fa02ec091dd","observation_id":"77d5682a-b30c-42db-b433-4261c4fdda77","resolution":{"observed_at":"2026-08-06T20:29:50.386856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10300","last_updated":"2025-02-05T09:57:59Z","snapshot_observed_at":"2026-08-10T13:04:48.734344Z","submitted_at":"2023-12-16T03:17:30Z","title":"Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10300","snapshot_observed_at":"2026-08-06T20:29:50.482506Z","title":"Shot2story20k: A new benchmark for comprehen- sive understanding of multi-shot videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:50.482506Z"},"links":{"cited_paper":"/paper/2312.10300","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:a703e42e8903c51a0690880baff2d66c317d820c59631c44d6599b8442f2d90b","observation_id":"6f53dc11-111a-4c9e-9ca0-ef9b3f4c1988","resolution":{"observed_at":"2026-08-06T20:29:50.482506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:50.583701Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:50.583701Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:d0ad238b44120182e5f9a9db09abd3eb5453d4d35ef2dd57ca577fb7e683d4f3","observation_id":"fa2f5207-8970-413d-bf4e-4d804d98ed10","resolution":{"observed_at":"2026-08-06T20:29:50.583701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:50.658548Z","title":"Masked autoencoders are scal- able vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:50.658548Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:159eff3ce30bfcc2043ddd0c3183c4768f47d98d8bfd06b040878c21843fd0ab","observation_id":"5638984e-b43e-4833-a759-52ab312519ab","resolution":{"observed_at":"2026-08-06T20:29:50.658548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13362","last_updated":"2024-12-19T05:26:14Z","snapshot_observed_at":"2026-08-10T13:01:52.077345Z","submitted_at":"2024-06-19T09:07:31Z","title":"VisualRWKV: Exploring Recurrent Neural Networks for Visual Language Models","version":3},"cited_work":{"arxiv_id":"2406.13362","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.13362","snapshot_observed_at":"2026-08-06T20:29:57.982969Z","title":"VisualRWKV: Exploring Recurrent Neural Networks for Visual Language Models","venue":"cs.CV","work_id":"e5068b24-d604-4112-9633-798f380c9415","year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:50.789507Z"},"links":{"cited_paper":"/paper/2406.13362","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:7386fb8036b9aa62b89e91c292e01cdcdcbc40c9e50a589660dcfdc903f0ff98","observation_id":"6fb40779-dca4-40bb-abb8-87b94a84d98a","resolution":{"observed_at":"2026-08-06T20:29:57.988732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:50.888495Z","title":"Token compensator: Altering in- ference cost of vision transformer without re-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:50.888495Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:03d5cd01a1ed1113aa580dd610e9802405938336a19548411db82c1539529a7c","observation_id":"6e4b89be-19af-4698-b465-3a75f94544c0","resolution":{"observed_at":"2026-08-06T20:29:50.888495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:51.012187Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.012187Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:b8683f67d6f9e69b0012e8d4bf44ae1dc2bdc92fe560b93141f7aefa9a012548","observation_id":"65cf98aa-0a57-421f-8ddf-f8a99652eb0a","resolution":{"observed_at":"2026-08-06T20:29:51.012187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11023","last_updated":"2024-12-15T02:33:37Z","snapshot_observed_at":"2026-08-10T13:02:51.326382Z","submitted_at":"2024-12-15T02:33:37Z","title":"Exploring Enhanced Contextual Information for Video-Level Object Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11023","snapshot_observed_at":"2026-08-06T20:29:51.094833Z","title":"Exploring enhanced contextual infor- mation for video-level object tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.094833Z"},"links":{"cited_paper":"/paper/2412.11023","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:8030eb619ac80d317b0085c0d2ea049cc0dd0c46fe12834f14bc50fc8f155a87","observation_id":"cd13014e-7ead-46af-9005-82a217effe0b","resolution":{"observed_at":"2026-08-06T20:29:51.094833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:51.173839Z","title":"Transformers are rnns: Fast autore- gressive transformers with linear attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.173839Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:dab1668c9a7d7bb8eff63b98b2ac0c5d9ad194219b030bb75f9215920b9f52e8","observation_id":"e660e977-e55a-46bf-b95b-d8a5b4637ed1","resolution":{"observed_at":"2026-08-06T20:29:51.173839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15595","last_updated":"2021-03-15T07:56:22Z","snapshot_observed_at":"2026-08-10T13:04:19.097027Z","submitted_at":"2020-06-28T13:11:02Z","title":"Rethinking Positional Encoding in Language Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15595","snapshot_observed_at":"2026-08-06T20:29:51.253360Z","title":"Rethinking posi- tional encoding in language pre-training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.253360Z"},"links":{"cited_paper":"/paper/2006.15595","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:2be41835aaa6293dc2c5e379a527d37990f1ed35ece0dd79eda3ab94c9ddbc77","observation_id":"7b51d115-5159-4ae8-ad73-38f1c729ed51","resolution":{"observed_at":"2026-08-06T20:29:51.253360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23782","last_updated":"2024-10-31T09:55:32Z","snapshot_observed_at":"2026-08-10T13:02:50.280033Z","submitted_at":"2024-10-31T09:55:32Z","title":"Video Token Merging for Long-form Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23782","snapshot_observed_at":"2026-08-06T20:29:51.350310Z","title":"Video token merging for long-form video under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.350310Z"},"links":{"cited_paper":"/paper/2410.23782","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:d483cc065973df0db8bfd17a5013ea46e4fc77ff57fc5f664377c2149a31c38b","observation_id":"1859956c-fa26-4f03-acbe-d34f0e8363e9","resolution":{"observed_at":"2026-08-06T20:29:51.350310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-06T20:29:51.447003Z","title":"Minimax-01: Scaling foundation models with lightning attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.447003Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:ac32ebad1a2a959c80d96d25aa99c82e0e20045b73690395bc13cf8b0c8d9de8","observation_id":"b5b48a0b-b677-4c05-b7c6-cca924d5aa4e","resolution":{"observed_at":"2026-08-06T20:29:51.447003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:51.537802Z","title":"Lmms-eval: Accelerating the development of large multimoal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.537802Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:57894714a3695c82cab75d289b2080bfe2de71cd71a41907d1e14d71f4db6de5","observation_id":"41e8f07a-f02d-405e-83f9-e0ba620521e1","resolution":{"observed_at":"2026-08-06T20:29:51.537802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T20:29:51.630112Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.630112Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:5661ae9cd345aa58529f34a4dd96a0f573a4b250993bdb89643973df4648dafd","observation_id":"ce37d5cf-a163-49c2-bf22-184a2702f662","resolution":{"observed_at":"2026-08-06T20:29:51.630112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-10T13:50:34.044232Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T20:29:51.704165Z","title":"Aria: An open multimodal native mixture- of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.704165Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:91b3f430d996843fa16779bd76f896b9068f10c7aa17a50e43b2bedce740be1f","observation_id":"67cf1236-7fa1-4118-8cbe-6711b0775924","resolution":{"observed_at":"2026-08-06T20:29:51.704165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:51.787241Z","title":"Mvbench: A comprehensive multi-modal video under- standing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.787241Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:a079d94cb6a263de40fb2bdcddd7538cc91aae22064501275f96904422e994b0","observation_id":"96efacf1-46f1-4ad7-8ead-ec7d9589b0bb","resolution":{"observed_at":"2026-08-06T20:29:51.787241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:51.870161Z","title":"Videomamba: State space model for efficient video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.870161Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:eac356382ecd2f4274e5876e42189d7ef2338c34acc6c856c1f4186d232c7d5b","observation_id":"cc3df688-87ae-43be-9cbf-90e6559d12ff","resolution":{"observed_at":"2026-08-06T20:29:51.870161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:51.962556Z","title":"Independently recurrent neural network (indrnn): Building a longer and deeper rnn","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.962556Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:c93d411d9e5a89b7ec94ec0a974f662f9e49c8116e189612fddf65af12b9f71f","observation_id":"eb4f2bdf-9eaf-4eca-9789-49d5d5680fa3","resolution":{"observed_at":"2026-08-06T20:29:51.962556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:52.058317Z","title":"Mamba- nd: Selective state space modeling for multi-dimensional data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.058317Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:4c96f5775d2b7fd873cad155784231e49e67434021f4e11c400d832cfe08ab4b","observation_id":"4d725fa6-89c5-47d4-8899-7fd448e4b2c5","resolution":{"observed_at":"2026-08-06T20:29:52.058317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-10T13:02:01.821606Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T20:29:52.144931Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.144931Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:7e90615c2f83b08eb5e94fbd44ff24ee5835bd745425c8a6f7026c51b1c72453","observation_id":"2efa0987-9240-45d2-aa06-4a09a803cc06","resolution":{"observed_at":"2026-08-06T20:29:52.144931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:52.217239Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.217239Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:3e842b41ef83ca6542a66dba31956032f21feb10d8ccaefe3ba0561475912ea6","observation_id":"427d13d9-fd81-4bd6-88c9-36743cc2950d","resolution":{"observed_at":"2026-08-06T20:29:52.217239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T20:29:52.299845Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.299845Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:17ad104a2cae524bdd8a49ded2acd1820221753786e5305a57edc5c4d819bb04","observation_id":"29839910-d5e9-4898-a35d-64c2d808633e","resolution":{"observed_at":"2026-08-06T20:29:52.299845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-08-10T13:01:53.292743Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-06T20:29:52.368568Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.368568Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:d0e605f5d30437a9927f0f3d805f591b91252ea214dde617944fd73ab3407289","observation_id":"91d85d33-4de6-46c1-9662-ac35ff987eda","resolution":{"observed_at":"2026-08-06T20:29:52.368568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:52.438157Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.438157Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:aefe21637e20e627d6e123d6d5cfe4375eea538b40c5a3e3358bcf6226a3a260","observation_id":"1268ee51-1cde-4edf-9513-2bd023e36f54","resolution":{"observed_at":"2026-08-06T20:29:52.438157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:52.544631Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.544631Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:266c5141941f46d357991e7bbcd41a19da6d42be6546f14ed0f4891dc49dd400","observation_id":"097793e8-a78c-4584-a32b-f5bb696a9267","resolution":{"observed_at":"2026-08-06T20:29:52.544631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:52.642874Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.642874Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:ef175ef8d13420f186751b9f315032c520af422c0a31b776bdcc3cd34c1c00e0","observation_id":"67cf2745-2a8b-4f86-9da3-44dafe224d18","resolution":{"observed_at":"2026-08-06T20:29:52.642874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:52.709002Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.709002Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:cb60bf00bc6836e0afb2217eae9d58fb54e50001677a3a372f417386e488bc0d","observation_id":"ee3968c0-a0cf-49e6-afc9-d3ab647abbf9","resolution":{"observed_at":"2026-08-06T20:29:52.709002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18111","last_updated":"2024-09-26T17:53:04Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:53:04Z","title":"E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18111","snapshot_observed_at":"2026-08-06T20:29:52.796096Z","title":"Et bench: Towards open-ended event-level video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.796096Z"},"links":{"cited_paper":"/paper/2409.18111","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:a150f4ca57df1185f5a26c53af8669c33ee168350d0acb6038b7be2a6e6517a2","observation_id":"ec5d62f4-428d-4497-bbd9-08a8a5b08701","resolution":{"observed_at":"2026-08-06T20:29:52.796096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19006","last_updated":"2024-11-13T10:56:14Z","snapshot_observed_at":"2026-08-10T13:03:32.256735Z","submitted_at":"2024-06-27T08:45:31Z","title":"Snakes and Ladders: Two Steps Up for VideoMamba","version":4},"cited_work":{"arxiv_id":"2406.19006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.19006","snapshot_observed_at":"2026-08-06T20:29:57.825055Z","title":"Snakes and Ladders: Two Steps Up for VideoMamba","venue":"cs.CV","work_id":"117950ec-b194-408d-9635-daa9e720fd75","year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.891899Z"},"links":{"cited_paper":"/paper/2406.19006","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:ee3815622cb7efd3dac684ba18262db3390bad2e9165049fbb18ca9e1f35d22b","observation_id":"131cfbbc-8a0e-42de-a5d0-d4c2040a6ada","resolution":{"observed_at":"2026-08-06T20:29:57.830138Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08870","last_updated":"2025-03-03T17:58:12Z","snapshot_observed_at":"2026-08-10T13:01:49.384599Z","submitted_at":"2023-12-12T09:47:59Z","title":"Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08870","snapshot_observed_at":"2026-08-06T20:29:52.976080Z","title":"Vista-llama: Reliable video narra- tor via equal distance to visual tokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.976080Z"},"links":{"cited_paper":"/paper/2312.08870","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:4ed5e388de75b73c61d24cecdc05050ed6bc1760bad0b3fb36f179022bbb9c6d","observation_id":"fef4cecf-0169-4367-8e2e-009733dc94b6","resolution":{"observed_at":"2026-08-06T20:29:52.976080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11182","last_updated":"2024-09-16T05:31:01Z","snapshot_observed_at":"2026-07-06T19:16:47.399069Z","submitted_at":"2024-09-16T05:31:01Z","title":"Video Token Sparsification for Efficient Multimodal LLMs in Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2409.11182","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.11182","snapshot_observed_at":"2026-08-06T20:29:57.789637Z","title":"Video Token Sparsification for Efficient Multimodal LLMs in Autonomous Driving","venue":"cs.CV","work_id":"d632ca54-1cd0-4300-a5b6-0ac79ef0ad99","year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:53.072085Z"},"links":{"cited_paper":"/paper/2409.11182","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:128f790cd520ba80350fd97939350a0a8767100a7d02b52997c7e48ec2f6cae5","observation_id":"2d58ae8a-7056-4704-8753-f10239e6cc0e","resolution":{"observed_at":"2026-08-06T20:29:57.794271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T20:29:53.161164Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:53.161164Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:c1ff60b83f224d86dc4a43c983564b16fcf3f2cc67ecccfe8caaacb2ee2dbb98","observation_id":"08f1d850-86c2-4028-af62-fef6abd66539","resolution":{"observed_at":"2026-08-06T20:29:53.161164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:53.257731Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:53.257731Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:9512a65b9f6b96dba9e9fbf0dd4d522f6eb3470591fdf97c6994bc80024be114","observation_id":"550f1580-0770-401c-8fdc-f1bf961f5b2d","resolution":{"observed_at":"2026-08-06T20:29:53.257731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:53.353271Z","title":"Videomamba: Spatio-temporal selective state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:53.353271Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:7942dde6cd84f88471e4aea3af41c4f7239dbf75b923b7ffafdfa4fcc06c351d","observation_id":"174d41dd-2a7a-4ac1-91c0-ecce84463bed","resolution":{"observed_at":"2026-08-06T20:29:53.353271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-06T20:29:53.451063Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:53.451063Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:af5f75e40871cc7ffc5ba1da4e473b82e0ee8ceb9a69357ca06e1c64d335036b","observation_id":"3c35457c-e2e5-4a8f-8bc9-e1ee253910da","resolution":{"observed_at":"2026-08-06T20:29:53.451063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05892","last_updated":"2024-09-26T22:39:08Z","snapshot_observed_at":"2026-08-10T10:37:29.996750Z","submitted_at":"2024-04-08T22:20:59Z","title":"Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05892","snapshot_observed_at":"2026-08-06T20:29:53.546916Z","title":"Eagle and finch: Rwkv with matrix-valued states and dynamic re- currence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:53.546916Z"},"links":{"cited_paper":"/paper/2404.05892","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:ccb404588cb8c97de714e0ac9d84aa517b719171fb269133075691a5146dd72c","observation_id":"712d3c3f-5c91-418d-b940-6534d53f7b75","resolution":{"observed_at":"2026-08-06T20:29:53.546916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14456","last_updated":"2025-03-30T13:46:44Z","snapshot_observed_at":"2026-08-07T16:54:15.957609Z","submitted_at":"2025-03-18T17:31:05Z","title":"RWKV-7 \"Goose\" with Expressive Dynamic State Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14456","snapshot_observed_at":"2026-08-06T20:29:53.623195Z","title":"Rwkv-7” goose” with expressive dynamic state evolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:53.623195Z"},"links":{"cited_paper":"/paper/2503.14456","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:818146afda97e7995876ece3107d1729123bba3b0c285dfddbcd0a29571e21a1","observation_id":"99aa023c-f10a-4c49-99c2-00644696aa80","resolution":{"observed_at":"2026-08-06T20:29:53.623195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13600","last_updated":"2024-03-20T13:48:50Z","snapshot_observed_at":"2026-08-10T13:01:51.483664Z","submitted_at":"2024-03-20T13:48:50Z","title":"VL-Mamba: Exploring State Space Models for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13600","snapshot_observed_at":"2026-08-06T20:29:53.692582Z","title":"Vl-mamba: Ex- ploring state space models for multimodal learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:53.692582Z"},"links":{"cited_paper":"/paper/2403.13600","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:3a56902179b3bafd189b5d47e3eb7edda5d29835fe9046e3711469c98147a60d","observation_id":"a9d8c3be-0243-4298-95b9-3ee921ca8923","resolution":{"observed_at":"2026-08-06T20:29:53.692582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04658","last_updated":"2024-01-15T14:57:29Z","snapshot_observed_at":"2026-08-10T13:02:55.737137Z","submitted_at":"2024-01-09T16:27:28Z","title":"Lightning Attention-2: A Free Lunch for Handling Unlimited Sequence Lengths in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04658","snapshot_observed_at":"2026-08-06T20:29:53.778431Z","title":"Lightning attention-2: A free lunch for handling unlimited sequence lengths in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:53.778431Z"},"links":{"cited_paper":"/paper/2401.04658","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:3258f13daf2e5a93e1bda01ce790e00a7e23c7655aef2988a742c589c0a7bc2d","observation_id":"210f87e3-5250-4913-835f-ce77de68d1b6","resolution":{"observed_at":"2026-08-06T20:29:53.778431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17381","last_updated":"2024-06-20T09:12:42Z","snapshot_observed_at":"2026-08-10T13:04:21.950226Z","submitted_at":"2024-05-27T17:38:13Z","title":"Various Lengths, Constant Speed: Efficient Language Modeling with Lightning Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17381","snapshot_observed_at":"2026-08-06T20:29:53.879224Z","title":"Various lengths, constant speed: Efficient language modeling with lightning attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:53.879224Z"},"links":{"cited_paper":"/paper/2405.17381","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:d29363a87e9f374105b6e7bde199df03f83090613313eac9ce94af633e90bc13","observation_id":"91df7b2a-5fb5-4c48-a2a8-6008dc862506","resolution":{"observed_at":"2026-08-06T20:29:53.879224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:53.933269Z","title":"Automated as- sistance for creative writing with an rnn language model","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:53.933269Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:f5ebec4127a8a375b2aa21622a7abd68448e8af853ef60bc59d1cb064ac245f3","observation_id":"b496daaa-7fa5-4104-8fc1-3028415a32f5","resolution":{"observed_at":"2026-08-06T20:29:53.933269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:53.985796Z","title":"Bidirectional recur- rent neural networks","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:53.985796Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:dd93d04b2606db6d9bb24c15cfbbf1851bcac06cb8c042428d0c5c47ceece399","observation_id":"a387132b-e8ff-4ff4-8820-df3656c28326","resolution":{"observed_at":"2026-08-06T20:29:53.985796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:54.036800Z","title":"Llava-prumerge: Adaptive token reduc- tion for efficient large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.036800Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:0b4f5fa13f6605b0d8a93b1b2df493bb84e30ac8e52681697d4f6e1a3a61f65b","observation_id":"16a14370-b6e2-41eb-8cd6-6a4b73f12e0b","resolution":{"observed_at":"2026-08-06T20:29:54.036800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:54.092514Z","title":"Disan: Directional self-attention network for rnn/cnn-free language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.092514Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:ca81fff1bf551320458af727c9c1882f4229664619a656936f0605f313bee703","observation_id":"743e4ac4-13eb-4ee1-8f93-8f2fc22b05e8","resolution":{"observed_at":"2026-08-06T20:29:54.092514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-06T20:29:54.158609Z","title":"Longvu: Spatiotemporal adaptive compression for long video-language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.158609Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:f8f15ec784fecf8ec6ef637fdbac66cedbac01fa8413e35d62ca5065bbe5891c","observation_id":"8a5837f7-493f-489d-bcdb-c2b0723c4d99","resolution":{"observed_at":"2026-08-06T20:29:54.158609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T20:29:54.223612Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.223612Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:cd265972976dfe01648970ed98ce0ed272d89bafcd78080280e3ef3127b9e9df","observation_id":"11789708-fe6c-41c0-b5a3-1c112e649775","resolution":{"observed_at":"2026-08-06T20:29:54.223612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T20:29:54.291657Z","title":"Moviechat: From dense token to sparse memory for long video understand- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.291657Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:0a89b38d4fe4affbb005aba95bb6f5c05762c4836a5767dec428219382228bf2","observation_id":"00d8e688-0c33-48cb-ab53-274cf486fbfb","resolution":{"observed_at":"2026-08-06T20:29:54.291657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17176","last_updated":"2024-04-26T06:17:04Z","snapshot_observed_at":"2026-08-10T13:01:53.615539Z","submitted_at":"2024-04-26T06:17:04Z","title":"MovieChat+: Question-aware Sparse Memory for Long Video Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17176","snapshot_observed_at":"2026-08-06T20:29:54.353632Z","title":"Moviechat+: Question-aware sparse memory for long video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.353632Z"},"links":{"cited_paper":"/paper/2404.17176","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:6e5904ef7933e871dda5925b6f2e55414f9ecf1529214ba2ace8873027abc9d3","observation_id":"c4ebeb15-4443-4c06-9dcd-0a56d5531c28","resolution":{"observed_at":"2026-08-06T20:29:54.353632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14693","last_updated":"2025-05-02T22:30:26Z","snapshot_observed_at":"2026-08-10T13:03:27.769395Z","submitted_at":"2025-04-20T17:58:46Z","title":"Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14693","snapshot_observed_at":"2026-08-06T20:29:54.414573Z","title":"Video-mmlu: A massive multi- discipline lecture understanding benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.414573Z"},"links":{"cited_paper":"/paper/2504.14693","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:4e52aa2a952335803cc1ec254931363ebdac236a299e4be073e0d47ebbcb4660","observation_id":"605c7da0-e77d-421b-a97a-1546f94eb854","resolution":{"observed_at":"2026-08-06T20:29:54.414573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:54.473573Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.473573Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:1d07ae838e503d67487380b4458044ea3e5125f2b580af7bd0f8215ed714961a","observation_id":"c64bc55b-2e82-4402-8aae-ec3bec8db202","resolution":{"observed_at":"2026-08-06T20:29:54.473573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:54.531733Z","title":"Koala: Key frame-conditioned long video-llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.531733Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:4efd73619fc63260c249f23fdefd1e74cc70e632a9232adf3dc8b39d1949d91b","observation_id":"1f64888b-413f-4e14-ac5b-6f1b0bd7b83a","resolution":{"observed_at":"2026-08-06T20:29:54.531733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-10T05:54:28.884157Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-08-06T20:29:54.595717Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.595717Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:6a39acf2c73453c97bb4df90fb9ff883529f50fc680e971c67d4a7788740d85f","observation_id":"9fdda23a-e379-4a88-8fda-78e5a5fba147","resolution":{"observed_at":"2026-08-06T20:29:54.595717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T20:29:54.651903Z","title":"Llama: Open and efficient foundation language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.651903Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:2f7edf221064680b34982d3a8265088c28aa9ef7201cdc0b9ee6750c7824b6ee","observation_id":"4f764f96-db39-421c-a41d-58e3607f5b97","resolution":{"observed_at":"2026-08-06T20:29:54.651903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:54.714517Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.714517Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:79bf0b91263f5a4fd053d2abdbdfcea7f577e3e0eb29b094c52be58c6c4d6c8a","observation_id":"56dee312-c2e3-4278-9be9-1b72b046e87f","resolution":{"observed_at":"2026-08-06T20:29:54.714517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T20:29:54.835249Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.835249Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:49e7c98ddb9baed43b64dc74fa56ff036276d42ba364da7aad39e95d7ce2a283","observation_id":"5c8a4b1f-7233-4bcb-9af4-7f93cd16f279","resolution":{"observed_at":"2026-08-06T20:29:54.835249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T20:29:54.904223Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.904223Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:4036fef2fea471d5c5e994eeb919cf3850a47b3c5546d55a3c6c503ded3d8ade","observation_id":"d0d78680-692b-4287-ba9b-5a160a7bad8c","resolution":{"observed_at":"2026-08-06T20:29:54.904223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-06T20:29:54.965989Z","title":"Lvbench: An extreme long video un- derstanding benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.965989Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:d1af92bb698f4a5aaeb1fbfc7aed2cc1c6350dc2158bf25a419b24c7ea78aeeb","observation_id":"537224d8-9dba-45f2-902d-a7db50547967","resolution":{"observed_at":"2026-08-06T20:29:54.965989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:55.031669Z","title":"Vatex: A large-scale, high-quality multilingual dataset for video-and-language research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:55.031669Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:e104354dab38f73a7993f32bf7c0f0c965c9e08c0f9703ffd35779095b2c841f","observation_id":"335c0eca-0909-4bfa-ae52-8fd8012f6ea6","resolution":{"observed_at":"2026-08-06T20:29:55.031669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10517","last_updated":"2024-03-15T17:57:52Z","snapshot_observed_at":"2026-08-10T13:01:51.637119Z","submitted_at":"2024-03-15T17:57:52Z","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10517","snapshot_observed_at":"2026-08-06T20:29:55.094037Z","title":"Videoagent: Long-form video understand- ing with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:55.094037Z"},"links":{"cited_paper":"/paper/2403.10517","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:09e9a0c4a1dae9c4fa66054212dacae43be06ca0dd99fc0607c6cd13d8df7e1f","observation_id":"b0c89a3f-5ec9-4803-ab29-2c4119d62c42","resolution":{"observed_at":"2026-08-06T20:29:55.094037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:55.171694Z","title":"Longvlm: Efficient long video under- standing via large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:55.171694Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:9dac9661f4ad3ba7666679bce938188ab3fdd8507f622ed076b0f1fd3ce17f22","observation_id":"a46fe6e4-f825-4248-a277-b170d844826d","resolution":{"observed_at":"2026-08-06T20:29:55.171694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-06T20:29:55.224420Z","title":"Longvideobench: A benchmark for long-context inter- leaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:55.224420Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:a1350e500c4b756a9a9591245ac46205e35fa48354a5476b140cf947fad4d555","observation_id":"1e423a24-2f0a-46a3-8cf4-c44392ca6812","resolution":{"observed_at":"2026-08-06T20:29:55.224420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13790","last_updated":"2024-10-17T17:31:24Z","snapshot_observed_at":"2026-08-10T13:02:19.021684Z","submitted_at":"2024-10-17T17:31:24Z","title":"MotionBank: A Large-scale Video Motion Benchmark with Disentangled Rule-based Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13790","snapshot_observed_at":"2026-08-06T20:29:55.275065Z","title":"Motionbank: A large-scale video motion benchmark with disentangled rule-based annotations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:55.275065Z"},"links":{"cited_paper":"/paper/2410.13790","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:19da42c0498bab090727f3a528a57e4b092504708c2fdca7a1d7d4f4a8eeb163","observation_id":"e1f5b7ff-f3f4-47cf-84c7-597dfc837803","resolution":{"observed_at":"2026-08-06T20:29:55.275065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:55.355032Z","title":"Pllava : Parameter-free llava extension from images to videos for video dense captioning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:55.355032Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:66c1eceff1e78509c28c7c16ed3cbff9ae5927b1bc25e7fb7df8eb643248a045","observation_id":"4bd87471-658a-43fb-b255-b133fc4b9a93","resolution":{"observed_at":"2026-08-06T20:29:55.355032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-06T20:29:55.468866Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:55.468866Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:eb941eca8cfb16b7549edfe8b32f0128ac7c8eb71f153c0cbbb0b3d0628d500d","observation_id":"7d5a20d2-bc5b-4ea3-b24e-2cd0facb5bf6","resolution":{"observed_at":"2026-08-06T20:29:55.468866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:55.594072Z","title":"xgen-mm (blip-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:55.594072Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:117cc86295e7346785d0826f931519b387948d0d9404835659e58f7c7e7022fd","observation_id":"e7dcce52-2094-48fc-add4-b66e602eeb3a","resolution":{"observed_at":"2026-08-06T20:29:55.594072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T20:29:55.704606Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:55.704606Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:854220e0486c81163bf484abb98ba5c8a826dadfb52bd89d71d2b9546daeb525","observation_id":"a52bc8ad-4b85-42e8-bc8f-a01a40173fc7","resolution":{"observed_at":"2026-08-06T20:29:55.704606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-06T20:29:55.864749Z","title":"Gated linear attention trans- formers with hardware-efficient training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:55.864749Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:f7d7c8602eb14d3fcc943a36a3198f036ef0b259a4483afb2c9b005b3494c3ee","observation_id":"0038c185-3efb-4b91-8d47-5a0d438fc751","resolution":{"observed_at":"2026-08-06T20:29:55.864749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-03T00:27:18.402796Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-08-06T20:29:56.031745Z","title":"Gated delta networks: Improving mamba2 with delta rule","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:56.031745Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:eee454cbc9cd82ef4a15b22587dfd4a0cfc61d198417a93d6b8c40b59a2f549a","observation_id":"78ba265f-537d-4ff3-9b1d-371127275889","resolution":{"observed_at":"2026-08-06T20:29:56.031745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:56.156114Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:56.156114Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:9ead206c590777fe079e373ddbea4feb9e3061417d66209b77fb235d3400110f","observation_id":"2b0430c1-0fd4-4b5a-82b4-bf8817005e6e","resolution":{"observed_at":"2026-08-06T20:29:56.156114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T20:29:56.364545Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:56.364545Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:afd8620cafbf5b93d3962c7429d8a4b80066f3abd407e5df685b09f3dc741e09","observation_id":"f8077658-29a0-4f35-a5a3-9d480e1c43d4","resolution":{"observed_at":"2026-08-06T20:29:56.364545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:29:56.537267Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:56.537267Z"},"links":{"citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:2638fab8181db574d014285510c123a3bf271034df14f071bd1a4cba757f89f3","observation_id":"43514bb3-a1bf-4712-adca-c41d2225b911","resolution":{"observed_at":"2026-08-06T20:29:56.537267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":97,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":120},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 120 outbound references and 1 inbound Pith citation observation for arXiv:2507.02591."}