{"as_of":"2026-08-09T19:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ba644e2f35455888a7af4d2934eca5261e3ee145aac9b92607661d52c87b1ea","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:06:35.255089Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:26:28.859252Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:39:37.598350Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-08T17:26:28.859252Z","title":"Videorope: What makes for good video rotary position embedding?arXiv preprint arXiv:2502.05173, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05928","last_updated":"2025-07-11T04:08:20Z","snapshot_observed_at":"2026-08-09T16:46:38.881732Z","submitted_at":"2025-02-09T15:08:10Z","title":"ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:28.859252Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2502.05928"},"observation_digest":"sha256:8f2d5959e2561fb4e4a54f4c2dde8dda4c95adcd2f1489d0540b260fa3fc65b0","observation_id":"0c8f2209-5d3c-42fd-ab0c-1e4749873c54","resolution":{"observed_at":"2026-08-08T17:26:28.859252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":"2502.05173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-07-04T06:39:37.598350Z","title":"Videorope: What makes for good video rotary position embedding?","venue":null,"work_id":"ef789cf9-0d4b-466b-a27e-ba36dbf5377f","year":2025},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:f51f70cab4eefdff9d87424e6d6e6a043d321547385cf22c3e0d08df4ce908b2","observation_id":"3d0f781a-f4a6-4cfc-91ce-56a209cd6d6a","resolution":{"observed_at":"2026-05-17T07:24:04.687193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":"2502.05173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-07-04T06:39:37.598350Z","title":"Videorope: What makes for good video rotary position embedding?","venue":null,"work_id":"ef789cf9-0d4b-466b-a27e-ba36dbf5377f","year":2025},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:87cdf6a9ae02568e5acf2f6f28239743b95d65cf3d95f565b84d6b8ecf46b891","observation_id":"a78a7883-6d7d-4472-902f-582dae61d412","resolution":{"observed_at":"2026-05-22T14:21:39.810267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-07T00:26:03.315947Z","title":"VideoRoPE:Whatmakesforgood video rotary position embedding?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.315947Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:c14e01032e3e07be4eda2bfd6c2b87f8952eabcf9f4214339a3bce20e484cfc6","observation_id":"72d0da19-90bd-49a7-bad9-1dce2fcd7bc2","resolution":{"observed_at":"2026-08-07T00:26:03.315947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-06T23:13:11.715462Z","title":"Videorope: What makes for good video rotary position embedding?arXiv preprint arXiv:2502.05173, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:11.715462Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:cc101f3ce02d703bd8004f8ce095ee8b960a3a08880ad9604c678f8d24fd8205","observation_id":"4a909771-f00d-4697-acda-ccf2c2a7a875","resolution":{"observed_at":"2026-08-06T23:13:11.715462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-06T22:36:38.968114Z","title":"Videorope: What makes for good video rotary position embedding?arXiv preprint arXiv:2502.05173, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.968114Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:6d9331ec38df31529145f0f78df0fe1c6fb1862f1d028362b499a1ed1a975c81","observation_id":"333a114b-7802-40da-aee7-bd656b079e76","resolution":{"observed_at":"2026-08-06T22:36:38.968114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-06T18:10:14.257348Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.257348Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:ca440f3fa3cb7cc21ed282a1934c4f311f7d62f590205c6b164699f1b52e3cf1","observation_id":"f519b7f8-72c3-4347-acda-48ca2a008599","resolution":{"observed_at":"2026-08-06T18:10:14.257348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-05T11:40:23.835237Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02359","last_updated":"2025-09-02T14:22:43Z","snapshot_observed_at":"2026-08-08T06:17:37.928618Z","submitted_at":"2025-09-02T14:22:43Z","title":"Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T11:40:23.835237Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2509.02359"},"observation_digest":"sha256:518b434b0b0a48b88a5014bbb19d63bb5aa9915a21c925575a318cee7956cdb2","observation_id":"403e88a9-0bf6-44aa-8100-3224b1e886ed","resolution":{"observed_at":"2026-08-05T11:40:23.835237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-03T20:30:38.274053Z","title":"Videorope: What makes for good video rotary position embedding?arXiv preprint arXiv:2502.05173, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-07T03:18:48.553937Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:38.274053Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:98060c333b6a11c07d7585f735ff7be756a6e2e1b86f98ef5acdbd2f4e82263a","observation_id":"1bccfc75-5faa-4730-9dad-5d0766c30932","resolution":{"observed_at":"2026-08-03T20:30:38.274053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":"2502.05173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-07-04T06:39:37.598350Z","title":"Videorope: What makes for good video rotary position embedding?","venue":null,"work_id":"ef789cf9-0d4b-466b-a27e-ba36dbf5377f","year":2025},"citing_paper":{"arxiv_id":"2605.00968","last_updated":"2026-05-01T15:51:10Z","snapshot_observed_at":"2026-07-06T23:14:15.780028Z","submitted_at":"2026-05-01T15:51:10Z","title":"Adaptive 3D-RoPE: Physics-Aligned Rotary Positional Encoding for Wireless Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T18:48:03.437788Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2605.00968"},"observation_digest":"sha256:aaf31a93ed0ce59752706da44934d5892f7363a28aec5f9c3b745014b87ee007","observation_id":"267f2f9f-3cd4-4d5e-b8d4-ef00846bdc9d","resolution":{"observed_at":"2026-05-11T16:06:07.573803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":"2502.05173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-07-04T06:39:37.598350Z","title":"Videorope: What makes for good video rotary position embedding?","venue":null,"work_id":"ef789cf9-0d4b-466b-a27e-ba36dbf5377f","year":2025},"citing_paper":{"arxiv_id":"2606.03578","last_updated":"2026-06-02T12:47:14Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:47:14Z","title":"Diffusing in the Right Space: A Systematic Study of Latent Diffusability","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T10:44:24.318786Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2606.03578"},"observation_digest":"sha256:102bd4f544d21f79336d4d24a09ebc211810e5ed46ac93b1a8bf49ac6c56ae44","observation_id":"12933e0b-01a1-4e67-bb01-f81fd46e42b4","resolution":{"observed_at":"2026-07-02T02:36:27.600377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":"2502.05173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-07-04T06:39:37.598350Z","title":"Videorope: What makes for good video rotary position embedding?","venue":null,"work_id":"ef789cf9-0d4b-466b-a27e-ba36dbf5377f","year":2025},"citing_paper":{"arxiv_id":"2606.09250","last_updated":"2026-06-08T09:23:42Z","snapshot_observed_at":"2026-08-02T10:05:30.199022Z","submitted_at":"2026-06-08T09:23:42Z","title":"LiteVSR: Lightweight Adaptation of Frozen Diffusion Transformers for Video Super-Resolution","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T17:16:44.500338Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2606.09250"},"observation_digest":"sha256:9cb02bc48200ae61b2234a61c5d85c7315e794450786f1ddbee2ca087ecbc01d","observation_id":"2a713525-41ae-4314-9492-796073ef8e62","resolution":{"observed_at":"2026-07-03T00:17:29.629230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":"2502.05173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-07-04T06:39:37.598350Z","title":"Videorope: What makes for good video rotary position embedding?","venue":null,"work_id":"ef789cf9-0d4b-466b-a27e-ba36dbf5377f","year":2025},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":130,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:69a9e68f53db69edaf0a122dd733045af9fd76925038166ea46db4d636cd48b7","observation_id":"afdacdee-a5a5-485e-8d91-d3428a46e6e3","resolution":{"observed_at":"2026-07-04T06:39:37.599608Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-01T17:22:32.782701Z","title":"Videorope: What makes for good video rotary position embedding?arXiv preprint arXiv:2502.05173, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17675","last_updated":"2026-07-20T08:27:18Z","snapshot_observed_at":"2026-08-06T20:46:21.533031Z","submitted_at":"2026-07-20T08:27:18Z","title":"ShotPlan: Cinematic Video Generation with Learnable Planning Token","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T17:22:32.782701Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2607.17675"},"observation_digest":"sha256:d54d5b63813689d2a04cce528900c43c1dccfc21656db56d3cf2e7d7903aa269","observation_id":"5f6635f3-64b7-44be-b639-c611f485d09c","resolution":{"observed_at":"2026-08-01T17:22:32.782701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-01T12:28:00.977584Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19547","last_updated":"2026-07-21T19:46:38Z","snapshot_observed_at":"2026-08-08T12:51:55.873002Z","submitted_at":"2026-07-21T19:46:38Z","title":"ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T12:28:00.977584Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2607.19547"},"observation_digest":"sha256:c396ac1746705ad0cf597afe7a826043e443426234347274d5a693f023b080a7","observation_id":"ac47fea1-aa70-403c-8d35-88a576e228ee","resolution":{"observed_at":"2026-08-01T12:28:00.977584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-01T09:52:44.291024Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20628","last_updated":"2026-07-22T18:01:03Z","snapshot_observed_at":"2026-08-09T03:11:53.437860Z","submitted_at":"2026-07-22T18:01:03Z","title":"RealVDeblur: One-Step Diffusion for Generalizable Real-World Video Deblurring","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T09:52:44.291024Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2607.20628"},"observation_digest":"sha256:bb321e1a943ff9e5a75b4d4d865e6d38b93d7d343846dbcff54d670ddca908bb","observation_id":"387af61f-359b-4b3a-8569-d5f16007ec61","resolution":{"observed_at":"2026-08-01T09:52:44.291024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05173/citation-record","integrity":"/paper/2502.05173/integrity","json":"/paper/2502.05173/citation-record.json","paper":"/paper/2502.05173"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-08T20:06:35.088592Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.088592Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:7ab4d5fe938098166d521302a0febb5850f946d1f558d7884cf67c25165547d2","observation_id":"b5837546-afe1-4b76-bd4d-509e4deaf5f0","resolution":{"observed_at":"2026-08-08T20:06:35.088592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-08T20:06:35.093340Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.093340Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:ffccea8f680a39f196d34e1918cca76e5415584b9bf74062d9efb460e759d378","observation_id":"a2077bea-ac2a-447b-a03e-e843b71bea30","resolution":{"observed_at":"2026-08-08T20:06:35.093340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T20:06:35.107957Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.107957Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:d779dc84ecfe0f34639dcac6918f19861b943c75f7e260b8f55270beaede0897","observation_id":"07a9bb7b-6e13-4cfc-b409-9f359f324945","resolution":{"observed_at":"2026-08-08T20:06:35.107957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:06:35.882127Z","title":"VideoHallucer classifies hallucinations into two primary types: intrinsic and extrinsic","venue":null,"work_id":"9a2ed369-1e69-4211-8d60-b29024061cd4","year":2024},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.231736Z"},"links":{"citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:b7cb40394faa23fb7f6a1455b340223268dea23c4a919f682c02d670aa9a2c08","observation_id":"7a484ea4-8fc3-41f7-9399-a6d86d273de6","resolution":{"observed_at":"2026-08-08T20:06:35.887283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03206","last_updated":"2024-09-05T02:54:17Z","snapshot_observed_at":"2026-08-09T16:45:53.365309Z","submitted_at":"2024-09-05T02:54:17Z","title":"TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations","version":1},"cited_work":{"arxiv_id":"2409.03206","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.03206","snapshot_observed_at":"2026-08-08T20:06:35.587254Z","title":"TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations","venue":"cs.CV","work_id":"a0b9ec12-5abd-44a3-a11a-9f4944d93e61","year":2024},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.117016Z"},"links":{"cited_paper":"/paper/2409.03206","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:782181fe4abe71ae70261a5ba77fee6cc4555297e2f984ff25909e31f1ddc8ac","observation_id":"d5a95be9-768f-49d8-8e48-89b5465b8e14","resolution":{"observed_at":"2026-08-08T20:06:35.593964Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:06:35.910150Z","title":"Accessed: 2025-01-12","venue":null,"work_id":"e2260c4d-8eae-49c9-a038-889ab2b16769","year":2025},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.121719Z"},"links":{"citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:94073cb7a104fe3783081dcc3538d4357e26c9203f6f56d21f6458c5f92cb4e2","observation_id":"5b65fabf-b039-4a63-85c7-3f1263918e07","resolution":{"observed_at":"2026-08-08T20:06:35.914386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-08T20:06:35.126322Z","title":"Ruler: What’s the real context size of your long-context language models? arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.126322Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:398be58ccae76208f1cde3d3d4d1b32dbe3c4013d6a03faa5cd0ef11282dfdc0","observation_id":"9e69fc2f-6a95-4bfe-b89b-12d3a77ec5cb","resolution":{"observed_at":"2026-08-08T20:06:35.126322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-08-08T20:06:35.130897Z","title":"Huang, Q., Dong, X., Zhang, P., Wang, B., He, C., Wang, J., Lin, D., Zhang, W., and Yu, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.130897Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:ebe6e2b1b9bb68abdde3f77cb22b0c8105c1c914f6745c49ed1c2d46aab3f6ea","observation_id":"76ce522a-51f9-4e33-8d59-0eba8a33ac6e","resolution":{"observed_at":"2026-08-08T20:06:35.130897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17911","last_updated":"2024-03-12T05:59:46Z","snapshot_observed_at":"2026-08-04T19:33:20.426712Z","submitted_at":"2023-11-29T18:57:07Z","title":"OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17911","snapshot_observed_at":"2026-08-08T20:06:35.135448Z","title":"Jin, P., Takanobu, R., Zhang, C., Cao, X., and Yuan, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.135448Z"},"links":{"cited_paper":"/paper/2311.17911","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:49b80b6cefac2f691b0fb6d43fb8513f1330b483412ea1d48502ab6fcc44607a","observation_id":"0ef1c0de-4222-4e57-86c7-2db6cc064039","resolution":{"observed_at":"2026-08-08T20:06:35.135448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-08T20:06:35.140418Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.140418Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:5dd793c162217da9977ddb9e244ec09d34eca646e7edd7a95a0072be4815564f","observation_id":"23cc5c99-1f77-4c8e-bf47-d466a50145bb","resolution":{"observed_at":"2026-08-08T20:06:35.140418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06183","last_updated":"2021-02-11T18:50:16Z","snapshot_observed_at":"2026-07-06T10:40:37.508112Z","submitted_at":"2021-02-11T18:50:16Z","title":"Less is More: ClipBERT for Video-and-Language Learning via Sparse Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.06183","snapshot_observed_at":"2026-08-08T20:06:35.144695Z","title":"Li, K., He, Y ., Wang, Y ., Li, Y ., Wang, W., Luo, P., Wang, Y ., Wang, L., and Qiao, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.144695Z"},"links":{"cited_paper":"/paper/2102.06183","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:51fce5ac39a4e4cc09ba6e941b084e0a0bb8c1d5e870bd0c3cfc72749d372c3b","observation_id":"b932cf2e-e01e-46e7-920c-29be7c7953f8","resolution":{"observed_at":"2026-08-08T20:06:35.144695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06166","last_updated":"2024-10-08T16:10:29Z","snapshot_observed_at":"2026-08-07T05:06:22.564018Z","submitted_at":"2024-10-08T16:10:29Z","title":"Temporal Reasoning Transfer from Text to Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06166","snapshot_observed_at":"2026-08-08T20:06:35.149060Z","title":"Temporal reasoning transfer from text to video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.149060Z"},"links":{"cited_paper":"/paper/2410.06166","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:bcf825682677f31045cc5d4118415baba8cc16332623976f6dbdce1346ff9b60","observation_id":"69c19d6d-75bc-4eab-a81e-bf1ba7233419","resolution":{"observed_at":"2026-08-08T20:06:35.149060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05510","last_updated":"2025-03-27T17:40:09Z","snapshot_observed_at":"2026-07-06T20:18:58.432111Z","submitted_at":"2025-01-09T19:00:01Z","title":"OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05510","snapshot_observed_at":"2026-08-08T20:06:35.153650Z","title":"Lin, B., Zhu, B., Ye, Y ., Ning, M., Jin, P., and Yuan, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.153650Z"},"links":{"cited_paper":"/paper/2501.05510","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:a0908da158d69a61b48c11a86124ba8ac6030f33d668aa182c54483c3c2921cd","observation_id":"ff4f5f3d-1bd8-4344-9e74-500a973541fc","resolution":{"observed_at":"2026-08-08T20:06:35.153650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T01:13:25.920641Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-08T20:06:35.158259Z","title":"Maaz, M., Rasheed, H., Khan, S., and Khan, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.158259Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:7aba9629b83519581589cb952c224125608f63ba5b94e5f70f2fef1ec329a9d8","observation_id":"0e1d8574-032b-4117-ab75-eb7050bd2c38","resolution":{"observed_at":"2026-08-08T20:06:35.158259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-08T20:06:35.162915Z","title":"Yarn: Efficient context window extension of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.162915Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:82c019c08109e29a0570cfcc492b2e69f66d83b9076fdd7cc875a52984f622f9","observation_id":"f387f90c-54ba-4c63-ba1a-e9d1f17789f5","resolution":{"observed_at":"2026-08-08T20:06:35.162915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03218","last_updated":"2025-01-06T18:55:10Z","snapshot_observed_at":"2026-08-06T16:02:53.165875Z","submitted_at":"2025-01-06T18:55:10Z","title":"Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03218","snapshot_observed_at":"2026-08-08T20:06:35.167362Z","title":"Dispider: Enabling video llms with active real-time interaction via disentangled perception, decision, and reaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.167362Z"},"links":{"cited_paper":"/paper/2501.03218","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:394e68a4b94dd9ee8f97be8bd2f92831a745535aece29b3c615e51db607355c4","observation_id":"8a52dff9-a257-442d-8a57-e889f9000459","resolution":{"observed_at":"2026-08-08T20:06:35.167362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-08T20:06:35.172033Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.172033Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:759294d9266cb712220db22626acc3e5cb4cc775b0e2554710f94ddc66f85d67","observation_id":"84713aff-4810-4419-91c5-4a46ad3647e9","resolution":{"observed_at":"2026-08-08T20:06:35.172033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:06:35.176439Z","title":"doi: 10.1007/s11633-024-1502-8","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.176439Z"},"links":{"citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:5eccb185a72231bca158c825b5ca7e860827e7e22c457dcc842b98bbc5a36670","observation_id":"17f81594-282b-48cc-9b24-50ae266d3f7a","resolution":{"observed_at":"2026-08-08T20:06:35.176439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-08T20:06:35.180843Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.180843Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:2740765995e3c04d6a2173cb7deb356b9343c5310a27c6e4b0af26648abd020a","observation_id":"b43b4771-904a-462c-b813-dbae6baa87fc","resolution":{"observed_at":"2026-08-08T20:06:35.180843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-08T20:06:35.185621Z","title":"Wang, P., Bai, S., Tan, S., Wang, S., Fan, Z., Bai, J., Chen, K., Liu, X., Wang, J., Ge, W., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.185621Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:39018be5f2efab7f7c21c0ca422b1e5beb92e5dc5d57cb18f37b1e62214f9fce","observation_id":"ec2a373d-f810-4828-a02f-1d37a7f2e28d","resolution":{"observed_at":"2026-08-08T20:06:35.185621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-08T20:06:35.194856Z","title":"Xu, H., Ghosh, G., Huang, P.-Y ., Okhonko, D., Agha- janyan, A., Metze, F., Zettlemoyer, L., and Feichten- hofer, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.194856Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:3b1a7f90eadbf3a8b92ae8767c484e41140265144ca0450625a6126b8486808d","observation_id":"3afbc6e1-ba68-4238-9002-d88ba44221df","resolution":{"observed_at":"2026-08-08T20:06:35.194856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-08T20:06:35.199614Z","title":"Xu, L., Zhao, Y ., Zhou, D., Lin, Z., Ng, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.199614Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:e08e86495e1defa499568f544745e3915dc972978e2b14c39c994a93c180bd30","observation_id":"8f45b970-b8b4-4627-9524-83ad999afd2a","resolution":{"observed_at":"2026-08-08T20:06:35.199614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-08T20:06:35.204077Z","title":"Xue, H., Hang, T., Zeng, Y ., Sun, Y ., Liu, B., Yang, H., Fu, J., and Guo, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.204077Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:1737d83c93aaec0ed9bbaef25d02046f6616c0db7d3375bf61e116ecc643fff9","observation_id":"072338a1-9646-41b7-81b0-5e858610cf05","resolution":{"observed_at":"2026-08-08T20:06:35.204077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T20:06:35.208740Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.208740Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:c33ee30a9dffa73e5b8c0029d4ffa6c70fc107b9b8fc8ac5be22caaa7bbf631f","observation_id":"06e9e869-3a66-4c50-8bca-eb4abcc7a6d2","resolution":{"observed_at":"2026-08-08T20:06:35.208740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-06T01:46:05.964793Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-08T20:06:35.213153Z","title":"Internlm- xcomposer2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.213153Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:4055d814cb7b8f1e058bfd13b7d364fc3c4e0e2f99292fdcca74e7d91b48e516","observation_id":"d4118f63-dd22-44cc-943a-d3c28a5d7eef","resolution":{"observed_at":"2026-08-08T20:06:35.213153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-08T20:06:35.217443Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.217443Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:1fc9fc44501d643a7eba8745a42f281e6383689cc0a6c1984171390e9fb00053","observation_id":"5b51070d-d63d-4fc0-976a-77c714bd43a5","resolution":{"observed_at":"2026-08-08T20:06:35.217443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-08T20:06:35.222155Z","title":"Zhang, Y ., Wu, J., Li, W., Li, B., Ma, Z., Liu, Z., and Li, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.222155Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:c6877caee246415acff4fa25fcecad3793e1866c412c58b28a406c91838dcec0","observation_id":"c5d1cee3-db0c-4fd8-b453-1aa778b5ed74","resolution":{"observed_at":"2026-08-08T20:06:35.222155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:06:35.897018Z","title":", y, y, y,","venue":null,"work_id":"987a2ea7-1585-4563-88dd-c5dc0cc9fb2d","year":2024},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.226952Z"},"links":{"citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:bdef5521ffd496bcf917708d20df9f15bb00ece177654086879abb04bdd66d53","observation_id":"78137972-cb66-4640-99b0-572721a6272b","resolution":{"observed_at":"2026-08-08T20:06:35.901230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:06:35.867552Z","title":"Extending these models to video requires handling temporal dependencies (Xu et al., 2021; Lei et al., 2021; Bertasius et al., 2021; Huang et al.,","venue":null,"work_id":"d001dc95-9296-4bed-81f1-b5c26e6aa87e","year":2021},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.236494Z"},"links":{"citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:7c19e5837fcedbeaad20465c9d139ea1e9ae951aa610ada9848d1df75db7f27c","observation_id":"fb0685fe-619e-4eb5-9965-c775bdf2a6bd","resolution":{"observed_at":"2026-08-08T20:06:35.872041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:06:35.853653Z","title":"Early video LLMs, such as Wang et al","venue":null,"work_id":"89297c41-d6df-41ff-9b78-d2f85d8b62df","year":2023},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.241583Z"},"links":{"citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:e8a88223303c8ad4d19c72529cf76eb9fb34eed1047bbf4e667a673f0d171b3c","observation_id":"74a37008-fa0c-4e64-a6d0-9b890e4bda00","resolution":{"observed_at":"2026-08-08T20:06:35.858338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:06:35.839551Z","title":"However, video haystack retrieval still lags in difficulty compared with the QA or retrieval task in NLP (Hsieh et al., 2024; Yuan et al., 2024)","venue":null,"work_id":"615355a5-2fbc-41ce-a2f6-fd28a35ed73e","year":2024},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.246387Z"},"links":{"citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:acc209e478ae8ab1304103e3b3d75a2c49230b34f9d5cb6c4efb92fec3531f6a","observation_id":"d6d43b69-749f-471f-88cc-e8ecd5dc073f","resolution":{"observed_at":"2026-08-08T20:06:35.844073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:06:35.825800Z","title":null,"venue":null,"work_id":"30435fe3-a0dc-4f47-9bf0-3190cc81edc0","year":2024},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.250707Z"},"links":{"citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:5aaa49604dfb7befd12939faf6578e4a2894fcee69cfba2d3230e20f8844f399","observation_id":"208dd9a1-187b-4412-85a0-d387598f8d00","resolution":{"observed_at":"2026-08-08T20:06:35.830372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:06:35.712353Z","title":"On the other hand, VideoRoPE employs low-frequency temporal modeling, allowing it to capture long-range dependencies and successfully identify the needle for accurate responses","venue":null,"work_id":"90e71896-42a0-47ff-b142-c65ab66a1b7a","year":2024},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.255089Z"},"links":{"citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:2c044e592bf82226228ceaa8ccc8470127af96843f51f3b9a6d83a39e2da8dd5","observation_id":"d8f62f04-0191-4f40-b2c4-170ecfbe2b63","resolution":{"observed_at":"2026-08-08T20:06:35.717033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-08T20:06:35.112479Z","title":"Video-MME: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.112479Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:a02d00278d5f0eeb69727f207bc2c12798232d94a7df2721a4ac635a87f8660c","observation_id":"42257403-172b-49d9-ab51-fb888b0324de","resolution":{"observed_at":"2026-08-08T20:06:35.112479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05095","last_updated":"2021-06-09T14:48:13Z","snapshot_observed_at":"2026-08-08T08:05:04.282318Z","submitted_at":"2021-02-09T19:49:33Z","title":"Is Space-Time Attention All You Need for Video Understanding?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05095","snapshot_observed_at":"2026-08-08T20:06:35.083369Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.083369Z"},"links":{"cited_paper":"/paper/2102.05095","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:c0e8abf3abc870163eae6088f75d9dd83a2a3071123af6fa5a482dcb1ec4adba","observation_id":"c564a8a0-6674-415b-bf39-4b706af6b661","resolution":{"observed_at":"2026-08-08T20:06:35.083369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-08T20:06:35.190284Z","title":"Wang, Y ., Wang, Y ., Zhao, D., Xie, C., and Zheng, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.190284Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:13a655fb4d8d700efcca5af361a6efeecf093f974441236419efd6ed56836f92","observation_id":"dc9bac64-023a-4caa-b918-1bec63136a6a","resolution":{"observed_at":"2026-08-08T20:06:35.190284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-08T20:06:35.097848Z","title":"Sharegpt4video: Im- proving video understanding and generation with better captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.097848Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:e3abce7e5143278addb790c40e2eef36602619a9dcb9101e804cd0a107bad36c","observation_id":"c48653a7-17e7-4649-b1f8-6273adf43fdc","resolution":{"observed_at":"2026-08-08T20:06:35.097848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-08T20:06:35.077993Z","title":"Barbero, F., Vitvitskyi, A., Perivolaropoulos, C., Pascanu, R., and Veliˇckovi´c, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.077993Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:d23412d33bc4463c1ee520233f572a2138aed43bd11de9e2ea95dffa615f35d6","observation_id":"5beaa9dd-d781-4b65-9da0-1da05671958c","resolution":{"observed_at":"2026-08-08T20:06:35.077993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-08T20:06:35.102689Z","title":"L., Zhang, C., Xu, Y ., Shang, N., Xu, J., Yang, F., and Yang, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.102689Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:53a603c2a7b0b10f7b2fc8cc7c3742ea799111a982685a6da81b75630e28ade8","observation_id":"bcb314c8-8f4f-48c6-94cf-730a25f6fc0d","resolution":{"observed_at":"2026-08-08T20:06:35.102689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 16 inbound Pith citation observations for arXiv:2502.05173."}