{"as_of":"2026-08-10T03:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c094fe3fd21944b60b62fa5ec51dc048c00a7cc92de93508aaff8a70334a82c2","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:40:47.324806Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T22:05:07.326202Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T22:08:04.286737Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2505.23922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23922","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalelong: A multi-timescale benchmark for long video understanding","venue":null,"work_id":"9e83ca69-5949-4356-94fd-1f1fac73cca0","year":2025},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2505.23922","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:f34371025c99d80b91e12b07d960a9dfc67261dbd32d3bc4714f4b58da0e9f24","observation_id":"9337d054-7d63-4276-b9e7-359e2604d5e6","resolution":{"observed_at":"2026-05-14T22:08:04.290536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2505.23922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23922","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalelong: A multi-timescale benchmark for long video understanding","venue":null,"work_id":"9e83ca69-5949-4356-94fd-1f1fac73cca0","year":2025},"citing_paper":{"arxiv_id":"2604.09037","last_updated":"2026-04-10T06:58:29Z","snapshot_observed_at":"2026-08-05T06:31:53.723325Z","submitted_at":"2026-04-10T06:58:29Z","title":"SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-10T17:37:40.373211Z"},"links":{"cited_paper":"/paper/2505.23922","citing_paper":"/paper/2604.09037"},"observation_digest":"sha256:5dd1287e22bd235a3764a6f0e7c994cbd5bafdcf9e2e6043498d69bbcf267725","observation_id":"2c925b8d-354c-42b9-9c6c-f07824e1caf9","resolution":{"observed_at":"2026-05-11T06:30:58.542836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23922/citation-record","integrity":"/paper/2505.23922/integrity","json":"/paper/2505.23922/citation-record.json","paper":"/paper/2505.23922"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:40:43.662910Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:43.662910Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:0fc5ab05f71e731133e55769b6607fd8b94fe6a608d62b42db6feb34f2418f04","observation_id":"b71eb6e3-1d48-453b-80f9-2d8b3b01e1c0","resolution":{"observed_at":"2026-08-07T12:40:43.662910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:50.422969Z","title":"Chandrasegaran, A","venue":null,"work_id":"fc0c1869-a931-456a-8a2a-877d4273d039","year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:43.782302Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:cf2472eee27f241076648a41924e3fcc6c5a97032ff2c5803cad19c99e76fbf5","observation_id":"682d56f4-7066-4455-b7e2-e3b4f148272c","resolution":{"observed_at":"2026-08-07T12:40:50.470397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:40:43.917741Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:43.917741Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:22be8625975f5d97c68fa939f7072f645e0bd0e179b2d66f2f0a32c15efae9c3","observation_id":"25d24c42-a878-4a4f-a6eb-056edf6a179e","resolution":{"observed_at":"2026-08-07T12:40:43.917741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:50.247824Z","title":null,"venue":null,"work_id":"87b2974b-a1f0-465a-a60f-72faffc632b7","year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:44.012787Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:b4e358120b78bac5f36ce2688f9ae29ddfbcd498eaa06adcde287b482ed66dac","observation_id":"28fc4a54-d057-4084-b47e-3b63eb7dbdff","resolution":{"observed_at":"2026-08-07T12:40:50.323261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:50.089204Z","title":"DeepMind","venue":null,"work_id":"b1f6fbd6-41cc-4d88-b518-38cb94ac0ccc","year":2025},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:44.131188Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:32bb2a09d1628e8bc0c4d5937c41c7180c9d7d2dac656ac57c64eb215ee78678","observation_id":"480c7562-1d43-4583-a763-24ae623d6714","resolution":{"observed_at":"2026-08-07T12:40:50.166115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:49.880015Z","title":"Doubao 1.5 pro, 2025","venue":null,"work_id":"6cfe236e-ea38-4e93-bacd-c9d2f00f488c","year":2025},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:44.232566Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:7920a1f059917f0d31c47511dc562c8b1f00bf76c1089f8a09fecf875596de3e","observation_id":"8ad5a41a-2573-4dd1-af4a-aafeba535142","resolution":{"observed_at":"2026-08-07T12:40:49.972577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:49.675954Z","title":null,"venue":null,"work_id":"836b76c7-2634-4ebb-9835-4ee9835c5630","year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:44.308846Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:60bed025ad5b5049613468d4edf90e4b47a4d0e531dc03f4a1905adfc6dd52d4","observation_id":"88063761-34f5-4ab5-99e3-3dde934e0a84","resolution":{"observed_at":"2026-08-07T12:40:49.762946Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T12:40:44.409794Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:44.409794Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:b8dce64bb4130d9b9ccdf74379c0d3a8fcbf49b3dd997532adc2904ea2f77aed","observation_id":"5392d8dd-7c20-4b75-b402-f2267f201a07","resolution":{"observed_at":"2026-08-07T12:40:44.409794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T12:40:44.530844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:44.530844Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:69215bc77927f5de1fafd2d187495bd3e65285d43091b8e0013e60ca7e3e33e9","observation_id":"4cc616f9-4037-4362-bdce-c9897d81045c","resolution":{"observed_at":"2026-08-07T12:40:44.530844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-07T12:40:44.609839Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:44.609839Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:43863c489ebeafea5b8c5165a9d5533e4bc944682d23cea7665766bb21e4eb30","observation_id":"e6ef9a37-2ca8-45b5-9f62-31b1ad98f46e","resolution":{"observed_at":"2026-08-07T12:40:44.609839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:49.524919Z","title":null,"venue":null,"work_id":"97a639fa-efe9-4930-a530-3bdeee8e9afa","year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:44.732999Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:a661bee87db39260cf213c564b1da4775ff92fbbc68fa06c8a38cba0ddcb1a75","observation_id":"3f2aa3f8-f99c-4ae7-b191-a46e1b3bc57b","resolution":{"observed_at":"2026-08-07T12:40:49.608571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:49.376587Z","title":null,"venue":null,"work_id":"fe5c2865-8c54-4119-83a2-eac71ae240ad","year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:44.844576Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:70ae4925a4410336852aecdc4203df464c0590fcbaa19694af49f8bd11aec2e0","observation_id":"b38eac44-3252-46f8-9521-79bcaa3502cc","resolution":{"observed_at":"2026-08-07T12:40:49.453066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-04T15:53:11.168523Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-07T12:40:44.943565Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:44.943565Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:9eff59753e9c296ca3eadd9447daeda574f3a54fa86dfaf2b44eb86f1eafb9b7","observation_id":"6f5a593c-f7dc-4764-85f5-da4346e18514","resolution":{"observed_at":"2026-08-07T12:40:44.943565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:49.163556Z","title":null,"venue":null,"work_id":"5ada589f-4f3b-4220-a54c-f72e83b0454c","year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:45.040839Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:4e3461858eb3e12a60c1addb2ad329d27d473b0bd3f57a72f950e495d01d09c6","observation_id":"8200610f-ffde-49ed-9473-22cc28cb3372","resolution":{"observed_at":"2026-08-07T12:40:49.244299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:48.997243Z","title":null,"venue":null,"work_id":"2e3e3327-cb39-400b-a11b-d8be3d906ee4","year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:45.142616Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:04296b87a9c8c73b9a205012021fc61f94bafc5d45a1a87abdc8e6a64354ee72","observation_id":"39f4d80e-f723-41c7-b215-a26c00515798","resolution":{"observed_at":"2026-08-07T12:40:49.089735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:48.770690Z","title":null,"venue":null,"work_id":"422acfc9-43f3-4b93-8452-f1cfd04f4d77","year":2023},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:45.223692Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:43b42b91da70fece79e200946fef9d2f6be7a214fa0bfc8012faf7c0d25eff18","observation_id":"a3eb682c-f034-47ce-92d5-f53219be48f5","resolution":{"observed_at":"2026-08-07T12:40:48.872389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T12:40:45.339709Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:45.339709Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:f607c9a49230f19613333921c7ed6b28d2728313b0b022a76a583623630d4a1b","observation_id":"6091c6ff-b78b-479d-ad4b-24aee1a96c6d","resolution":{"observed_at":"2026-08-07T12:40:45.339709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15415","last_updated":"2025-04-21T19:53:44Z","snapshot_observed_at":"2026-08-09T06:57:55.123045Z","submitted_at":"2025-04-21T19:53:44Z","title":"IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15415","snapshot_observed_at":"2026-08-07T12:40:45.454890Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:45.454890Z"},"links":{"cited_paper":"/paper/2504.15415","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:dd55a5d3877c6c6fe7522103e08f3a7b7f6d7836fa87903c9eb94a67403fa06a","observation_id":"c26723eb-e2b1-4f10-8436-71652711cd66","resolution":{"observed_at":"2026-08-07T12:40:45.454890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:45.527933Z","title":"Mangalam, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:45.527933Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:5fc4719fc94be458cdd2d63798dd98e94e74b35015470bb9afbc96509995a1d0","observation_id":"c586b8cd-c0c5-4e73-8af8-033fda347a11","resolution":{"observed_at":"2026-08-07T12:40:45.527933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:48.438457Z","title":"Gpt-4o, 2024","venue":null,"work_id":"6a5e3af9-a792-4441-bb65-7f7bc7ad6fb2","year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:45.624965Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:1e11709cf7f27fc5688b81e08f5725275c9dd5cb25b74d066602474192e826cf","observation_id":"a1ae3d67-2822-4574-8b7f-1ab190ac2046","resolution":{"observed_at":"2026-08-07T12:40:48.601869Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-07T17:42:30.374808Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-07T12:40:45.721408Z","title":"Rawal, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:45.721408Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:5c00f30be14c666d0275503ed1d211091424d5d6514af072b54c3360baeac2f8","observation_id":"b2beb961-e52e-4d7a-b0c9-53ffdea1b977","resolution":{"observed_at":"2026-08-07T12:40:45.721408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:48.211306Z","title":null,"venue":null,"work_id":"74df6e64-b0c5-4e9c-b324-9cd0e9807626","year":2025},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:45.806683Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:5b96a232a4b404b4ef1bee1ea8ad8fc7a59f94f7bd51f5f6b79c9360f051edfe","observation_id":"5e64fc14-c5b2-4a83-87f8-e1a9ac9ca6d3","resolution":{"observed_at":"2026-08-07T12:40:48.321293Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T12:40:45.892788Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:45.892788Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:1724d59550930ddb2a5190ee4beb0ebfc1121a20d06cf74cd9980cb5ac6016ae","observation_id":"701044dd-99e8-4a15-9a2a-0502f07eb7c3","resolution":{"observed_at":"2026-08-07T12:40:45.892788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T12:40:45.986582Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:45.986582Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:850e1928762d5de3dae4f2e2f80d2eaeb4e3026fde89518ef5310954100d284c","observation_id":"edbc9e1d-c28f-4f74-b94e-bb6de5dd1ec2","resolution":{"observed_at":"2026-08-07T12:40:45.986582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-07T12:40:46.071081Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.071081Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:83cb29631f45308c1817b2f2029e9a99b1c476092b845802d2ff19a3bf21da16","observation_id":"f14f1403-e947-4140-9265-c2c4a249b393","resolution":{"observed_at":"2026-08-07T12:40:46.071081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10683","last_updated":"2023-10-21T16:34:03Z","snapshot_observed_at":"2026-08-01T16:19:29.060602Z","submitted_at":"2023-05-18T03:53:59Z","title":"Paxion: Patching Action Knowledge in Video-Language Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10683","snapshot_observed_at":"2026-08-07T12:40:46.163790Z","title":"Wang , A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.163790Z"},"links":{"cited_paper":"/paper/2305.10683","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:d1156977f585b72ef8f5a9e128b4169457f484c170f93f31c8699c70c43d5927","observation_id":"6cd89460-8510-40d8-80c7-13b5adff7d22","resolution":{"observed_at":"2026-08-07T12:40:46.163790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T12:40:46.242481Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.242481Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:94cd35624f3484d041dc80ae79e4d27c5c6790484307e09667e63b13424561e0","observation_id":"7ee1a5e5-7b2c-498f-90ae-a196f9785ab4","resolution":{"observed_at":"2026-08-07T12:40:46.242481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-07T12:40:46.344645Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.344645Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:75ecc192bf1d3bb99a69f090ffaeb637bea04b147cc813dfe9d46b7a23b39a2e","observation_id":"a2bdbbba-6147-4a80-b3e4-0fcdc8e64677","resolution":{"observed_at":"2026-08-07T12:40:46.344645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:46.432941Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.432941Z"},"links":{"citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:ac786b325dc47da588c2f68135e894a45d13aa29227880a45ce5bfe18cbf0d54","observation_id":"bb6b502e-3114-4cbc-a0f6-61b4979945a2","resolution":{"observed_at":"2026-08-07T12:40:46.432941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-07T12:40:46.514841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.514841Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:b7628887b60b8088db63b6724916dca33a33381a618b09aabbde6b53f8662592","observation_id":"9e49b836-8fa0-4952-b710-181d1be72000","resolution":{"observed_at":"2026-08-07T12:40:46.514841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-07T12:40:46.590863Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.590863Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:0be48f9aa216384ddacefb3f6dc8908ad8c25ba09c956351999e97bcbd61c332","observation_id":"b536e117-562f-402c-b04e-e5d6419eef9a","resolution":{"observed_at":"2026-08-07T12:40:46.590863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T12:40:46.656155Z","title":"Zhang, X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.656155Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:00f9babda1bc00904975b39ec56420ddba9b3b19c238cc8186d4ce4e95dd710b","observation_id":"2136ca96-d3e7-47b8-a3bb-a1d841930026","resolution":{"observed_at":"2026-08-07T12:40:46.656155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-08T07:28:54.378232Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-08-07T12:40:46.777607Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.777607Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:c70841e72219d51af4acee9a4c891ecec11b3fbcde5c635ba867d7b51cf2c83d","observation_id":"ec5f4923-2264-490d-828d-3ffec31585c1","resolution":{"observed_at":"2026-08-07T12:40:46.777607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-03T12:09:02.990658Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-08-07T12:40:46.869024Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.869024Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:43e1dfd46f3456375508717986bc9c6e52505db108f135f0786fbd2468388e3b","observation_id":"c6df2d43-09d9-4618-97e4-0c342718411e","resolution":{"observed_at":"2026-08-07T12:40:46.869024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05067","last_updated":"2026-04-20T07:42:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T08:43:57Z","title":"LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05067","snapshot_observed_at":"2026-08-07T12:40:46.965574Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.965574Z"},"links":{"cited_paper":"/paper/2501.05067","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:907d00be303ddf768e6703f50ccbbd406f95947ff0fb64a94295b264a1185f6f","observation_id":"540e02ff-9660-4c5e-84af-462ad7b9eb2c","resolution":{"observed_at":"2026-08-07T12:40:46.965574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T12:40:47.090823Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:47.090823Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:4a5f56887a7ab3dab26c725a8274cc7ca9348a31fffc283f42bbeb2f921d2b55","observation_id":"0d4370c3-ae89-4f96-8f7a-f774b3ba986c","resolution":{"observed_at":"2026-08-07T12:40:47.090823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:40:47.180213Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:47.180213Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:1114c29a8111c873c6b1ea6307b6a4e30a21b4519c2a271c60e5ea129658f3b6","observation_id":"7c83732d-0799-4372-a423-e1939376ee40","resolution":{"observed_at":"2026-08-07T12:40:47.180213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01645","last_updated":"2025-05-13T06:38:44Z","snapshot_observed_at":"2026-08-01T01:35:24.172402Z","submitted_at":"2025-01-03T05:32:37Z","title":"HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.01645","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01645","snapshot_observed_at":"2026-08-07T12:40:47.536901Z","title":"HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding","venue":"cs.CV","work_id":"beedfea0-fe04-4af3-9b11-3aefa9c0bc68","year":2025},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:47.324806Z"},"links":{"cited_paper":"/paper/2501.01645","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:6e5289a58acd745e3f807e0413876226b9862f77327cc440c834bef16f682335","observation_id":"ceccd74c-0d78-4a0a-b4b0-e2360e424580","resolution":{"observed_at":"2026-08-07T12:40:47.648879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":33,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2505.23922."}