{"as_of":"2026-08-21T06:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1092931c70cfad6960ab64249274ef989eb334549ff33d48207f2d589ba1455","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:10:57.491105Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.03829/citation-record","integrity":"/paper/2505.03829/integrity","json":"/paper/2505.03829/citation-record.json","paper":"/paper/2505.03829"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.699497Z","title":"Frozen i n time: A joint video and image encoder for end-to-end retriev al,","venue":null,"work_id":"b1b4bfa7-916f-4d59-8a9f-27d740f027d0","year":2021},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.208332Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:89d8c42af4801f936a88aafa3c1cdb238a6ea2d2e476911dd1d06de0fd27325e","observation_id":"0457cecf-8f81-4e45-bb37-3fb973083e06","resolution":{"observed_at":"2026-08-16T04:10:58.703017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.686620Z","title":"Scale invariant feature transform,","venue":null,"work_id":"d6f17a8a-f50d-46e3-b521-94e3df22b746","year":null},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.212724Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:a882a80d06bbba09f0955625bbded08c52c520c5a211cc7f6c20587603f19879","observation_id":"08461a35-ad1d-4559-8d15-2fd6d89cff1a","resolution":{"observed_at":"2026-08-16T04:10:58.691096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.674273Z","title":"Speeded-u p ro- bust features (surf),","venue":null,"work_id":"d06aabd3-cac7-47ff-9a55-31d000567f34","year":2008},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.216370Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:8e08a179daf131ca9862d85638a753b4029ff14061f6ae30c0b5ebda3da6a028","observation_id":"f47cd2e7-f2a0-4bea-82c1-7e31ea624775","resolution":{"observed_at":"2026-08-16T04:10:58.678497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.661154Z","title":"Histograms of oriented gradient s for human detection,","venue":null,"work_id":"78290d9d-5d12-4358-bdb1-aaa9c1577a05","year":2005},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.220205Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:3b834e1da20edf949bb8733d5656613f5addd256febec263b84a68520a2b4b26","observation_id":"d9163e71-2ed7-4c94-a706-223aa3952cf9","resolution":{"observed_at":"2026-08-16T04:10:58.665742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.648423Z","title":"Large-scale video classiﬁcation with conv olu- tional neural networks,","venue":null,"work_id":"03eb2470-82e9-4688-8346-3bb84bc3a95d","year":2014},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.223893Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:8912bd312022890d2522e5d29bf9d202106dfc7d4a7b21d43989ba0bace7d28a","observation_id":"c413d45f-92cf-49bd-8da6-6fbfd18877e0","resolution":{"observed_at":"2026-08-16T04:10:58.651998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.636408Z","title":"Convoluti onal two-stream network fusion for video action recognition,","venue":null,"work_id":"d00530ef-7ae2-4efe-9f87-2d3399a0559a","year":2016},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.227558Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:12ddd4a901fbab7f745f4d778f3281aa16ddbb12aa8ffdd40b08e8155905b81e","observation_id":"3be2e011-c426-4941-bea1-b8889489d7e1","resolution":{"observed_at":"2026-08-16T04:10:58.640500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.624001Z","title":"Videobert: A joint model for video and language representa - tion learning,","venue":null,"work_id":"b02a3a8c-8758-41c3-8094-825f8f7b5312","year":2019},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.231096Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:96d1cc627af0fd1f0741d518a88255c8cc4416e94db5ffac821e53669d3d8009","observation_id":"7a15fdf0-f206-4377-9ab6-0c3dfe524e7c","resolution":{"observed_at":"2026-08-16T04:10:58.628095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.611615Z","title":"Videomae: Masked autoencoders are data-efﬁcient learners for self-supervi sed video pre-training,","venue":null,"work_id":"419ec2fa-8c2e-4f7f-8f7e-f031ba2de5f5","year":2022},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.235248Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:74eef7f95322e4051ca70b1b7ed03102699ff0066e5bc78955b0991612038320","observation_id":"cc9c0b22-75d0-42a1-9682-af326be4f67b","resolution":{"observed_at":"2026-08-16T04:10:58.615844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-16T04:10:57.238581Z","title":"Video-llama: An instructio n- tuned audio-visual language model for video understanding ,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.238581Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:770d216eb4ab2f31703c8637beb348d93cee5435fad34209977afc89a1cbe3ef","observation_id":"b3cbbc0d-6946-45bb-b1f7-40f56455398b","resolution":{"observed_at":"2026-08-16T04:10:57.238581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-16T04:10:57.242459Z","title":"Videochat: Chat-centric video under- standing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.242459Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:16d924419e17ab4b8af30d8835f934bb486e27b93ed9885b2f0d51400bf8ed7a","observation_id":"41a4c077-2842-4e92-b2c1-95f2903988ef","resolution":{"observed_at":"2026-08-16T04:10:57.242459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-16T04:10:57.246180Z","title":"Video- chatgpt: Towards detailed video understanding via large vi sion and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.246180Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:9887d61d3baed0ab90d863fbb4c1723d445fdee6f71e58f1557ae2ab73421c31","observation_id":"30905b2d-f513-41b6-a5b6-a3fb1bc79228","resolution":{"observed_at":"2026-08-16T04:10:57.246180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:57.250137Z","title":"Video understanding with large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.250137Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:9c2d9c6baa51cca2abf865193ad54b42808422161cc55e74b0d6a363a3dc1f4f","observation_id":"7ffd5089-4f02-4cc0-9353-71b6d8632fed","resolution":{"observed_at":"2026-08-16T04:10:57.250137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.598107Z","title":"Video question answering via gradually reﬁned attention o ver appearance and motion,","venue":null,"work_id":"82948367-6492-475f-a355-12cf2b2cab77","year":2017},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.253389Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:e96d08ee2166dc68cef4bd105b94f64cc826f05502f001c87363bf047dd5b9cc","observation_id":"9a52db01-2d9f-4b38-850f-5d805656a4a6","resolution":{"observed_at":"2026-08-16T04:10:58.602266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.586269Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering,","venue":null,"work_id":"54070aa5-2675-4837-a310-f25346cffaff","year":2017},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.256649Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:8f00ab1a6de4bbac2a994bb77fcbfb7ebe9393df9abd4b6a3874fb3924692058","observation_id":"0c4efde5-f176-4d14-9ce3-6a915556c71a","resolution":{"observed_at":"2026-08-16T04:10:58.590327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.572470Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering,","venue":null,"work_id":"c01dc503-b6a3-4fd1-8c79-9aecbc90c392","year":2019},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.259980Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:6356e1728ed9e85b290fa37b80080cda4d9faf8992c564f3eebda70a80a46efa","observation_id":"0af542e8-025b-4f0c-9876-975dac7eafbd","resolution":{"observed_at":"2026-08-16T04:10:58.577932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.560622Z","title":"Tvqa: Localized , compositional video question answering,","venue":null,"work_id":"096f927e-eb54-42eb-abf9-94652ef1b983","year":2018},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.263310Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:01845919671ba5d3b37cf07af3ee83495daab603e33bc0c15a71df51ae7f485f","observation_id":"989723b7-7e4a-43e2-8960-6215ec44ad74","resolution":{"observed_at":"2026-08-16T04:10:58.564643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.548195Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":"b3764668-f198-41c3-8bc7-6d677c5f84dd","year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.266599Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:3a9933c268ade8b9cc4022f7f8eea22b60f9a0c80de35016771b907f34943e1f","observation_id":"a7584a48-4dff-44f8-b212-2f08c75fafcc","resolution":{"observed_at":"2026-08-16T04:10:58.552326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-16T14:39:55.654977Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-16T04:10:57.270051Z","title":"Video-bench: A comprehensive benchmark and toolkit for evaluating video-based large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.270051Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:5266bb388c8fa293e0387d9dc6ed14885190c1f61bfd97bb0b7b50c0c8b78b40","observation_id":"c5e18990-fa29-4d29-abe7-3ec904d7cc23","resolution":{"observed_at":"2026-08-16T04:10:57.270051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-20T13:41:40.828943Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-16T04:10:57.273744Z","title":"Videovista: A versatile benchmark for video understandin g and reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.273744Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:e057cc17193291500562bdbbe6859e1b5a72b7e127caff607b72251785774e8e","observation_id":"7827d522-bce2-400e-8df6-f4151b52fb7f","resolution":{"observed_at":"2026-08-16T04:10:57.273744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-17T14:14:30.066593Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-16T04:10:57.278096Z","title":"Cinepile: A long video question answer- ing dataset and benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.278096Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:e9c11a2754eada3fb060141d28e3ef3ae64721a6827819d6444b31d856e30b31","observation_id":"c93d0d5f-e557-431d-a3fc-a6eb6398a25a","resolution":{"observed_at":"2026-08-16T04:10:57.278096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:57.281659Z","title":"Inﬁnibench: A comprehensive benchmark for large multimodal models in very long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.281659Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:31b6c0e115fd3ad216fc5bdc8d12949d0a50a9e5dd5df637992a960f3431dbbb","observation_id":"2f64fe3f-2e34-4a4d-a9d6-34680788f4f0","resolution":{"observed_at":"2026-08-16T04:10:57.281659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-20T11:33:15.725975Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-16T04:10:57.285229Z","title":"Tempcompass: Do video llms really understand videos?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.285229Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:20af86cbe7c147a627f71cd12ba72c78c6c7ebcc70b4dcf83635504245beec51","observation_id":"e5c30a6e-22c3-471e-9472-771585ae9e31","resolution":{"observed_at":"2026-08-16T04:10:57.285229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.535696Z","title":"Her o: Hierarchical encoder for video+ language omni-representa tion pre-training,","venue":null,"work_id":"7bda989a-9131-446c-b633-33acc3e80ee5","year":2020},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.288735Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:8ed4f465de7ae74f77d4f40bca0a048cecffcd5a77ee714956460b029502661a","observation_id":"9af3a1e1-5d5b-44c1-aca3-b62ad2d63219","resolution":{"observed_at":"2026-08-16T04:10:58.539725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.523946Z","title":"Star: A benchmark for situated reasonin g in real-world videos,","venue":null,"work_id":"f44ef69e-3d35-4e8d-b082-832a91d93bd3","year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.292147Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:7025c83bbc7e17fa4e192b6de2ebe7158526a68bf0dae3353d1eb798451cfad2","observation_id":"a38e6837-e11d-4e71-910b-0a895c294139","resolution":{"observed_at":"2026-08-16T04:10:58.527959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-16T04:10:57.295597Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.295597Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:5e64b90cf1720aab1fb12cb7fe7a15c624a42b561fc6a6af7c182628238ba6ca","observation_id":"2942772e-a2f3-4211-b5d8-6c2a222f5199","resolution":{"observed_at":"2026-08-16T04:10:57.295597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.511257Z","title":"Autoeval-video : An automatic benchmark for assessing large vision language mo d- els in open-ended video question answering,","venue":null,"work_id":"7c5250a8-c59e-4e3a-bfca-3bb1b37f9bae","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.299508Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:7b724f838a999c2ac5b89a58417208fa8adabee1f30540742966588341d035f4","observation_id":"53072aab-6734-4f68-9aa4-25c5fdc9f789","resolution":{"observed_at":"2026-08-16T04:10:58.515745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-16T04:10:57.302910Z","title":"Video-mme: The ﬁrst- ever comprehensive evaluation benchmark of multi-modal ll ms in video analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.302910Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:0c77b7fcb94a794ce3abbd02988ba3841376f41eb1e44f95b484eeee2a9de2e2","observation_id":"cdde5b75-7588-402e-a959-a055637c308a","resolution":{"observed_at":"2026-08-16T04:10:57.302910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.498774Z","title":"Sok-bench: A situated video reasoning bench - mark with aligned open-world knowledge,","venue":null,"work_id":"563d0873-5d4a-47ee-a1e3-9964e7bb882b","year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.306568Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:abf287ec9d0566d39d3cff813743c5948b8d674b63afa1f80354f7caef173647","observation_id":"1ffb5038-5031-4671-9b6f-8c6c32ed87b6","resolution":{"observed_at":"2026-08-16T04:10:58.502546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-19T19:31:39.899491Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-08-16T04:10:57.310180Z","title":"Short ﬁlm dataset (sfd): A benchmark for story-level video understan ding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.310180Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:8bad445c9f0c8c9c56d7c4119465d8eb5b464163bf99f21db76f1257985fd02e","observation_id":"96461d7b-a7ae-465d-9552-ea619cb64dde","resolution":{"observed_at":"2026-08-16T04:10:57.310180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-16T04:10:57.313889Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.313889Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:bdb97cc4e11d968c10d3503e2b86e474ff02346842d258a03bd59497215166ac","observation_id":"e7847b22-1578-4fe9-9df3-5e32153a7437","resolution":{"observed_at":"2026-08-16T04:10:57.313889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08407","last_updated":"2024-07-30T03:15:55Z","snapshot_observed_at":"2026-08-20T02:26:59.896909Z","submitted_at":"2024-06-12T16:54:54Z","title":"MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08407","snapshot_observed_at":"2026-08-16T04:10:57.317505Z","title":"Mmworld: Towards multi-discipline multi-faceted world model evaluation in videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.317505Z"},"links":{"cited_paper":"/paper/2406.08407","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:e1984f94b9d744468dcc20da7ea0d22533b6e7a1fa08584b2b7d3aeeff26e116","observation_id":"bb73934b-8e76-4fc1-ad34-f7ff3b48399b","resolution":{"observed_at":"2026-08-16T04:10:57.317505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10889","last_updated":"2025-03-30T14:07:22Z","snapshot_observed_at":"2026-08-20T02:26:47.224600Z","submitted_at":"2024-06-16T10:42:21Z","title":"VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10889","snapshot_observed_at":"2026-08-16T04:10:57.321005Z","title":"V elociti: Can video-language models bind sema n- tic concepts through time?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.321005Z"},"links":{"cited_paper":"/paper/2406.10889","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:c6de894faf0ab0e6285856d64294944882d141e78c76af33f764e3852c40a0a9","observation_id":"26e35818-4686-46ba-bc00-b8fa21d25181","resolution":{"observed_at":"2026-08-16T04:10:57.321005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.486971Z","title":"Next-qa: Next phase of question-answering to explaining temporal action s,","venue":null,"work_id":"86e435b4-26e2-408c-8872-1fc489439956","year":2021},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.325091Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:de252ac73e708975f85e5742fd0764141b1f76df0d8f5ca13b9c641366abc984","observation_id":"3f093539-0a41-4e41-8255-28fbf86fa408","resolution":{"observed_at":"2026-08-16T04:10:58.490657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10484","last_updated":"2024-09-27T02:47:55Z","snapshot_observed_at":"2026-08-20T02:24:47.459851Z","submitted_at":"2024-06-15T03:28:52Z","title":"Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10484","snapshot_observed_at":"2026-08-16T04:10:57.328774Z","title":"Beyond raw videos: Understand- ing edited videos with large multimodal model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.328774Z"},"links":{"cited_paper":"/paper/2406.10484","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:27af85c8f34baefac5309a5f9f084997d168261469db3c6b1292b098551e5308","observation_id":"4ff75dd1-8b15-4161-9509-23de8554df3d","resolution":{"observed_at":"2026-08-16T04:10:57.328774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.475387Z","title":"Cider : Consensus-based image description evaluation,","venue":null,"work_id":"7ecfc806-6ef4-4de9-83bb-71a36ac6d601","year":2015},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.332438Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:47d282a871c5b086322a20fd416243d8a0cde22f24427a22cfeacca1eb9261ea","observation_id":"a0758e65-dd60-454b-98ff-1f843bd22dc0","resolution":{"observed_at":"2026-08-16T04:10:58.479156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.461779Z","title":"Meteor: An automatic metric f or mt evaluation with improved correlation with human judgments ,","venue":null,"work_id":"3c7ef8ff-cad2-4259-a243-23f7abd70de2","year":2005},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.336309Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:8e6e640fef3d3027e2fcd9485ba53c1dc66e838a8546aa94ca7aac9626195063","observation_id":"b2f1fe92-9012-40ad-9d96-a9bd2b7d64bb","resolution":{"observed_at":"2026-08-16T04:10:58.466039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.449728Z","title":"Rouge: A package for automatic evaluation o f summaries,","venue":null,"work_id":"e2a17132-2bae-4cc5-9816-604b3d6703d2","year":2004},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.340100Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:143b952af54783b57c6ed61f599f9bf52f6b6385cec1591609355e54379143a3","observation_id":"8aaee166-238b-4fa2-97d3-7415a0172be5","resolution":{"observed_at":"2026-08-16T04:10:58.453481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.434234Z","title":"Spi ce: Semantic propositional image caption evaluation,","venue":null,"work_id":"d794f2d1-e6da-40cd-8ba8-592e99d474a8","year":2016},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.343546Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:6e9ed512f87eae194e9797a9e6b28b112a9302bde9d413aaeacabdbce06b3e32","observation_id":"10154545-9f00-4c87-ac65-3385c473647a","resolution":{"observed_at":"2026-08-16T04:10:58.439700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-16T04:10:57.348050Z","title":"Plla va: Parameter-free llava extension from images to videos for vi deo dense captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.348050Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:cc2aa17072d90ea72a613746df003e9179e218a16b4111ed5387de46d831ed35","observation_id":"fd49f749-fda1-418d-b0aa-5a11e99e2bac","resolution":{"observed_at":"2026-08-16T04:10:57.348050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.422178Z","title":"An image grid can be worth a video: Zero-shot video question answering using a vl m,","venue":null,"work_id":"c472088b-d404-4406-ac1b-044884798951","year":null},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.351876Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:7512ca659a04a8bccdeeb67216d325132eea963e0ccf1bb8626f53bc1f636cfa","observation_id":"c8bdc7b7-d4f6-42e8-a55c-a5f99ed9d973","resolution":{"observed_at":"2026-08-16T04:10:58.426279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00308","last_updated":"2024-03-30T10:11:26Z","snapshot_observed_at":"2026-08-20T02:27:00.383763Z","submitted_at":"2024-03-30T10:11:26Z","title":"ST-LLM: Large Language Models Are Effective Temporal Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00308","snapshot_observed_at":"2026-08-16T04:10:57.360169Z","title":"St-llm: Large language models are effective temporal learners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.360169Z"},"links":{"cited_paper":"/paper/2404.00308","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:1558a1220192c394753c74c04e11295a9cfdf4e4794f642291691572e94aeb72","observation_id":"1551d931-4d42-4c77-a1fa-faee1b5e021d","resolution":{"observed_at":"2026-08-16T04:10:57.360169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06573","last_updated":"2023-10-19T23:45:30Z","snapshot_observed_at":"2026-08-16T15:48:57.108651Z","submitted_at":"2023-03-12T05:08:16Z","title":"Large Language Models Know Your Contextual Search Intent: A Prompting Framework for Conversational Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06573","snapshot_observed_at":"2026-08-16T04:10:57.363973Z","title":"Large language models know your contextual search intent: A prompting framework for conversational search,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.363973Z"},"links":{"cited_paper":"/paper/2303.06573","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:5128d22fcffbbdd5d3dceb9d41eab2d16b86c913e94b1bad33d9771127ffc2a4","observation_id":"a25d3613-5ba0-47bf-8b3b-1bf2ccbb4ac0","resolution":{"observed_at":"2026-08-16T04:10:57.363973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.395388Z","title":"Prompting visual-language models for efﬁcient video understanding,","venue":null,"work_id":"14a720fc-86c5-48df-9938-63e8e253e05f","year":2022},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.367703Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:350aa2e703f6768a1e71f7883d21eed4f9125da7ea61e739d16576dbea5b67e0","observation_id":"97e10699-b042-47b8-bdf9-ceb03bcaac73","resolution":{"observed_at":"2026-08-16T04:10:58.401414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.383348Z","title":"Vid2seq: Large-scale pr e- training of a visual language model for dense video captioni ng,","venue":null,"work_id":"21c977c0-94d1-41b3-9538-d06cb79039c1","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.370935Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:3bcd69cee49cc892d7bde1a31f35be2ba4412cf5fd1656cb293cbbe8b66a7ee2","observation_id":"2c694bcf-fb46-454a-a33d-b2ea7fe61535","resolution":{"observed_at":"2026-08-16T04:10:58.387048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.366858Z","title":"Lea rning video representations from large language models,","venue":null,"work_id":"6c656cae-db9b-47f6-99d8-699b41fb7aa9","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.374152Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:7d69ec716d3f2e56919c9ec4cf255a82b65a320c52cac5a0cba6d75ba61c31ae","observation_id":"7a2d283b-0723-4264-bda1-06c3f4fa4d38","resolution":{"observed_at":"2026-08-16T04:10:58.375575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12218","last_updated":"2023-05-20T15:48:47Z","snapshot_observed_at":"2026-08-16T15:31:28.474878Z","submitted_at":"2023-05-20T15:48:47Z","title":"Text-Video Retrieval with Disentangled Conceptualization and Set-to-Set Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12218","snapshot_observed_at":"2026-08-16T04:10:57.377738Z","title":"Text-video retrieval with disentangled conceptu aliza- tion and set-to-set alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.377738Z"},"links":{"cited_paper":"/paper/2305.12218","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:35b1e961cd33877a412637993f801c0f37c17a8c023e084f758162ec86c18498","observation_id":"dd2bf198-3261-463e-9b15-da47f779f920","resolution":{"observed_at":"2026-08-16T04:10:57.377738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09867","last_updated":"2023-08-19T08:31:57Z","snapshot_observed_at":"2026-08-20T21:39:27.999814Z","submitted_at":"2023-03-17T10:07:19Z","title":"DiffusionRet: Generative Text-Video Retrieval with Diffusion Model","version":2},"cited_work":{"arxiv_id":"2303.09867","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09867","snapshot_observed_at":"2026-08-16T04:10:57.615082Z","title":"DiffusionRet: Generative Text-Video Retrieval with Diffusion Model","venue":"cs.CV","work_id":"fe3864f3-2a4c-431e-ae74-9239c295d28c","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.381159Z"},"links":{"cited_paper":"/paper/2303.09867","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:50c8a94b77f86250620e53fd294a7858c1473e20fd54db8f383bd211480e6faa","observation_id":"cff9b54f-1fd1-4f1a-b1c0-b7d5f4637841","resolution":{"observed_at":"2026-08-16T04:10:57.621559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.347268Z","title":"Egovlpv2: Egocentric vid eo- language pre-training with fusion in the backbone,","venue":null,"work_id":"6b94b533-2755-47d1-bd83-5156e0c193ab","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.384947Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:326fc9b6fda30be3530e49fdf295ed7a69c0e8d6bc2fc5ebd4e2e470b2d97ae4","observation_id":"632fe7bf-dc07-41d9-bc93-a9f8f9c48c9d","resolution":{"observed_at":"2026-08-16T04:10:58.354358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13160","last_updated":"2023-11-22T05:04:20Z","snapshot_observed_at":"2026-08-20T02:26:49.726099Z","submitted_at":"2023-11-22T05:04:20Z","title":"Large Language Models in Education: Vision and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13160","snapshot_observed_at":"2026-08-16T04:10:57.389050Z","title":"Large language models in education: Vision and opportunities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.389050Z"},"links":{"cited_paper":"/paper/2311.13160","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:f6fa8e62371f6a9a89682ffe84b6879227f1cd9265f754110e59bb81d8441a63","observation_id":"a5c85418-434c-423a-b6db-6a8a8141fbf2","resolution":{"observed_at":"2026-08-16T04:10:57.389050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08849","last_updated":"2023-08-17T08:15:51Z","snapshot_observed_at":"2026-08-20T02:26:58.666664Z","submitted_at":"2023-08-17T08:15:51Z","title":"A Survey on Deep Multi-modal Learning for Body Language Recognition and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08849","snapshot_observed_at":"2026-08-16T04:10:57.392691Z","title":"A survey on deep multi-modal learning for body language recognition and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.392691Z"},"links":{"cited_paper":"/paper/2308.08849","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:8109139da2b81000904925261d24d5e9c7c14730e77c2720ae68ca3c0d3b945e","observation_id":"f6de4c2e-beb7-459c-bb93-36834d7552ca","resolution":{"observed_at":"2026-08-16T04:10:57.392691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.334817Z","title":"Machine translation from signed to spoken lan- guages: State of the art and challenges,","venue":null,"work_id":"f0e15f44-d7c8-4303-ac81-caa00be4cc15","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.396186Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:8080540a7705fdee65dbd6d9cc1b3e5d0d69d450f070bf80f49b16113e5ee2e2","observation_id":"8c8c58cb-9c19-452d-b9ac-4f52344f1e7a","resolution":{"observed_at":"2026-08-16T04:10:58.339055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.321634Z","title":"Generating video game quests from storie s,","venue":null,"work_id":"12d69116-ab67-4785-bd6d-0c20b0de3702","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.399555Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:49d25003043953f235421b989a88bb19a2b6c1cca70f31d4bb57cafae6a4daa6","observation_id":"6a583ddb-c0bb-45c5-af0f-16802d2cc2e7","resolution":{"observed_at":"2026-08-16T04:10:58.325720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.309349Z","title":"Text generation for quests in multiplayer r ole- playing video games,","venue":null,"work_id":"5188f502-da71-4766-9473-4d89d9db12fa","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.402915Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:b86e51d3386b53ae5a19aa05d6e3d589db6701ed7d73dbdc0ae228c54bca634d","observation_id":"2b6d144f-71e8-4bca-baf9-e27bb6d3d6d5","resolution":{"observed_at":"2026-08-16T04:10:58.313403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.297299Z","title":"The role of artiﬁcial intelligence and robotic solution technologies in metaverse design,","venue":null,"work_id":"b5d22cad-6574-4766-b177-0dcd169c7c69","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.406452Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:1fe0ab8f3ef14810abb9ecf2f63e44522b881649ee0cc1bb50709d95df966ee8","observation_id":"fa00f981-94d5-49b8-bf36-108fb955f490","resolution":{"observed_at":"2026-08-16T04:10:58.301198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.285506Z","title":"Jung and M","venue":null,"work_id":"370b7cc1-3d6d-49b2-903a-808515295bda","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.409962Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:daa83bfc238145816bfae70b62bf0fcac752d52a94e4dc8be539b042df186951","observation_id":"38d1517d-d868-411a-93f5-6e9df3ab346d","resolution":{"observed_at":"2026-08-16T04:10:58.289191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16785","last_updated":"2024-10-10T16:09:22Z","snapshot_observed_at":"2026-08-21T00:37:40.256966Z","submitted_at":"2024-05-27T03:13:28Z","title":"PromptFix: You Prompt and We Fix the Photo","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16785","snapshot_observed_at":"2026-08-16T04:10:57.414062Z","title":"Promptﬁx: Y ou prompt and we ﬁx the photo,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.414062Z"},"links":{"cited_paper":"/paper/2405.16785","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:cd2fcd68cb8e491e62d571d678af5d4f6248784a7181aaae36f8d4430bda33c5","observation_id":"03b6e04c-908e-4e08-8cd0-44e0d4ecfe61","resolution":{"observed_at":"2026-08-16T04:10:57.414062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.273055Z","title":"Egocentric audio - visual object localization,","venue":null,"work_id":"bc702021-9704-4248-ae9c-089bc6b2c679","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.418116Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:ccf8fe098ff4ef9c68b30a1f6fce56c582309fa4f6789a6d86647ba2df3858c7","observation_id":"c134139c-ac6a-4450-98f7-d5590369b4a2","resolution":{"observed_at":"2026-08-16T04:10:58.277305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.260448Z","title":"Misar: A multimodal instructional system with augmented reality,","venue":null,"work_id":"065331cc-3b2f-40f1-9434-852ac258c477","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.421836Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:b504a61a7f39d3655b2cfb128eeaa95f9047127209b18fb593d03b871c4665c2","observation_id":"abc99f2a-1a97-4173-b087-98960b9c1f2a","resolution":{"observed_at":"2026-08-16T04:10:58.264739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.247738Z","title":"Sayplan: Grounding large language models using 3d scene graphs for scalable robot task planning,","venue":null,"work_id":"a306cb4f-3e4c-47b3-b40b-eea0c43f0ddf","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.426486Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:cae9e51be2e6e454250e9dd8d3f20cd0c226bfbd14d15169cde2626295bc1d75","observation_id":"123e926d-2a69-4728-9ee5-95ae57077aa7","resolution":{"observed_at":"2026-08-16T04:10:58.252034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.234997Z","title":"The role of chatgpt, generative language models, and artiﬁcial intelligence in medical education: a con- versation with chatgpt and a call for papers,","venue":null,"work_id":"c7a03a3d-e881-4bfd-aaff-d830d2cf73d9","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.430221Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:b123ab6f605f35076e900d355645e3b573def56f5d38bfa492e9d9f6305e1357","observation_id":"84041543-f715-41ec-bf3a-d5a94720c217","resolution":{"observed_at":"2026-08-16T04:10:58.239305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.221106Z","title":"Beat: A large-scale semantic and emotional multi-modal dataset for conversational gestures synthesi s,","venue":null,"work_id":"6d66463f-fdba-4fff-a0da-883ff11c23a0","year":2022},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.434122Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:05be3fe485928ece3fbba756a6448bd46276980a10a5d76c12110dd198d5bfaf","observation_id":"b699bdf1-e3ec-4f01-b360-88270bb966f3","resolution":{"observed_at":"2026-08-16T04:10:58.225749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.208464Z","title":"Disco: Disentangled implicit content and rhythm learning for diverse co-speech gestures synthesis,","venue":null,"work_id":"04ca33d5-1510-4145-be29-1bd510c6a875","year":2022},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.438175Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:c539c49f33411968eeaedb9e75a109749e530b392eefde2e7ed07d5a4596d4c7","observation_id":"f21a76c5-1eef-4af4-8019-227a4c0556d3","resolution":{"observed_at":"2026-08-16T04:10:58.212875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.194397Z","title":"Emage: Towards uni- ﬁed holistic co-speech gesture generation via expressive m asked audio gesture modeling,","venue":null,"work_id":"e3687cca-da61-474e-a57e-346d5e5c9826","year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.442033Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:a0c56b4190c5e415435995c212bc99d8dd7d9a2dc71ee9dd2a57f1c47101b6b5","observation_id":"fb50e9a4-e2e1-4316-bc52-5881bca592d5","resolution":{"observed_at":"2026-08-16T04:10:58.198635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00890","last_updated":"2023-06-01T16:50:07Z","snapshot_observed_at":"2026-08-09T05:23:28.778360Z","submitted_at":"2023-06-01T16:50:07Z","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00890","snapshot_observed_at":"2026-08-16T04:10:57.445714Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.445714Z"},"links":{"cited_paper":"/paper/2306.00890","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:e310091fe230afc846ab895e5dd32b57704bec2d018bdb1fd3ce18103374cd42","observation_id":"087c594f-de19-4643-8fa2-ac170830ed03","resolution":{"observed_at":"2026-08-16T04:10:57.445714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.180183Z","title":"Chatgpt for cybersecurity: practical applications, challenges, a nd future directions,","venue":null,"work_id":"ba3eba56-cc53-4888-bacd-3503af643b44","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.450162Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:95b58461f1c81393aa8af8bf7e9aff5e9ee0fd9de2b1dbab201a52fa01a45478","observation_id":"06414b93-953f-4053-9c7d-8f9bec932fbf","resolution":{"observed_at":"2026-08-16T04:10:58.185033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.167868Z","title":"Modelling language for cyber security incide nt handling for critical infrastructures,","venue":null,"work_id":"45ae1296-293d-4a4d-a944-e667d75915d7","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.454103Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:f077a5d522ad5bb9f87b8d5a15ee4b35086708842c89f5bc519d8e02bba3da06","observation_id":"0c1196e5-1cc2-4c52-bc9e-6e5129f94096","resolution":{"observed_at":"2026-08-16T04:10:58.171783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.154876Z","title":"Socratic video un- derstanding on unmanned aerial vehicles,","venue":null,"work_id":"badb83b1-da9a-4349-82c6-a1359f00075b","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.457788Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:89046daf8a58b0e27eda52dda6d189cf4af2aa3df79ba65013c1f339ec4ce765","observation_id":"d9c89dbe-87da-40c5-965a-458ee2a764e3","resolution":{"observed_at":"2026-08-16T04:10:58.159088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.141484Z","title":"Lanobert: System log anomal y detection based on bert masked language model,","venue":null,"work_id":"5b9ae1df-f411-4f23-b605-da197ec94b02","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.461676Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:3ba4c9fc1e600807da79d0fc46529a49fa49fa879b5136b0ae5f9a4396eb3cda","observation_id":"337893e5-e600-47d2-901a-5c5eb9b5bce4","resolution":{"observed_at":"2026-08-16T04:10:58.146125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.128348Z","title":"Logﬁt : Log anomaly detection using ﬁne-tuned language models,","venue":null,"work_id":"ef81524b-e8e6-44f8-9a55-3e5a0cdcccc1","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.465491Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:3bb33b362b9a46f93d28c4c4a92fd182e36ecdb0cf727bb71c62aaefa6e2a9e1","observation_id":"9e006d68-503a-4a62-846d-b3740f65e80e","resolution":{"observed_at":"2026-08-16T04:10:58.132101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13023","last_updated":"2024-05-07T10:10:14Z","snapshot_observed_at":"2026-08-16T14:50:49.761494Z","submitted_at":"2023-10-19T06:17:46Z","title":"GraphGPT: Graph Instruction Tuning for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13023","snapshot_observed_at":"2026-08-16T04:10:57.469272Z","title":"Graphgpt: Graph instruction tuning for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.469272Z"},"links":{"cited_paper":"/paper/2310.13023","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:a85215cf3c711c4f365159b7597b910878d2fbd0e0b366d014a090ee2d2ef2a8","observation_id":"51c40cc3-ebe4-498a-bd32-9c912e6b9c82","resolution":{"observed_at":"2026-08-16T04:10:57.469272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.115462Z","title":"Drive as you speak: Enabling human-like interaction with large lan- guage models in autonomous vehicles,","venue":null,"work_id":"765205e7-5f3d-4427-9663-964040bd3d37","year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.473276Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:1fe0da4300b8c34d840e29964779fed49d440ea0026e388c3473a6d94eb8b8f7","observation_id":"16a4d9ce-1d6a-4f39-92a9-8840ec38568d","resolution":{"observed_at":"2026-08-16T04:10:58.119702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-16T04:10:57.477036Z","title":"Ott er: A multi-modal model with in-context instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.477036Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:4b5da3c870ea040648e12598b1a1b80be617833e2c7948bd1b827a9ff366debd","observation_id":"873ee204-4992-4a7a-922b-a62edde51234","resolution":{"observed_at":"2026-08-16T04:10:57.477036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-16T15:11:32.772599Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-16T04:10:57.480975Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.480975Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:037c10617d104de32696a8c5ac1ed78daa9ac2f1464d5c3a7dac8c51946f6915","observation_id":"16568131-7681-421b-bfb1-1c9a22c477e4","resolution":{"observed_at":"2026-08-16T04:10:57.480975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.102218Z","title":"How retail video analytics enhances cust omer experience,","venue":null,"work_id":"d975052b-c90d-4ddb-ba7e-1e902a1cb0fc","year":2025},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.484416Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:8c4655c3213e278dad8da4d6fd3ae4d60b5f4cb6ab3fcaedc89d701bef6e9e8c","observation_id":"f2741f88-e54a-40dc-9562-72d60aef8840","resolution":{"observed_at":"2026-08-16T04:10:58.106588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.088736Z","title":"How video analytics is transform ing the luxury retail experience,","venue":null,"work_id":"04ad347c-8b7f-4bb8-ad8e-17e74e9fab29","year":2025},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.487821Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:7365e0d51cd43df43e56cfcb9f5556865891a53f75cbc8725902d2617691c8a4","observation_id":"720ed770-7920-462c-9723-62462dbb55b4","resolution":{"observed_at":"2026-08-16T04:10:58.093348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.074584Z","title":"Visual search and its growing inﬂuence on e-commerce,","venue":null,"work_id":"7cd6ae99-08da-467c-b82e-06549405213a","year":2018},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.491105Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:15185aa384ae3264f3e40a19488512a886371ffaa437956f13a375a3e37f4944","observation_id":"83ca2291-8e1f-48e6-aa14-dad7416d4a75","resolution":{"observed_at":"2026-08-16T04:10:58.079736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.410035Z","title":"Available: https://arxiv.org/abs/2403","venue":null,"work_id":"c254e302-4e88-411a-a6ea-e60f64114436","year":null},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.356168Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:79f7f7f373640a0c7a5f354a49eb89a17bea28295a01e941a32f5abc78cc8d2d","observation_id":"34ed7320-45fb-4f0c-8dae-03e4858cd505","resolution":{"observed_at":"2026-08-16T04:10:58.414170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T02:24:10.367848Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":49},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2505.03829."}