{"as_of":"2026-08-05T14:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fbac2cf8b6433fd6214da18cfc269d859af4f4d462ef2865a0255b5d661992d7","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T14:50:02.159411Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T04:55:07.020202Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02522","snapshot_observed_at":"2026-07-31T04:55:07.020202Z","title":"Moment-video: Diagnosing temporal fidelity of video mllms on momentary visual events.arXiv preprint arXiv:2606.02522, 2026b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28516","last_updated":"2026-07-30T16:55:00Z","snapshot_observed_at":"2026-08-03T00:12:15.483759Z","submitted_at":"2026-07-30T16:55:00Z","title":"Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T04:55:07.020202Z"},"links":{"cited_paper":"/paper/2606.02522","citing_paper":"/paper/2607.28516"},"observation_digest":"sha256:6d27287ae6b246508b806f062069c0b37b514e342ff33aa5e5f8917be1d10e57","observation_id":"ad2aa71d-2926-493f-9a58-83fc99f8bb29","resolution":{"observed_at":"2026-07-31T04:55:07.020202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.02522/citation-record","integrity":"/paper/2606.02522/integrity","json":"/paper/2606.02522/citation-record.json","paper":"/paper/2606.02522"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:20c25ee80686c3ac32e09a01bb1debbc020022798d5e5eb87cfc98a9a5ac8cdb","observation_id":"7ce63d8e-d541-44ba-913d-fd91d8e87c7b","resolution":{"observed_at":"2026-07-01T22:56:20.847215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:d19575aa49249732d4ab7ae290e5bab3ed5299bdcd46c2ceb5835f85f38dd7c9","observation_id":"08a64477-c3f5-4ecf-9a72-182d6117dcbf","resolution":{"observed_at":"2026-07-01T22:56:20.866115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Animal kingdom: A large and diverse dataset for animal behavior understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:6706147593e91c904c44c440a87b0efe8878645330e59fa6d71d91f5011c3f0b","observation_id":"3fd0a824-3534-4ce6-89f4-1b5d0ab61079","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":"2501.13106","doi":"10.48550/arxiv.2501.13106","metadata_source":"pith","pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","venue":"cs.CV","work_id":"38f52461-37fd-4266-bc46-9dea31be2824","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:6cb5cb2439ed8c62551b7421d9504302d264c27d8bc68fcc5b9b678e7cc523dc","observation_id":"7e9837e0-fefb-4b2f-88ff-a5b6aadca96f","resolution":{"observed_at":"2026-07-01T22:56:20.887187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:5424693ad5c930a0ac0185ff9c708c57bc386c10119c6e18b9d43e8b335214cc","observation_id":"9433cb44-0d39-483f-aac0-417b46fac94f","resolution":{"observed_at":"2026-07-01T22:56:20.855054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:33c38a2663911910ad67bbea60e3e5c9538467f39711540cb167ccf8f72e1486","observation_id":"7821c330-90e8-4408-b07d-c5b520b05166","resolution":{"observed_at":"2026-07-01T22:56:20.894624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Tracknetv2: Efficient shuttlecock tracking network,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:5357e1be8374d2745a6ad70b8bc4d2bc19c6a506000abdddda0978d2528c20c3","observation_id":"6f17675a-a9cf-4893-930c-d022a3088706","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":"1212.0402","doi":"10.48550/arxiv.1212.0402","metadata_source":"pith","pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","venue":"cs.CV","work_id":"5dfb46e7-e952-409d-a3c7-ba7f20aebad6","year":2012},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:9df9f85045a14b20209281a6bd2c880fc6ed59998966905dd8a937c5b471b1e4","observation_id":"b2dc98d0-796a-4fb1-b97b-2f910ae92e20","resolution":{"observed_at":"2026-07-01T22:56:20.903412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Sports videos in the wild (svw): A video dataset for sports analysis,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:e850043adad599bb4f90250f91323caf7742b3b45f4199d7245a6090e4ea50b1","observation_id":"5c1fa725-b0ec-4bb9-b9ee-95baa3e53b83","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Multisports: A multi-person video dataset of spatio- temporally localized sports actions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:936acba27c2a4eb2c3963687888e4e29d04e17243a8b1568bbe9121911e0759f","observation_id":"8dab6a8e-c68c-4971-9bb6-76e5b54d2d1a","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05067","last_updated":"2026-04-20T07:42:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T08:43:57Z","title":"LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.05067","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.05067","snapshot_observed_at":"2026-07-01T22:56:20.849342Z","title":"LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding","venue":"cs.CV","work_id":"2c7d772c-f446-468e-b3b2-1af425952b41","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2501.05067","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:af6ae4d5e8e3cb04249d54c3c973be016488722b06505c9995c40e96b39da7e1","observation_id":"01a5f906-7144-4358-8e1c-892fdf347538","resolution":{"observed_at":"2026-07-01T22:56:20.851381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":"2503.21776","doi":"10.48550/arxiv.2503.21776","metadata_source":"pith","pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","venue":"cs.CV","work_id":"0ce88332-564c-4361-8e2a-3850eb1ace9c","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:1b84f2ede05b2de7f50b4436a23333b8df0f23d9c334a41ee819fddd62ba064e","observation_id":"c311c578-fa1e-45a7-bad3-e242998ad98d","resolution":{"observed_at":"2026-07-01T22:56:20.862878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:d824367bf302dc96df88c0b7857c2f0ad88265d1b5a82876c7663d6a09ea761a","observation_id":"f36497b5-429f-4978-bb95-23677da03585","resolution":{"observed_at":"2026-07-01T22:56:20.898675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.889311Z","title":"Videochat-r1","venue":null,"work_id":"8d2957eb-c24e-46b9-8bef-c978f7c5f0e6","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:76b9a940685b42309a3df2a46c47d3968892e7d07bf828ba9d5fd0196551fd8e","observation_id":"521b4e63-8d93-4afe-baeb-58a2b537e33d","resolution":{"observed_at":"2026-07-01T22:56:20.840548Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:5010cfe282f0f04e2a645efd37431bb12995cccab940fcb04735b11d774da4fd","observation_id":"ad3d368e-2a78-4611-80e2-b6d572f7d88c","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:e764e3aad3054d0621516b7f4d935779fa8eef8664bc16d28b2b546779d25843","observation_id":"88746ea4-69e3-4143-b76c-dae8301f75e1","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05015","last_updated":"2026-04-06T17:59:56Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T17:59:56Z","title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","version":1},"cited_work":{"arxiv_id":"2604.05015","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.05015","snapshot_observed_at":"2026-07-04T03:49:30.277574Z","title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","venue":"cs.CV","work_id":"79edc1c3-c8fc-42ee-b2b8-e2f477b88399","year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2604.05015","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:44de57ca3253a6108f079d5581812abcf2aac04b1c8dbd567bab800c0daf4a91","observation_id":"57b4fda6-02e1-424f-8cf3-a01012bba15a","resolution":{"observed_at":"2026-07-01T22:56:20.874736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Motionbench: Benchmarking and improving fine-grained video motion understanding for vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:ba6bccfb275fa253f91ac0b1ac14e8453d5bc07f17709282dc8db301a9d72a3d","observation_id":"53216f08-b4cb-46cf-8f5f-9fe1345b2923","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14935","last_updated":"2025-03-19T06:42:32Z","snapshot_observed_at":"2026-07-06T20:55:09.392546Z","submitted_at":"2025-03-19T06:42:32Z","title":"FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding","version":1},"cited_work":{"arxiv_id":"2503.14935","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14935","snapshot_observed_at":"2026-07-02T16:17:09.552515Z","title":"arXiv preprint arXiv:2503.14935 (2025)","venue":null,"work_id":"c1602f24-3b7c-4308-a132-5b869164f002","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2503.14935","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:82f11fe79d421b38970eef1d26abb2d33c78279b7243fef05d765b6d88e144b9","observation_id":"e72667ee-7ddd-435b-b475-43da0418d8b8","resolution":{"observed_at":"2026-07-01T22:56:20.891145Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Lvbench: An extreme long video understanding benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:3fa2bce27c834ab235b46ae56ce3ef161bd5023a7105be7eeaacec2913c87f34","observation_id":"b9cc5764-de71-4616-9c15-8bed25e4c86b","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:7f840c090b120ee38b807d75a23958d0876b4d4246bd76afbb04ef7eb014e6a4","observation_id":"a713c0db-e5f7-42ee-83e3-2a777922a005","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Mlvu: Benchmarking multi-task long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:0c1ec0b3d9f2f1995dd2db22c730074675a3a6ff994bca0db6373feeac0951c3","observation_id":"4725545a-3bd9-42eb-9f07-79f12a045dd1","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Hourvideo: 1-hour video-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:f1d7d7839f3ca9b65ac445c641e1ab85f92e2ce862d28ec89bb4904ac333fdb0","observation_id":"4b7fcc73-94ef-4ea3-b662-a697b800f01b","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Seeing from another perspective: Evaluating multi-view understanding in mllms,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:a4f01f7face7a363ba4d14ecfc183cffa583a20aa943f5dcd7d89a5e6e7e844f","observation_id":"8aace875-383e-4e60-a3d6-bbadf57aab9e","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Crossvid: A comprehensive benchmark for evaluating cross-video reasoning in multimodal large language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:0b3f08b3c2c7fe36319274777ca45a1f53ddae16dfd6b4061db3c6fadd9d5df6","observation_id":"18a72315-5a40-452d-87d1-0c4142502165","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T19:07:17.486690Z","title":"Videoreasonbench: Can mllms perform vision-centric complex video reasoning?","venue":null,"work_id":"1ea7b896-5143-407e-8cad-bc2816e4ec8a","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:241f5aa560c1ff760b744b3e193cabecde361543d72bc7fd257e2483100a1030","observation_id":"634962d4-5e78-45ee-ab15-8f79c5991c21","resolution":{"observed_at":"2026-07-01T22:56:20.870527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":"2501.13826","doi":"10.48550/arxiv.2501.13826","metadata_source":"pith","pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","venue":"cs.CV","work_id":"365a8624-64bf-45a7-8a3e-c575aba224dc","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:c7a8eda4034951947e5c0a59894057b59433149073f6c24328eb40b4f8c6619e","observation_id":"242c2a57-807e-4572-a409-cb13252dbdfd","resolution":{"observed_at":"2026-07-01T22:56:20.859293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:b2d014eec599b91bda3c64c9cdf8489be6e38f089c608ff531e08fd27c885096","observation_id":"7e2958a7-24d8-4644-a4fa-746c9615b66a","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Videoads for fast-paced video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:c658551994adfb24f37a92dcccbfa3ddd486d11b2e5e218f1fdf31018447bd0b","observation_id":"6e370cfa-66a0-486f-b2ce-1fcd4605dc95","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:72aab866783ea62ea82ecb04161ba0966e770058b9f262a5ba132901964f49d9","observation_id":"ca256f31-5a2d-482d-819e-bf6f8e3044d2","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Llama-omni 2: Llm-based real-time spoken chatbot with autoregressive streaming speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:91068c0d3eefbdb5ebb26e3300d47bdb2ac36a6ebd35e61067aacc0fdcce8aa0","observation_id":"59bf114e-8823-4572-a5a5-825c58f22219","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:81fb974256873a240d439eb9e168304c44462a08a2034394d21c8e83c28f34dc","observation_id":"c0c69416-f179-4fe3-a134-47d7e2ec5a3f","resolution":{"observed_at":"2026-07-01T22:56:20.882937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Toward deep representation learning for event-enhanced visual autonomous perception: The eap dataset,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:5458a30a4bca660933b8560b0f5f2b4fce70f6502343ab843f6cc0dbd6ed690e","observation_id":"a69b2502-b027-46d2-bb11-ac1bed800e82","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Aisafety: An ai-based smart system for enhancing operator safety in production processes,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:1b4508b33431eb8d339941fbe7e7424a14ae5a89a2a22654c41f4b602e494fbc","observation_id":"b30ea1fe-fd6e-4529-b1d0-795ba320217a","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Introducing our most intelligent model yet. with state-of-the-art reasoning to help you learn, build, and plan anything,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:0a2fdea9c304fc0c5f793eb5b6541e8306a9d054464cfbfc0185d721a3f53c5c","observation_id":"304f4478-bb3f-4ea5-a928-0049afab94a8","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Seed2.0 model card: Towards intelligence frontier for real-world complexity,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:036cb67c483ea1d6ed329fae5cfb7ee5bba580818c6cccedec2f0154d65e6fa5","observation_id":"3e00c39b-620c-4abd-bab9-a911b168b803","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:70e1db4259521c8570de3253076d6377afa60fe8ef98c1dc1d3efa393bb55ea6","observation_id":"2a0c2852-8407-44cc-a48a-4aee4111ed30","resolution":{"observed_at":"2026-07-01T22:56:20.879172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Mimo-v2.5,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:e8e2ea4810f395ce27ad514e83bef9dc24f28b4a8469b5f227f9a82493603471","observation_id":"50d3c2aa-4a93-4d23-b619-9f786db7b748","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Qwen3.5: Towards native multimodal agents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:137c311993c9724a1e78a1bef1cfa387f677ad5dfd29d696596c230dc9eae685","observation_id":"15cafdbb-a7b7-4184-9880-be4582a54f53","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Qwen3.6-35B-A3B: Agentic coding power, now open to all,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:afb51b82e12df73fb1ef6671e9a5eeaf5be7fcff932f994b676e547906c53078","observation_id":"a0576681-6af3-46b8-b53f-ebf2fa3d8425","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Qwen3.6-27B: Flagship-level coding in a 27B dense model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:bf593bbcd0ed8a17deb58db98344e9bd8f82db98b391de7ca2a46891afd264ad","observation_id":"6032dfa5-0746-4bc8-aabe-db52e4c7c1d1","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:4249a1ac5bf7ca438358f2995f13705fc01341a21eedec14bd3061bb44c33f09","observation_id":"774d293e-f1ff-4f69-acd2-d22d96d6ed8b","resolution":{"observed_at":"2026-07-01T22:56:20.907805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:5a1da553228085a170a3d9829f471d41d5c1708b36bb2afab7b574a47e09f6a1","observation_id":"73d1f7c9-175c-4906-9556-0ebde69178ca","resolution":{"observed_at":"2026-07-01T22:56:20.829957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Kimi k2.6 tech blog: Advancing open-source coding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:05896fd415daffc538a784871387fbb68f5e69e21a76ef71151d60d867ea1199","observation_id":"5c3ad478-6fe2-4b04-890e-56dfe3337382","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Envisioning beyond the pixels: Benchmarking reasoning-informed visual editing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:2d451154fdfed9105e7772367e3215192ebba43cf7dbcdddbc4aaacc74b5ddd2","observation_id":"015c5d72-5ac2-4882-bb41-e2088a24f2b4","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10819","last_updated":"2025-03-24T11:46:14Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T06:56:53Z","title":"GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding","version":2},"cited_work":{"arxiv_id":"2406.10819","doi":"10.48550/arxiv.2406.10819","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10819","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.10819 (2024)","venue":"arXiv (Cornell University)","work_id":"1a0befd0-1bbb-46a3-a6fa-f2876bb1c7fc","year":2024},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2406.10819","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:77e26dfd51f4e7f557d82415b8485b98a26f0b4d5345b5d8758acf5ceb5a6146","observation_id":"4eb8595b-c4a9-4c92-88e5-d8a66d97e923","resolution":{"observed_at":"2026-07-01T22:56:20.833472Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Dataset of photographed lightning events attaching to and around the brixton tower, johannesburg, south africa for the 2015-2016 thunderstorm season","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:db1dc12ddfaa39354072863de8b01115c18745ade69d53184845f26e79d5757e","observation_id":"34d31f1c-e049-4930-bded-aee7ec7e30ec","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Egocentric-10k,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:99edcfdbdeab9a98adbcc5ad6b9133ea3d6ca3aba17e2153781bfe1e5d764524","observation_id":"5bfeb4a9-a345-4709-8775-6bfb2ed68445","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"Gemma 4: Our most capable open models to date,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:61fdc8ee4358574b109fc44ca9a4b8e530f8df4becc06fd9c09739983867c795","observation_id":"14a41bf5-cd51-45b2-93b8-592a8a2535d8","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:57dcdfd65ab5cf350a71d27e4e4f4800e6484250c4846f88e0a6ee03c1027dfa","observation_id":"b2f52786-ada2-4b3a-8b12-92cb7ab9a5ab","resolution":{"observed_at":"2026-07-01T22:56:20.836897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":"2501.01957","doi":"10.48550/arxiv.2501.01957","metadata_source":"pith","pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","venue":"cs.CV","work_id":"510354f3-222a-48da-bda9-96a2df30bb68","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:12dfb223a3c99660e1442dfde129cc0bd20699c01cb075c18129c166dcabff57","observation_id":"bfee7568-6d3d-4d97-9298-e78e1bcb245f","resolution":{"observed_at":"2026-07-01T22:56:20.844108Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:46.657095+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:46.657095+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:3b39a3e1411ec96ee95928dacd23d5a34e66a9d2c2022b286f87cfe8ab9cd5df","observation_id":"5cb731e8-540e-43e8-8195-34620b776c69","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:fa518c51b4c72d3b028f1f06a2f49b7448274c30a6e0a213abefcdbf7168860e","observation_id":"fe48c176-45d7-45ea-a12e-b94a27ad6864","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:12460aeb2b0bceab8199a3a04147415376aa4be08ed3d3137fc13e7574c07e08","observation_id":"c73410b3-4236-4c9e-9247-7b90c7102632","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:02c57e46ccedfc62d8ccb70f5cae703d8c4ba90d9ffe43522027ad7e07304d04","observation_id":"8cc4afba-62ab-4525-aa13-4fac916de58b","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:e9f13e06d7174968b9a30a8fe37eb38b7c6a574e17de52be1cf84924cab07c68","observation_id":"55b66b22-502c-428d-b141-2651c19ac61a","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:50:02.159411Z","title":"is consistent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:d2421d568294e2692804cf97eac5458b0000ddf4a0af5564a1eb6842bf5deb3e","observation_id":"9e773264-7cad-4340-9a60-973ba2f5c5cb","resolution":{"observed_at":"2026-06-28T14:50:02.159411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":36,"verified_exact":17,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2606.02522."}