{"as_of":"2026-08-09T22:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6a569fa642e67552989c34caf5107d71863c9c91af38283a23847e250feb294d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:45:50.222550Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:48:55.978205Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.12380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-03T20:48:55.978205Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"8a500e11-ccec-4975-b702-f3338bd9e9c5","year":2025},"citing_paper":{"arxiv_id":"2502.02871","last_updated":"2026-04-20T02:18:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T04:05:27Z","title":"Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning","version":2},"reference_index":258,"source":"arxiv_source","source_observed_at":"2026-05-23T04:30:38.804702Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2502.02871"},"observation_digest":"sha256:7dbe75f5587657e58fab44fccc366645fc8551bb4d436600fd9d06aebc396658","observation_id":"d530259e-2af9-40f2-9f55-ce0aeab71c2a","resolution":{"observed_at":"2026-05-23T04:32:32.734737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.12380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-03T20:48:55.978205Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"8a500e11-ccec-4975-b702-f3338bd9e9c5","year":2025},"citing_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T02:25:04.405036Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2502.13923"},"observation_digest":"sha256:9cfd39dde706390ce21d8fcdbb4c1edf266944ec39a0718216f6b3a5c5ab6a4e","observation_id":"90f534eb-cd28-45cb-90de-ceb85eb367c2","resolution":{"observed_at":"2026-05-23T02:25:19.026586Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.12380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-03T20:48:55.978205Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"8a500e11-ccec-4975-b702-f3338bd9e9c5","year":2025},"citing_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T09:43:00.208065Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2503.21776"},"observation_digest":"sha256:dbb7badafb01904e68e5321ffbee48cd31a8851dccc61159dfed10e1d986aad9","observation_id":"692271aa-60f7-4281-a106-cb3b4aaa99a2","resolution":{"observed_at":"2026-05-12T09:43:00.329876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.12380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-03T20:48:55.978205Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"8a500e11-ccec-4975-b702-f3338bd9e9c5","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":176,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:a6c42b584088ca22abe4c44557785c13048e469b2d3019725515126582626476","observation_id":"1d76e4df-1500-4305-bb78-4964e978c0f8","resolution":{"observed_at":"2026-05-11T05:26:05.899274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.12380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-03T20:48:55.978205Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"8a500e11-ccec-4975-b702-f3338bd9e9c5","year":2025},"citing_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-06T04:32:21.352745Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T05:40:55.944288Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2505.21374"},"observation_digest":"sha256:25f48a0285ef257a433c314d96c52ba67c3d23c9ebee0d56ea83975f9de7bd33","observation_id":"5b120fd5-be85-403a-8b63-6e8a245f676d","resolution":{"observed_at":"2026-05-17T05:40:56.089555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T12:45:50.222550Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:50.222550Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:66b23e041f8a31a513489616a470282b3285eddd16c9236edc69b6963ddb3479","observation_id":"59f62b73-7618-40f5-89b7-ea8e69ca370f","resolution":{"observed_at":"2026-08-07T12:45:50.222550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T12:22:11.825894Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-09T21:07:26.605537Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:11.825894Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2505.24718"},"observation_digest":"sha256:97f6b4c0ad120331a47e2a604fea0b9ff42250ef8b0580c73ec430097ef18471","observation_id":"b10404a4-85df-4172-9be5-4bc22869d712","resolution":{"observed_at":"2026-08-07T12:22:11.825894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T11:52:05.618855Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding.arXiv preprint arXiv:2501.12380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01300","last_updated":"2025-06-02T04:23:21Z","snapshot_observed_at":"2026-08-09T17:38:02.993405Z","submitted_at":"2025-06-02T04:23:21Z","title":"ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:05.618855Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.01300"},"observation_digest":"sha256:1757fbc7fe48996f3a9498a58a40ea28148af866c7ae321b0c0e4fe48b834550","observation_id":"3ec4580c-f95e-4276-833e-804df956f725","resolution":{"observed_at":"2026-08-07T11:52:05.618855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T11:40:57.775507Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.775507Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:d4fe8fa2a69fe89024bfc77abaa723f32ac57f0dc51b299aa3087a65293115d4","observation_id":"568a8494-8f7a-48f4-b86c-3834ef178039","resolution":{"observed_at":"2026-08-07T11:40:57.775507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T11:35:48.023662Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding.arXiv preprint arXiv:2501.12380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:48.023662Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:bc3367ac494601ee279f7d964e0fa81c9feabcd8c772b84a5df598f9ca8e9083","observation_id":"81a57794-523a-4f6d-aa33-8a70e34563d8","resolution":{"observed_at":"2026-08-07T11:35:48.023662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T10:29:10.829585Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding.arXiv preprint arXiv:2501.12380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05287","last_updated":"2025-06-05T17:44:12Z","snapshot_observed_at":"2026-08-09T15:14:29.691315Z","submitted_at":"2025-06-05T17:44:12Z","title":"EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:10.829585Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.05287"},"observation_digest":"sha256:b375a0e5e963d6a22e27996d3e63919ee830d7321c50f776bc166ef116dfc95b","observation_id":"f5963aa4-80c5-4e97-9d84-92b464ed8acd","resolution":{"observed_at":"2026-08-07T10:29:10.829585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T05:19:20.434974Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08343","last_updated":"2025-06-18T14:43:36Z","snapshot_observed_at":"2026-08-07T08:58:45.702180Z","submitted_at":"2025-06-10T01:54:04Z","title":"Wait, We Don't Need to \"Wait\"! Removing Thinking Tokens Improves Reasoning Efficiency","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T05:19:20.434974Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.08343"},"observation_digest":"sha256:0b078a37e4fad2e0d809f920f62b9110166df521c4870d4446eb3dbd432caee0","observation_id":"18779145-4b15-48c6-9e9a-80262decbb4c","resolution":{"observed_at":"2026-08-07T05:19:20.434974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T04:22:56.109578Z","title":"Mmvu: Measuring expert- level multi-discipline video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-08T13:30:57.844783Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.109578Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:51c22c2f42dbbd4f71996923cbc89d0e3c235f6d96148db3699144eb05d296e0","observation_id":"737f9633-f141-463b-b19e-f15e39a533b1","resolution":{"observed_at":"2026-08-07T04:22:56.109578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-06T23:48:37.656075Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding.arXiv preprint arXiv:2501.12380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.656075Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:eac172d325e3797658220881ea144c5f56b51cf2e811de3d62f62e2a0f5945d1","observation_id":"cfb50d06-db4a-4122-b1a9-f8f7b1410dc9","resolution":{"observed_at":"2026-08-06T23:48:37.656075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-06T22:36:15.170351Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.170351Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:80c99d00c164b1c1e8ec9fa119f5e5aa697cfe2cd1e6a4e44141564d9943c59b","observation_id":"41b50db4-1a75-499d-8957-a94752de91bb","resolution":{"observed_at":"2026-08-06T22:36:15.170351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-06T17:55:45.489265Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09693","last_updated":"2025-07-13T16:09:58Z","snapshot_observed_at":"2026-08-09T02:39:23.430677Z","submitted_at":"2025-07-13T16:09:58Z","title":"ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:55:45.489265Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2507.09693"},"observation_digest":"sha256:4c9df927547634ba879b7b4a42ec73102c87a908d66cbb226a308b594d783a3d","observation_id":"70847a66-37ea-4fe9-bdbd-0dbeee5c7c97","resolution":{"observed_at":"2026-08-06T17:55:45.489265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-06T05:15:43.506493Z","title":"Mmvu: Measuring expert- level multi-discipline video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02094","last_updated":"2025-08-04T06:05:36Z","snapshot_observed_at":"2026-08-08T15:06:07.047501Z","submitted_at":"2025-08-04T06:05:36Z","title":"\"Harmless to You, Hurtful to Me!\": Investigating the Detection of Toxic Languages Grounded in the Perspective of Youth","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T05:15:43.506493Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2508.02094"},"observation_digest":"sha256:53ca5ac429794710ed0fc41c000de0baabafeed437a67c586ee97652fb895a50","observation_id":"391f0e94-7cc2-4f5a-802d-bf20799a183f","resolution":{"observed_at":"2026-08-06T05:15:43.506493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-06T05:12:38.494969Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.494969Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:c14396270efcf5f3bfa9a12580ff70bedf7b84582c229d8707444fd66a3b2cb4","observation_id":"bf9ba7c1-8894-43ca-9c45-32e62ae6b963","resolution":{"observed_at":"2026-08-06T05:12:38.494969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-05T19:03:05.907059Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-09T03:24:13.317916Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:05.907059Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:5253560b3eddc8fa455eebe70ab1a2e6ce5808e6e0883c474100b48a8a072a4b","observation_id":"7b5b0a94-6e41-4ee8-b6ee-f5e1eea5ba8b","resolution":{"observed_at":"2026-08-05T19:03:05.907059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-04T09:12:10.158373Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17045","last_updated":"2026-06-01T07:19:41Z","snapshot_observed_at":"2026-08-04T09:12:02.562884Z","submitted_at":"2025-10-19T23:17:13Z","title":"Video Reasoning without Training","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T09:12:10.158373Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2510.17045"},"observation_digest":"sha256:3c7f57198da0a2551f50e8cb2dc0eb04207822ed7934f9de665e003f035b5cc0","observation_id":"348ce4e7-9091-4aea-b1fb-7ee6108a8402","resolution":{"observed_at":"2026-08-04T09:12:10.158373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.12380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-03T20:48:55.978205Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"8a500e11-ccec-4975-b702-f3338bd9e9c5","year":2025},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:23525bd2a15055a7dd924f51ff6b9423ddebebdc9b09fc2df6ece4638b34eb66","observation_id":"36ffb9e0-b6ca-4cde-814c-736e7b3be412","resolution":{"observed_at":"2026-05-10T16:09:05.419513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.12380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-03T20:48:55.978205Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"8a500e11-ccec-4975-b702-f3338bd9e9c5","year":2025},"citing_paper":{"arxiv_id":"2604.16893","last_updated":"2026-04-18T07:56:32Z","snapshot_observed_at":"2026-07-06T23:04:05.813982Z","submitted_at":"2026-04-18T07:56:32Z","title":"EasyVideoR1: Easier RL for Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T07:41:27.231098Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2604.16893"},"observation_digest":"sha256:e7d49e4a9a48f1c1ed031d38bc22cab1ccff231eddf0ee9f7bcd81c65ad66900","observation_id":"5f8d3008-4f27-4050-8dfb-ec67cbb3e8e5","resolution":{"observed_at":"2026-05-10T07:42:06.731674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.12380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-03T20:48:55.978205Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"8a500e11-ccec-4975-b702-f3338bd9e9c5","year":2025},"citing_paper":{"arxiv_id":"2604.20473","last_updated":"2026-04-22T12:02:24Z","snapshot_observed_at":"2026-07-30T08:45:43.657043Z","submitted_at":"2026-04-22T12:02:24Z","title":"Video-ToC: Video Tree-of-Cue Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T01:20:29.374012Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2604.20473"},"observation_digest":"sha256:62180df7f061c3cd2b64fa20b9aaecc05d9d4a518bd8fb2fcfffb9ad59c87522","observation_id":"786b7083-5a8f-484c-b750-94f3e1903855","resolution":{"observed_at":"2026-05-11T13:36:09.709971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.12380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-03T20:48:55.978205Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"8a500e11-ccec-4975-b702-f3338bd9e9c5","year":2025},"citing_paper":{"arxiv_id":"2604.27083","last_updated":"2026-04-29T18:24:11Z","snapshot_observed_at":"2026-07-06T23:12:38.453388Z","submitted_at":"2026-04-29T18:24:11Z","title":"Co-Evolving Policy Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T08:23:41.819485Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2604.27083"},"observation_digest":"sha256:055f96a8f7d33c5d743724900c418c9c5c3094cba326122d9cc054cbb14c0214","observation_id":"d640528f-36f7-4894-b4f4-c61acfd8f2a0","resolution":{"observed_at":"2026-05-12T10:01:28.189816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.12380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-03T20:48:55.978205Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"8a500e11-ccec-4975-b702-f3338bd9e9c5","year":2025},"citing_paper":{"arxiv_id":"2605.19559","last_updated":"2026-05-19T09:02:20Z","snapshot_observed_at":"2026-07-06T23:30:16.094579Z","submitted_at":"2026-05-19T09:02:20Z","title":"EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T05:53:05.450946Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2605.19559"},"observation_digest":"sha256:1b195c65cfb8cc622bf5e376183ddf8c4ce9d9aa53b2cec5c6adf833ab585294","observation_id":"d319652e-f40d-41c5-a331-7082a0a4f2d7","resolution":{"observed_at":"2026-05-20T05:53:22.295479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.12380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-03T20:48:55.978205Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"8a500e11-ccec-4975-b702-f3338bd9e9c5","year":2025},"citing_paper":{"arxiv_id":"2606.05736","last_updated":"2026-06-04T05:55:15Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:55:15Z","title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T01:52:44.785582Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2606.05736"},"observation_digest":"sha256:acfeeebc4378fde299d1cc4653142035c627efe4a56c14ecc486a58bcb05d25e","observation_id":"21dbcd8c-ac52-4bdf-aa4a-6a54472cf9e9","resolution":{"observed_at":"2026-07-02T12:46:56.824488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.12380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-03T20:48:55.978205Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"8a500e11-ccec-4975-b702-f3338bd9e9c5","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-09T07:41:33.424534Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":151,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:6231fe705fae5ff86f154bdaced7c53aa5d3b958c66a2c34229db6a8f8d6983b","observation_id":"7ef3b79a-710a-4320-8528-13a890075f05","resolution":{"observed_at":"2026-07-03T20:48:55.979586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-12T11:31:14.532101Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02551","last_updated":"2026-06-26T16:05:57Z","snapshot_observed_at":"2026-08-06T08:59:01.715141Z","submitted_at":"2026-06-26T16:05:57Z","title":"DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T11:31:14.532101Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2607.02551"},"observation_digest":"sha256:a7fc2d021b3456be7be6f961330142d38e4fc611ddd603abe627fc380b2fccb8","observation_id":"7f85be1a-23a9-4c37-ab92-71f14c27d7e5","resolution":{"observed_at":"2026-07-12T11:31:14.532101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-07-12T09:09:15.248815Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding.arXiv preprint arXiv:2501.12380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02607","last_updated":"2026-07-01T13:51:02Z","snapshot_observed_at":"2026-07-12T09:09:14.587474Z","submitted_at":"2026-07-01T13:51:02Z","title":"Latent Visual Cache for Video Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T09:09:15.248815Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2607.02607"},"observation_digest":"sha256:2581ccc7182a1c19d47ac2933fac00d7d63e1d0d1db7e249602bdcbb791eda87","observation_id":"d4c2cb37-99d7-49b1-8cd2-1efa60cbe954","resolution":{"observed_at":"2026-07-12T09:09:15.248815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12380/citation-record","integrity":"/paper/2501.12380/integrity","json":"/paper/2501.12380/citation-record.json","paper":"/paper/2501.12380"},"outbound":[],"paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2501.12380."}