{"as_of":"2026-08-11T19:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c30426a47c4738b1ff29473a2409dd70ea8c4d12187ddb64fc56d5bf3c99672","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:06:46.257397Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:41:35.841271Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"cited_work":{"arxiv_id":"2501.10674","doi":"10.48550/arxiv.2501.10674","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Temporalvqa: A benchmark for temporal video question answering","venue":"ArXiv.org","work_id":"7ff2976d-5e47-456c-a9fb-8ce521dd42cb","year":2025},"citing_paper":{"arxiv_id":"2506.07180","last_updated":"2026-04-30T12:27:19Z","snapshot_observed_at":"2026-08-11T02:33:01.746143Z","submitted_at":"2025-06-08T15:00:21Z","title":"Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T11:03:59.222849Z"},"links":{"cited_paper":"/paper/2501.10674","citing_paper":"/paper/2506.07180"},"observation_digest":"sha256:b75ac9cdc541693fb0522e145f56e1cfb243a614c955e53b731cca4fbee24532","observation_id":"d3718325-5de1-4fc0-92c6-5c98b9263dea","resolution":{"observed_at":"2026-05-19T11:07:15.464858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10674","snapshot_observed_at":"2026-08-06T18:41:35.841271Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07550","last_updated":"2025-07-10T08:47:41Z","snapshot_observed_at":"2026-08-09T23:41:47.193200Z","submitted_at":"2025-07-10T08:47:41Z","title":"Pluri-perspectivism in Human-robot Co-creativity with Older Adults","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:41:35.841271Z"},"links":{"cited_paper":"/paper/2501.10674","citing_paper":"/paper/2507.07550"},"observation_digest":"sha256:8f2b35c086c9207dc97a13e972d602e003562dad1f3476a422c5bf134611350d","observation_id":"6039192c-0f0b-445f-9fff-c3c2200c1846","resolution":{"observed_at":"2026-08-06T18:41:35.841271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"cited_work":{"arxiv_id":"2501.10674","doi":"10.48550/arxiv.2501.10674","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Temporalvqa: A benchmark for temporal video question answering","venue":"ArXiv.org","work_id":"7ff2976d-5e47-456c-a9fb-8ce521dd42cb","year":2025},"citing_paper":{"arxiv_id":"2604.22829","last_updated":"2026-04-19T15:45:13Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-19T15:45:13Z","title":"Lost in the Vibrations: Vision Language Models Fail the Dynamic Gauges Test","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T06:21:17.509796Z"},"links":{"cited_paper":"/paper/2501.10674","citing_paper":"/paper/2604.22829"},"observation_digest":"sha256:167f8fb03164a94830f25ed80b6cbbce2feb9eb31a95dc4a42ade3d7d78950f1","observation_id":"11c15949-1f24-437e-bb22-6a43f81c0ec0","resolution":{"observed_at":"2026-05-10T06:21:26.657532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"cited_work":{"arxiv_id":"2501.10674","doi":"10.48550/arxiv.2501.10674","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Temporalvqa: A benchmark for temporal video question answering","venue":"ArXiv.org","work_id":"7ff2976d-5e47-456c-a9fb-8ce521dd42cb","year":2025},"citing_paper":{"arxiv_id":"2605.01333","last_updated":"2026-05-08T01:08:56Z","snapshot_observed_at":"2026-08-04T10:46:08.275509Z","submitted_at":"2026-05-02T09:08:33Z","title":"OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-11T01:03:50.055081Z"},"links":{"cited_paper":"/paper/2501.10674","citing_paper":"/paper/2605.01333"},"observation_digest":"sha256:2606a02644456e6ffb2f8aac28375c128bf4391d16b4a4cd084ec192d0a2ece9","observation_id":"d7480da3-8d0c-4b46-9d8b-5d4996d25f45","resolution":{"observed_at":"2026-05-11T01:05:50.282084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"cited_work":{"arxiv_id":"2501.10674","doi":"10.48550/arxiv.2501.10674","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Temporalvqa: A benchmark for temporal video question answering","venue":"ArXiv.org","work_id":"7ff2976d-5e47-456c-a9fb-8ce521dd42cb","year":2025},"citing_paper":{"arxiv_id":"2606.05702","last_updated":"2026-06-04T04:49:09Z","snapshot_observed_at":"2026-08-02T13:36:32.882557Z","submitted_at":"2026-06-04T04:49:09Z","title":"Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T01:30:36.491137Z"},"links":{"cited_paper":"/paper/2501.10674","citing_paper":"/paper/2606.05702"},"observation_digest":"sha256:4fae12f99f9ca259461ef1c8369226b28d9f6538900bfd153d1b994d57f0c211","observation_id":"b9359344-7ff2-41b1-a7bf-0e96f2dc3622","resolution":{"observed_at":"2026-07-02T13:06:59.623227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"cited_work":{"arxiv_id":"2501.10674","doi":"10.48550/arxiv.2501.10674","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Temporalvqa: A benchmark for temporal video question answering","venue":"ArXiv.org","work_id":"7ff2976d-5e47-456c-a9fb-8ce521dd42cb","year":2025},"citing_paper":{"arxiv_id":"2606.27828","last_updated":"2026-06-26T08:12:04Z","snapshot_observed_at":"2026-08-06T13:58:57.000121Z","submitted_at":"2026-06-26T08:12:04Z","title":"Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-29T04:53:25.259840Z"},"links":{"cited_paper":"/paper/2501.10674","citing_paper":"/paper/2606.27828"},"observation_digest":"sha256:dacfc19386253150bd37b5487ba5ea0b781c6e564ab5c56a1214c3c3b88b11d4","observation_id":"b98cd653-213b-47b3-b2ea-f2fa067e1798","resolution":{"observed_at":"2026-06-29T19:13:52.947250Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.10674/citation-record","integrity":"/paper/2501.10674/integrity","json":"/paper/2501.10674/citation-record.json","paper":"/paper/2501.10674"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:06:46.133639Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.133639Z"},"links":{"citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:1295023f3c45a83ec778b9bfe176529b22673f42f4bb087925e6830a832dae99","observation_id":"7dd80212-3df7-48f8-86d5-d033f731aa3d","resolution":{"observed_at":"2026-08-10T19:06:46.133639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:06:46.138060Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.138060Z"},"links":{"citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:63cff0743881f6be944b6aec67f555e08567d40559c88c61b3f343da656a7dc7","observation_id":"ba5d8bb1-90b7-4a7c-a59b-bbf1ec772c79","resolution":{"observed_at":"2026-08-10T19:06:46.138060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T19:06:46.143202Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.143202Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:61273aeb811edfa45f80a3ea2f96d18d3be1ed6d2fad79274709bbfcd399467b","observation_id":"2298c8bd-d5e7-41cc-afe2-5efbd23540fa","resolution":{"observed_at":"2026-08-10T19:06:46.143202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-10T19:06:46.147800Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.147800Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:084f3ca5af49369beb6d220ff6d3d2ffb85f1058428276c5fcaa899e95b0a616","observation_id":"43e812f6-e863-40dd-8404-0d52591f11a0","resolution":{"observed_at":"2026-08-10T19:06:46.147800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-10T19:06:46.152258Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.152258Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:42532f707fb4a8699239a4b06bf22f5f7df28ede799aafb9821b6ef78f7ba1db","observation_id":"46023000-6df2-4999-a19b-08e5156b50fc","resolution":{"observed_at":"2026-08-10T19:06:46.152258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:06:46.157210Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.157210Z"},"links":{"citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:c9bef8a4a7051b4a5f4240dcf6663d6b6f38e2cb48983fcedf5ad484646819ff","observation_id":"15d73432-2ef0-47f1-99e4-6a83f7777c63","resolution":{"observed_at":"2026-08-10T19:06:46.157210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-10T12:02:14.593194Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-10T19:06:46.161997Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.161997Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:994d9713fba6d78fe41d1ba9147aec3f77d9010904df88b69d27e6a03b39a834","observation_id":"f39631f1-dd69-4503-b0e7-984f504b983c","resolution":{"observed_at":"2026-08-10T19:06:46.161997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T19:06:46.166569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.166569Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:278347b1e4c003aa80c018a4c6a3e4febb21678c477a5de7b2f3572e3473cab3","observation_id":"78497f42-d7e3-4fe4-a8aa-34f3928f4c1b","resolution":{"observed_at":"2026-08-10T19:06:46.166569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-09T15:29:45.493907Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-10T19:06:46.171743Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.171743Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:87dcdf08d678138717832e748c5a1c800ea00513963f027e2adb876650aafe47","observation_id":"a2c53ff8-b438-4eed-9498-3c184a07db16","resolution":{"observed_at":"2026-08-10T19:06:46.171743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T19:06:46.176421Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.176421Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:f4e4c4ad301570d2f0de0cc566266650247c19fd34cd8371eef0629f87caefa8","observation_id":"f214ae92-a8f1-4149-8d5c-b2e571e5122e","resolution":{"observed_at":"2026-08-10T19:06:46.176421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-10T19:06:46.181220Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.181220Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:5e6c86e7cf55cb0ec967fd759049695678ec4c0ed81a9c63d952634fa233bf47","observation_id":"c60dc037-365f-481d-8ed1-333763189b6a","resolution":{"observed_at":"2026-08-10T19:06:46.181220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:06:46.190545Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.190545Z"},"links":{"citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:b6f43903f562375266c04c7f3f992d8cb8bc3433644153bae36e72fc3f74239d","observation_id":"11da3a5a-f5f3-4f84-a7e9-c6d5d000fa73","resolution":{"observed_at":"2026-08-10T19:06:46.190545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15769","last_updated":"2024-08-28T13:05:55Z","snapshot_observed_at":"2026-08-10T11:11:45.599347Z","submitted_at":"2024-08-28T13:05:55Z","title":"A Survey on Evaluation of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15769","snapshot_observed_at":"2026-08-10T19:06:46.194763Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.194763Z"},"links":{"cited_paper":"/paper/2408.15769","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:0cc89746ec5019bdb6a6b5848e556f9b2f27d6fc3efc2da2cfedcb8cc6af12e7","observation_id":"7e1cb9d6-6066-465c-97fb-6a20d02cbeac","resolution":{"observed_at":"2026-08-10T19:06:46.194763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-10T19:06:46.199672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.199672Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:d1e36968d02d55d936a895dd1a93c25f9f75e36c33667fc3c88aa97bc53e45ba","observation_id":"eba48bad-0095-41da-9435-6070b2508854","resolution":{"observed_at":"2026-08-10T19:06:46.199672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-10T19:06:46.203899Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.203899Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:e592abb3193662406423d71e84f9df9fe5869e5829a551413c198adb5ff2731d","observation_id":"84c0c77f-f77a-4e52-a589-1c80fa26f14d","resolution":{"observed_at":"2026-08-10T19:06:46.203899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-07-06T19:01:27.827878Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-10T19:06:46.207735Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.207735Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:694680a03b66bebad05a1d980992e18935e693883ee2fd8d6a10023a9f8b15bd","observation_id":"19f2362d-041d-4999-a00e-b8d154881caa","resolution":{"observed_at":"2026-08-10T19:06:46.207735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:06:46.211547Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.211547Z"},"links":{"citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:791b432e68607cb06834e93320e97723b2c2b3539586bce9d4d0d674673a6e04","observation_id":"8bc3818a-b01c-4abd-b3bf-96e07c1b8ff1","resolution":{"observed_at":"2026-08-10T19:06:46.211547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:06:46.215735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.215735Z"},"links":{"citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:62e9c5b0b5944f191b18a355763af0b25249ce4d7f44ac92070422cd32c96802","observation_id":"a90468de-f4ed-4474-a62d-bb595c051299","resolution":{"observed_at":"2026-08-10T19:06:46.215735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15272","last_updated":"2024-10-08T07:18:21Z","snapshot_observed_at":"2026-07-06T18:49:46.992782Z","submitted_at":"2024-07-21T21:22:58Z","title":"MIBench: Evaluating Multimodal Large Language Models over Multiple Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15272","snapshot_observed_at":"2026-08-10T19:06:46.219688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.219688Z"},"links":{"cited_paper":"/paper/2407.15272","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:7483d7b34d002fabf2ba56a38bec62a8f2edb5bc863b49bf9d77fec0cf898c67","observation_id":"ef8efdad-a3f1-460d-bb10-a93245101439","resolution":{"observed_at":"2026-08-10T19:06:46.219688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-07-06T19:42:25.742756Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-08-10T19:06:46.226297Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.226297Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:538e11ee490bcf9900cc1be5e4298df9f4ca678ad1bc8a5bc02c1ac5749a8938","observation_id":"b73cabd9-3ec1-4fdf-ac0f-828b168ce800","resolution":{"observed_at":"2026-08-10T19:06:46.226297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09861","last_updated":"2024-01-18T10:18:48Z","snapshot_observed_at":"2026-08-11T15:53:53.119110Z","submitted_at":"2024-01-18T10:18:48Z","title":"Temporal Insight Enhancement: Mitigating Temporal Hallucination in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2401.09861","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09861","snapshot_observed_at":"2026-08-10T19:06:46.499742Z","title":"Temporal Insight Enhancement: Mitigating Temporal Hallucination in Multimodal Large Language Models","venue":"cs.CV","work_id":"61bd1d11-43a8-42e6-a827-22e85666b17d","year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.230495Z"},"links":{"cited_paper":"/paper/2401.09861","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:4d9effd602fc3c9fb830a32324df0c4729c9d76362b4d1f1d6e297b46f88b9ea","observation_id":"06148cbe-1720-43c6-a6d6-afef2290c80f","resolution":{"observed_at":"2026-08-10T19:06:46.507260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T19:06:46.234287Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.234287Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:01d566c02a6dd65f332be55b10f2e91f6f33f9eb631770df8c243053cb37d1ae","observation_id":"672ff67a-4355-480b-b342-e31fa8cf8e42","resolution":{"observed_at":"2026-08-10T19:06:46.234287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:06:46.238897Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.238897Z"},"links":{"citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:b11ce5290efc239ec8122f59540a881c246dd8f745b9d785215a33ea50956057","observation_id":"71c16368-7823-4976-8384-197af39a3626","resolution":{"observed_at":"2026-08-10T19:06:46.238897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:06:46.243385Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.243385Z"},"links":{"citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:d8f8c27af9075e8fddf4de70a882f231bc9566756fd275c4dfe508ee70598f82","observation_id":"7c0e8e8b-75df-41a1-965b-74ead9564c02","resolution":{"observed_at":"2026-08-10T19:06:46.243385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-10T19:06:46.247965Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.247965Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:9a5a021ff78cfd1e52126769e923a4f1f1c91a9814dd63236f31142c42c1c65f","observation_id":"e2760568-7eca-4b4f-bd7a-96a93492d544","resolution":{"observed_at":"2026-08-10T19:06:46.247965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-10T19:06:46.252570Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.252570Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:c4bde4e20d327b2996d3272e344b60cbabf1ef41ea01978039226eeaa99f2f2c","observation_id":"d5d02360-6293-4877-a109-8163854aad09","resolution":{"observed_at":"2026-08-10T19:06:46.252570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-10T19:06:46.257397Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.257397Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:932e7f83c7e16e85b693e26e4493d105b75eb00a8029dbf09b3c1cc89e1e99da","observation_id":"f3d9fc16-207f-48c3-8879-667deed439f1","resolution":{"observed_at":"2026-08-10T19:06:46.257397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T18:59:40.573792Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 6 inbound Pith citation observations for arXiv:2501.10674."}