{"as_of":"2026-08-10T04:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16b3327832e4c97169b381db41a24fd1beb2502a2071d906a956b3272c231ca6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:26:20.268946Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:39:03.234328Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":216,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:3f8d7c06a3e2b1d4b959cef83ba11daf2fb6f7ad5a5e8e9a0d5aaba2e8b2dbfe","observation_id":"d5b6241f-c506-4dde-888a-5ebddaa3d455","resolution":{"observed_at":"2026-05-10T23:20:33.170271Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:6f59e0686fa195f659eed7021fd31b25c8e3106448462e0ec5f72b664a9b612a","observation_id":"8728683d-c1dd-4cae-8913-cb685f76a829","resolution":{"observed_at":"2026-05-14T00:32:41.302744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-08T23:26:20.268946Z","title":"TemporalBench: Towards fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-09T20:29:20.505084Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.268946Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:4c72912e884df26d9c37ad18fbfcb8a286d63bdb58f7f3b53df154baddc40dfa","observation_id":"333f9254-8eb1-45d4-bb86-ce42e95dab06","resolution":{"observed_at":"2026-08-08T23:26:20.268946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:ff8bb6af8e56308b75741edf1505f45008de04d629788f5f6d1c964dbd86e733","observation_id":"4d7bc3d6-cca5-45e2-9860-084fb8cfc5d9","resolution":{"observed_at":"2026-05-11T05:26:05.681583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T14:24:07.209929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19125","last_updated":"2025-05-25T12:44:12Z","snapshot_observed_at":"2026-08-09T21:58:21.837993Z","submitted_at":"2025-05-25T12:44:12Z","title":"RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:24:07.209929Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.19125"},"observation_digest":"sha256:c01b5f93e960317921160c08b3a6d54cda618bb505455957289f0d7a472db65a","observation_id":"a6bc6d7e-b309-427f-aa28-fe817f779cc3","resolution":{"observed_at":"2026-08-07T14:24:07.209929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T14:02:59.572640Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.572640Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:e17678711373a003eda844dc2262b47e06a27781acf8d96a61155b7ccaed6e12","observation_id":"0068b704-aecd-46cc-a8c5-175b3944aa05","resolution":{"observed_at":"2026-08-07T14:02:59.572640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2505.20715","last_updated":"2026-04-18T02:55:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-27T04:50:07Z","title":"MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T13:13:40.485342Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.20715"},"observation_digest":"sha256:fde4588ed7462424664120be69311142051a5843d92ec0589a18e1a5e1b319a6","observation_id":"358b7850-828e-4e44-905f-3a296da34640","resolution":{"observed_at":"2026-05-19T13:17:18.545824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T13:10:40.431117Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-09T21:52:56.063992Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.431117Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:bf5981c95c11e9907f7d6942d50f5cb9d7c3c3677a00cf64402ce5768d682408","observation_id":"8c97c53f-09c4-49cc-a2be-eebe6f273efc","resolution":{"observed_at":"2026-08-07T13:10:40.431117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T11:58:08.121411Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-09T03:57:02.684571Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.121411Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:67d41b073ac6c750cfebd96883bb7cdf3a3de7b12ca38f0b8c2aaa2e080d9511","observation_id":"305f6973-6c73-49c7-a805-d19b14918540","resolution":{"observed_at":"2026-08-07T11:58:08.121411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2506.07180","last_updated":"2026-04-30T12:27:19Z","snapshot_observed_at":"2026-07-06T21:38:39.914904Z","submitted_at":"2025-06-08T15:00:21Z","title":"Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T11:03:59.222849Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2506.07180"},"observation_digest":"sha256:6f5ded2ebdd50c97267b1e797636239a6a0bf41112721cadddba75fecee5e953","observation_id":"0a22fff6-cf20-4c15-89bc-b46ffd20a18e","resolution":{"observed_at":"2026-05-19T11:07:15.380828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:894205ba870e6c08435f915de2245d1fea378354b0ea7280afef23bdb2983073","observation_id":"b3e7157c-7b90-4817-989b-f5200612b389","resolution":{"observed_at":"2026-05-11T00:33:50.948202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-06T18:03:13.972207Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09313","last_updated":"2025-07-15T11:48:07Z","snapshot_observed_at":"2026-08-09T21:58:49.061689Z","submitted_at":"2025-07-12T15:11:50Z","title":"ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:03:13.972207Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2507.09313"},"observation_digest":"sha256:af87c9297a45fd7d8a5856f578c64a9e2e59306782405b63c9357c6434edf1c6","observation_id":"e849daa4-bf69-475c-8e19-353675a6c28c","resolution":{"observed_at":"2026-08-06T18:03:13.972207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-06T17:58:26.999928Z","title":"arXiv preprint arXiv:2410.10818","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:26.999928Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:326f4d1f57c5e79b02353adc12993760a965f506aca6b97cad73c03457381ce1","observation_id":"bbe643d1-35b2-4d2e-9e1a-e0b64b67fc02","resolution":{"observed_at":"2026-08-06T17:58:26.999928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-06T15:48:31.035101Z","title":"Temporalbench: Towards fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15028","last_updated":"2025-07-20T16:30:33Z","snapshot_observed_at":"2026-08-09T21:07:25.586579Z","submitted_at":"2025-07-20T16:30:33Z","title":"Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:31.035101Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2507.15028"},"observation_digest":"sha256:baee25117ddb1a02f1f2d67c73b25f7a6c11af98f1af619af970ed2a2d62c03e","observation_id":"f91d00e8-c6f6-491f-b1a5-7bdc970597a8","resolution":{"observed_at":"2026-08-06T15:48:31.035101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-06T15:14:17.287285Z","title":"Cao, P.; Men, T.; Liu, W.; Zhang, J.; Li, X.; Lin, X.; Sui, D.; Cao, Y .; Liu, K.; and Zhao, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16878","last_updated":"2025-07-22T12:29:13Z","snapshot_observed_at":"2026-08-09T16:03:32.935657Z","submitted_at":"2025-07-22T12:29:13Z","title":"CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:17.287285Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2507.16878"},"observation_digest":"sha256:d596b0b977a6f7f50bd1751cc1b70b5f4dda049145ff6b2a40ce2b69553bd834","observation_id":"ad492195-bd08-400d-a93c-a65b26054333","resolution":{"observed_at":"2026-08-06T15:14:17.287285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-04T20:20:36.661579Z","title":"Temporalbench: Bench- marking fine-grained temporal understanding for multimodal video models.CoRR, abs/2410.10818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08621","last_updated":"2025-09-10T14:17:53Z","snapshot_observed_at":"2026-08-09T06:09:37.758584Z","submitted_at":"2025-09-10T14:17:53Z","title":"AdsQA: Towards Advertisement Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:20:36.661579Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2509.08621"},"observation_digest":"sha256:84f624a691e3c259cf3ba0f852eaac8997fc6dbc11fef09e58b8b31806d7a6c7","observation_id":"15f9e0ce-387e-4e56-a998-6d9afa19ef88","resolution":{"observed_at":"2026-08-04T20:20:36.661579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-04T13:54:11.277795Z","title":", Tan , R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24563","last_updated":"2026-07-15T12:54:15Z","snapshot_observed_at":"2026-08-08T23:25:33.156446Z","submitted_at":"2025-09-29T10:16:05Z","title":"NeMo: Needle in a Montage for Video-Language Understanding","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:11.277795Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2509.24563"},"observation_digest":"sha256:c15d154ab45899c209998a4772d181b153ece4c6ea9b681e408dc341a96293fb","observation_id":"af06448f-fba1-4f4c-bcbd-94a2990c6610","resolution":{"observed_at":"2026-08-04T13:54:11.277795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:538393f307e51f75220f688a3e83c6375c9e3829c95c89df4c4e8778db166c14","observation_id":"6a8aaab0-b1f6-4fde-bec6-dbbb05df58b9","resolution":{"observed_at":"2026-05-22T12:31:32.156486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2512.02231","last_updated":"2026-04-10T02:23:14Z","snapshot_observed_at":"2026-07-06T22:37:31.360740Z","submitted_at":"2025-12-01T21:57:26Z","title":"See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T02:12:55.170296Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2512.02231"},"observation_digest":"sha256:12ca4ddf4cedabc54c50ab19e71d829397a7bb6dd4ca1cd0b5799df840c7dff2","observation_id":"d12b6c69-c134-451c-910b-20cabb957091","resolution":{"observed_at":"2026-05-17T02:13:52.103038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-03T18:28:15.922879Z","title":"Temporalbench: Benchmarking fine- grained temporal understanding for multimodal video mod- els.arXiv preprint arXiv:2410.10818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05277","last_updated":"2026-06-02T23:07:19Z","snapshot_observed_at":"2026-08-09T21:58:21.283734Z","submitted_at":"2025-12-04T21:57:10Z","title":"From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T18:28:15.922879Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2512.05277"},"observation_digest":"sha256:c95d9d1ba5fadfe4049534598206d4b165e2481fc704ff42bd3493cb89d5f0b5","observation_id":"c84d5d53-66bb-46aa-8f21-429c8c812f36","resolution":{"observed_at":"2026-08-03T18:28:15.922879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2604.10385","last_updated":"2026-07-14T05:51:48Z","snapshot_observed_at":"2026-08-08T09:44:03.441004Z","submitted_at":"2026-04-12T00:01:51Z","title":"GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:10.956726Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2604.10385"},"observation_digest":"sha256:ca1660a6d1b85552c6335aaf4e635365660b96e06f1ca315d08475d69035dd9d","observation_id":"f6290141-24a4-455e-b8f9-c5e6fe3d58e8","resolution":{"observed_at":"2026-05-11T08:26:01.762020Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:747a9a44ebb5ad7ebe54a850a32c105367926898277dcfa955b1c2536b09fcac","observation_id":"6968e55c-af11-43d4-910d-b458eb5ba282","resolution":{"observed_at":"2026-05-11T10:41:04.015830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2604.17375","last_updated":"2026-04-19T10:58:40Z","snapshot_observed_at":"2026-08-02T21:21:44.410489Z","submitted_at":"2026-04-19T10:58:40Z","title":"When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T06:41:59.641410Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2604.17375"},"observation_digest":"sha256:e521292e8b7cb380d85ee8be31013065e7ea2dc74c4c1ac2e083ef34b37b1911","observation_id":"4d934730-f911-4785-8ed2-1e50700138de","resolution":{"observed_at":"2026-05-10T06:46:37.546797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.02834","last_updated":"2026-05-05T09:59:53Z","snapshot_observed_at":"2026-08-07T22:39:16.868213Z","submitted_at":"2026-05-04T17:11:16Z","title":"VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T18:35:48.379198Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.02834"},"observation_digest":"sha256:6e48f3ad10f875d0e928a706195af661e139ffb5c340d04b0f68a912dec5fc3d","observation_id":"ebfb5115-25aa-42a9-8026-15d9f12fafa5","resolution":{"observed_at":"2026-05-09T06:20:41.264335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.09904","last_updated":"2026-05-12T03:09:23Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:47:59Z","title":"TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:13:21.487431Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.09904"},"observation_digest":"sha256:0d748ee14d2288be7eb952b72d23bc55fef9a997c07bb278f6955910c7b81194","observation_id":"83c7d2dd-2323-4155-b984-2468ff757f85","resolution":{"observed_at":"2026-05-12T06:31:26.606021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.09904","last_updated":"2026-05-12T03:09:23Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:47:59Z","title":"TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T06:53:42.726350Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.09904"},"observation_digest":"sha256:e2ec71ff176a3777f74fd02bc097ad624f35b50e5c3574c7eb87a47ae950d33e","observation_id":"7d3ca994-57b8-40e7-917c-a5a53953eb14","resolution":{"observed_at":"2026-05-13T06:57:28.298673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.13803","last_updated":"2026-05-13T17:25:51Z","snapshot_observed_at":"2026-08-02T10:58:24.692632Z","submitted_at":"2026-05-13T17:25:51Z","title":"EvoGround: Self-Evolving Video Agents for Video Temporal Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T19:29:47.356665Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.13803"},"observation_digest":"sha256:de1132c07557495bbf5bed6d210b64452320e650e7ed318035e29f2d0b5f6c94","observation_id":"7559d5ad-eb08-48c6-aa60-ead607b633ac","resolution":{"observed_at":"2026-05-14T19:32:52.564646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.15342","last_updated":"2026-05-14T19:12:20Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T19:12:20Z","title":"Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T16:02:53.887605Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.15342"},"observation_digest":"sha256:556550cdd744de1b2a7e348d5be85a01bffe7eafad6d75b547af06a4b6aa18b3","observation_id":"f1700d39-3c5f-45fb-8f20-19724b4ed41a","resolution":{"observed_at":"2026-05-19T16:03:08.044136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.19846","last_updated":"2026-05-23T07:31:13Z","snapshot_observed_at":"2026-08-02T22:01:11.866294Z","submitted_at":"2026-05-19T13:40:26Z","title":"FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T06:08:12.887394Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.19846"},"observation_digest":"sha256:4e7bb69b3a72bf31c6cc6cf720d4337923cfaa04486d924f9f9309327ad07b0e","observation_id":"aaa66853-e66b-4ffb-8c41-8f8517e6def5","resolution":{"observed_at":"2026-05-20T06:13:05.462877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.19846","last_updated":"2026-05-23T07:31:13Z","snapshot_observed_at":"2026-08-02T22:01:11.866294Z","submitted_at":"2026-05-19T13:40:26Z","title":"FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T07:59:57.488107Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.19846"},"observation_digest":"sha256:be3c32d1d14de23e59a5a2e79c53e7bdd70fa916617ecbd5f3e3daa74cfb169c","observation_id":"a057f476-9899-436f-91f4-48608cfcacc4","resolution":{"observed_at":"2026-05-21T08:04:02.791065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.19846","last_updated":"2026-05-23T07:31:13Z","snapshot_observed_at":"2026-08-02T22:01:11.866294Z","submitted_at":"2026-05-19T13:40:26Z","title":"FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T18:09:49.178090Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.19846"},"observation_digest":"sha256:93b0dc4ffd4cf695280b8d7c505e737dda6f58a8db5cc10dba27bf887882092f","observation_id":"165ec764-c51b-4b13-8e50-4780a9e9f8e9","resolution":{"observed_at":"2026-06-30T18:14:59.999305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.21988","last_updated":"2026-05-21T04:38:02Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T04:38:02Z","title":"Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T07:45:56.473188Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.21988"},"observation_digest":"sha256:884076d654b6001f8d485f6e627ff170094d36f5bd98f316842d66261e0835f3","observation_id":"e6080247-df3f-4d8b-944b-8736e0d26d6a","resolution":{"observed_at":"2026-05-22T07:46:14.880613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.23045","last_updated":"2026-07-15T09:38:22Z","snapshot_observed_at":"2026-08-02T18:10:47.588058Z","submitted_at":"2026-05-21T21:22:42Z","title":"The TIME Machine: On The Power of Motion for Efficient Perception","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T05:40:33.752341Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.23045"},"observation_digest":"sha256:5842422c689526b8bb556f7e70f1399b81884e6d6d12a8547d062fdcd609ea59","observation_id":"9aca9f84-e2ee-4eb9-a074-cb6fe0b21f5e","resolution":{"observed_at":"2026-05-25T05:46:40.010650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-15T11:06:23.089564Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.23045","last_updated":"2026-07-15T09:38:22Z","snapshot_observed_at":"2026-08-02T18:10:47.588058Z","submitted_at":"2026-05-21T21:22:42Z","title":"The TIME Machine: On The Power of Motion for Efficient Perception","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-15T11:06:23.089564Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.23045"},"observation_digest":"sha256:d7f4974713b9a8c6889a7ec26c353cd6a61f5450aadabcaec1c5b3d053eb2971","observation_id":"5fa44cfa-c497-42cd-8aa1-84798f581a31","resolution":{"observed_at":"2026-07-15T11:06:23.089564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-02T13:27:48.232517Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.23045","last_updated":"2026-07-15T09:38:22Z","snapshot_observed_at":"2026-08-02T18:10:47.588058Z","submitted_at":"2026-05-21T21:22:42Z","title":"The TIME Machine: On The Power of Motion for Efficient Perception","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T13:27:48.232517Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.23045"},"observation_digest":"sha256:ba58bdf81b6363d4c929c5a9e98b235390e7096eb1e29e4bb5dceecfaaca9504","observation_id":"de64e0c2-82c2-414a-a70c-739353ac54ac","resolution":{"observed_at":"2026-08-02T13:27:48.232517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.27074","last_updated":"2026-05-26T14:23:25Z","snapshot_observed_at":"2026-08-02T20:44:04.329111Z","submitted_at":"2026-05-26T14:23:25Z","title":"IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T18:24:57.881644Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.27074"},"observation_digest":"sha256:eaa67983cadec96db3239bc74f46a3ec7c1b9ce4b306865461bd9d92a05f2961","observation_id":"b5eb221b-48ea-48d7-8e50-f892bc12077b","resolution":{"observed_at":"2026-06-29T18:33:51.073077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:6993d06cab5cf32f53e44546934e5e3519683383909f5eac31f30e09e7a1e2a4","observation_id":"2a848339-a283-4131-80eb-97e8b045757f","resolution":{"observed_at":"2026-06-29T08:33:15.588037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.30673","last_updated":"2026-07-06T14:01:36Z","snapshot_observed_at":"2026-08-02T07:17:06.461529Z","submitted_at":"2026-05-29T00:06:54Z","title":"TeachObs: A Human-Validated Benchmark for Multimodal Teaching Observation and Model Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:43.712391Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.30673"},"observation_digest":"sha256:190f9091e1dc80cd9888bdc5a117de39617f26c0b0049781fecf5d9e18f08325","observation_id":"f8049609-c217-4dd0-9b2a-88c25912653e","resolution":{"observed_at":"2026-06-28T23:12:46.638618Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2606.03920","last_updated":"2026-06-02T17:12:05Z","snapshot_observed_at":"2026-08-02T12:14:20.077142Z","submitted_at":"2026-06-02T17:12:05Z","title":"Benchmarking Visual State Tracking in Multimodal Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T10:43:06.811228Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2606.03920"},"observation_digest":"sha256:edc12556754318858152c52ccaef22df5d220fa8720577ace46908bd39b16d8d","observation_id":"8ba65bc2-aaee-4236-9f7a-44708d0b76f4","resolution":{"observed_at":"2026-07-02T02:46:27.984113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2606.04880","last_updated":"2026-06-02T17:59:57Z","snapshot_observed_at":"2026-08-06T01:54:13.672479Z","submitted_at":"2026-06-02T17:59:57Z","title":"MAOAM: Unified Object and Material Selection with Vision-Language Models","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-06-28T11:08:59.900161Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2606.04880"},"observation_digest":"sha256:98cde646778cf8a3826eb685190b8f77aa2a9ba450faf03fe49eb4f48605d5d0","observation_id":"a21a8d1f-e3e0-4d18-957e-68a4b6df0fbb","resolution":{"observed_at":"2026-07-02T02:16:26.337706Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2606.18586","last_updated":"2026-06-17T01:26:50Z","snapshot_observed_at":"2026-08-02T17:47:20.748005Z","submitted_at":"2026-06-17T01:26:50Z","title":"APT: Atomic Physical Transitions for Causal Video-Language Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T22:06:00.249819Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2606.18586"},"observation_digest":"sha256:66d40c9b7f7d409d4f019e9d9715812155549cdb3a074f97ebccc84bc3b65543","observation_id":"4544884c-2f76-421b-ae9b-7d6aabf2f597","resolution":{"observed_at":"2026-07-03T23:39:03.236843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2606.28593","last_updated":"2026-06-26T20:38:04Z","snapshot_observed_at":"2026-07-07T00:02:38.226622Z","submitted_at":"2026-06-26T20:38:04Z","title":"Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T00:53:52.724902Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2606.28593"},"observation_digest":"sha256:25497d6766387010457befb1469a99da16f37b1360fae0c2e60c059f6175b436","observation_id":"fe62423f-d61e-4782-aac6-fa2f3577de9c","resolution":{"observed_at":"2026-07-01T16:05:49.779006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.10818/citation-record","integrity":"/paper/2410.10818/integrity","json":"/paper/2410.10818/citation-record.json","paper":"/paper/2410.10818"},"outbound":[],"paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 42 inbound Pith citation observations for arXiv:2410.10818."}