{"as_of":"2026-08-15T03:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f484d1982c2690032bd4ddc2ad566c3cb49d021dc92e7151bb391fafefb5c3ed","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:06:46.226297Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T05:57:41.270398Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-08-10T19:06:46.226297Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-14T06:33:07.678487Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.226297Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:96677b3698cb4e35400ba42dd7c6274dd74c1905cffedbfa7d9f2834dcbe324f","observation_id":"b73cabd9-3ec1-4fdf-ac0f-828b168ce800","resolution":{"observed_at":"2026-08-10T19:06:46.226297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.23266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-07-03T05:57:41.270398Z","title":"Tomato: Assessing visual temporal reasoning capabilities in multimodal foundation models","venue":null,"work_id":"7a50d850-6338-479d-ba02-65efc1b03f01","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:20870a12f31cbb98dbcd71f245730ae1f5053347c09e35e32e06dce70a8da888","observation_id":"32543ac6-b29e-42a2-954b-c83eec350e2b","resolution":{"observed_at":"2026-05-11T05:26:05.439460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-08-07T14:03:03.750220Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.750220Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:31620cb704812283b6a40f86f7ec7f855ddc1055bb2a827f61bfafd8fb98216b","observation_id":"ebbce05a-4324-48b2-8795-b111606f7354","resolution":{"observed_at":"2026-08-07T14:03:03.750220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-08-07T12:45:48.261199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-12T14:38:08.894823Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:48.261199Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:e0ca8c4e8fb26344dc9fe2440df60768411fedd0a181133b41a22fd4747a3df8","observation_id":"51d896f8-66df-4027-9c6e-e48beb66ab3b","resolution":{"observed_at":"2026-08-07T12:45:48.261199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-08-07T10:25:36.299124Z","title":"Tomato: Assessing visual temporal reasoning capabilities in multimodal foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05349","last_updated":"2025-06-24T07:36:56Z","snapshot_observed_at":"2026-08-14T07:51:50.824783Z","submitted_at":"2025-06-05T17:59:58Z","title":"VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:36.299124Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2506.05349"},"observation_digest":"sha256:243efbbebe657233c7441d67ebb139f4d50ac74a57ff3fcde89236a415c111d9","observation_id":"1084599e-7509-4f0e-a156-9c5c0b60a8f8","resolution":{"observed_at":"2026-08-07T10:25:36.299124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.23266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-07-03T05:57:41.270398Z","title":"Tomato: Assessing visual temporal reasoning capabilities in multimodal foundation models","venue":null,"work_id":"7a50d850-6338-479d-ba02-65efc1b03f01","year":2024},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:f8a6b84d0bf714696710121350f19925a46c36a467323bb79885c4fa65751c71","observation_id":"dd1c37b8-704b-4224-888d-0992d7313db4","resolution":{"observed_at":"2026-05-11T00:33:51.178602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-08-06T11:08:10.355570Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23135","last_updated":"2025-07-30T22:30:48Z","snapshot_observed_at":"2026-08-12T00:00:16.166166Z","submitted_at":"2025-07-30T22:30:48Z","title":"ISO-Bench: Benchmarking Multimodal Causal Reasoning in Visual-Language Models through Procedural Plans","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T11:08:10.355570Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2507.23135"},"observation_digest":"sha256:6a2a9b1e802998975826c00b225219633f1ea3a15ace73e63536619c10b2147f","observation_id":"ffdbdba9-ab23-41ab-b009-7575a0a0e9f7","resolution":{"observed_at":"2026-08-06T11:08:10.355570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-07-14T22:09:56.270516Z","title":"arXiv preprint arXiv:2410.23266 (2024) VCBench 15","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12703","last_updated":"2026-06-29T17:45:27Z","snapshot_observed_at":"2026-08-14T16:51:57.431472Z","submitted_at":"2026-03-13T06:28:46Z","title":"SVCBench: A Streaming Video Counting Benchmark for Spatial-Temporal State Maintenance","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T22:09:56.270516Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2603.12703"},"observation_digest":"sha256:ee9a22d16c6f41484455faaf451f51ba54de908a51ba5e8a72e0655d3cce623b","observation_id":"e6b5b6e6-29d1-4b52-93ca-c5210d58cc63","resolution":{"observed_at":"2026-07-14T22:09:56.270516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.23266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-07-03T05:57:41.270398Z","title":"Tomato: Assessing visual temporal reasoning capabilities in multimodal foundation models","venue":null,"work_id":"7a50d850-6338-479d-ba02-65efc1b03f01","year":2024},"citing_paper":{"arxiv_id":"2604.11399","last_updated":"2026-04-13T12:41:50Z","snapshot_observed_at":"2026-08-13T12:36:22.963155Z","submitted_at":"2026-04-13T12:41:50Z","title":"Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:42:43.948462Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2604.11399"},"observation_digest":"sha256:bf5c1f772504875cb7edf3fe00780404d4f06c0b1509fbc5454b92caa165b0e5","observation_id":"6adaaf95-1685-46ff-8bf3-bcd8f52a8fdb","resolution":{"observed_at":"2026-05-11T09:56:05.675745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.23266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-07-03T05:57:41.270398Z","title":"Tomato: Assessing visual temporal reasoning capabilities in multimodal foundation models","venue":null,"work_id":"7a50d850-6338-479d-ba02-65efc1b03f01","year":2024},"citing_paper":{"arxiv_id":"2604.26565","last_updated":"2026-04-29T11:51:35Z","snapshot_observed_at":"2026-08-10T21:10:06.962801Z","submitted_at":"2026-04-29T11:51:35Z","title":"DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-07T13:50:23.835653Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2604.26565"},"observation_digest":"sha256:85fe309da78f26b746ce8ee2f099bc2776b3f332caf439194a68587ffc925640","observation_id":"cd74b951-ddc4-4b90-84ca-f9892bb792f2","resolution":{"observed_at":"2026-05-12T08:46:26.115404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.23266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-07-03T05:57:41.270398Z","title":"Tomato: Assessing visual temporal reasoning capabilities in multimodal foundation models","venue":null,"work_id":"7a50d850-6338-479d-ba02-65efc1b03f01","year":2024},"citing_paper":{"arxiv_id":"2605.03351","last_updated":"2026-05-05T04:13:32Z","snapshot_observed_at":"2026-08-13T15:28:34.419334Z","submitted_at":"2026-05-05T04:13:32Z","title":"VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T01:30:15.463051Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2605.03351"},"observation_digest":"sha256:214795af5a775cfcb7af9c0bcd694cdb1d887054997c97cf997b8c6b31865198","observation_id":"c71e0dfd-8391-4f1b-9d1b-0a901beee377","resolution":{"observed_at":"2026-05-11T23:11:13.608173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.23266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-07-03T05:57:41.270398Z","title":"Tomato: Assessing visual temporal reasoning capabilities in multimodal foundation models","venue":null,"work_id":"7a50d850-6338-479d-ba02-65efc1b03f01","year":2024},"citing_paper":{"arxiv_id":"2605.13803","last_updated":"2026-05-13T17:25:51Z","snapshot_observed_at":"2026-08-11T00:27:38.038120Z","submitted_at":"2026-05-13T17:25:51Z","title":"EvoGround: Self-Evolving Video Agents for Video Temporal Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T19:29:47.356665Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2605.13803"},"observation_digest":"sha256:6e708660397899901e0974a069acb33f618e70fc0e919b728b1557deecd38388","observation_id":"43914f2a-3cf6-4734-a493-640c3ec42e7f","resolution":{"observed_at":"2026-05-14T19:32:52.309602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.23266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-07-03T05:57:41.270398Z","title":"Tomato: Assessing visual temporal reasoning capabilities in multimodal foundation models","venue":null,"work_id":"7a50d850-6338-479d-ba02-65efc1b03f01","year":2024},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-08-10T19:13:02Z","snapshot_observed_at":"2026-08-14T23:09:31.705348Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":205,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:09ee76dacd3616ac90dbebf0f1622800c341b6822ad674ccf3b37191bf9a8209","observation_id":"6bb766fe-00df-468e-b65c-38e645fc268b","resolution":{"observed_at":"2026-07-03T05:57:41.272017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.23266/citation-record","integrity":"/paper/2410.23266/integrity","json":"/paper/2410.23266/citation-record.json","paper":"/paper/2410.23266"},"outbound":[],"paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:11:34.380302Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2410.23266."}