{"as_of":"2026-08-14T11:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a9e535c002f330215a4b4f5ae6b00d0c8dcd8f287f859fc557663502d08e20e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:22:44.163417Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:49:31.003751Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-12T16:22:44.163417Z","title":"Tc- bench: Benchmarking temporal compositionality in text-to-video and image-to-video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-08-12T19:44:40.357419Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:44.163417Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2411.13503"},"observation_digest":"sha256:77bb8e8d89e3d0a56c290ee800e5c027562330148039125fb1676a82f37b9230","observation_id":"61dc7b8c-49a0-4425-808b-f3f33c9bedb5","resolution":{"observed_at":"2026-08-12T16:22:44.163417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-12T14:26:21.916622Z","title":"Tc-bench: Benchmark- ing temporal compositionality in text-to-video and image-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.916622Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:7211c29f0bb9ea194b803dda2964391e55b10681bc3a0e16d5d9b4b6ce96f0fb","observation_id":"281c7401-6ffb-457a-b9d7-48afa78b3874","resolution":{"observed_at":"2026-08-12T14:26:21.916622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-11T13:24:10.583658Z","title":"Tc-bench: Benchmark- ing temporal compositionality in text-to-video and image-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13195","last_updated":"2025-08-25T17:59:59Z","snapshot_observed_at":"2026-08-11T13:17:57.487420Z","submitted_at":"2024-12-17T18:59:50Z","title":"CoMPaSS: Enhancing Spatial Understanding in Text-to-Image Diffusion Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T13:24:10.583658Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2412.13195"},"observation_digest":"sha256:1c892721cd9ff8560796b431af6e38e990f36807cc55746a41f790cd217b7e75","observation_id":"91ef17fe-07c7-4694-8578-06be7ef9ddfa","resolution":{"observed_at":"2026-08-11T13:24:10.583658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-11T13:15:28.331739Z","title":"Tc-bench: Benchmark- ing temporal compositionality in text-to-video and image-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16211","last_updated":"2024-12-17T23:00:42Z","snapshot_observed_at":"2026-08-14T04:04:24.827102Z","submitted_at":"2024-12-17T23:00:42Z","title":"Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T13:15:28.331739Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2412.16211"},"observation_digest":"sha256:b0a2a1a630f6028881baddc6ee48bcf1ec2b924f28e291f02716f56bfabe6dfb","observation_id":"c1346412-4a35-4d28-8834-171cfd93aad5","resolution":{"observed_at":"2026-08-11T13:15:28.331739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-10T20:41:46.702000Z","title":"Tc-bench: Benchmark- ing temporal compositionality in text-to-video and image-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07647","last_updated":"2025-01-13T19:17:06Z","snapshot_observed_at":"2026-08-12T18:27:06.653348Z","submitted_at":"2025-01-13T19:17:06Z","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:46.702000Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2501.07647"},"observation_digest":"sha256:d7afa56df5b559cf9c989007b0d527c1ff0b5b2ea65a694fbe18c1df8d935b27","observation_id":"491fb305-9892-4bae-a1d2-045effcab649","resolution":{"observed_at":"2026-08-10T20:41:46.702000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2504.17180","last_updated":"2026-04-03T02:52:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-24T01:34:12Z","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T18:56:39.735334Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2504.17180"},"observation_digest":"sha256:6b47e48e3c727d91212b57389d691f279f5097cc0e39bd2de80b437e3f2e0d77","observation_id":"24e2b302-5f59-4efa-9066-1467aaa50ebf","resolution":{"observed_at":"2026-05-22T18:56:58.222912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-07T05:41:39.629628Z","title":"Tc-bench: Benchmark- ing temporal compositionality in text-to-video and image-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07371","last_updated":"2025-06-10T13:33:53Z","snapshot_observed_at":"2026-08-13T04:39:17.124810Z","submitted_at":"2025-06-09T02:42:13Z","title":"ARGUS: Hallucination and Omission Evaluation in Video-LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:39.629628Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2506.07371"},"observation_digest":"sha256:260c797859526709ad3a2c9b04fa6952bcf8a268c4f452dfb6993165d5a049c3","observation_id":"f9d3a925-7cf2-41e0-8c54-ce28d147afb5","resolution":{"observed_at":"2026-08-07T05:41:39.629628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-07T10:17:46.458920Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-14T07:07:49.646647Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.458920Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:fee21ce957888c6ecc9a207c884e73d17f0ca6335833642ba51faca430fb29e9","observation_id":"ab23c3cf-1d1e-496d-9759-c525e4513816","resolution":{"observed_at":"2026-08-07T10:17:46.458920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-06T14:43:26.566236Z","title":"Tc-bench: Benchmarking temporal compositionality in text-to-video and image-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-12T07:34:56.937523Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:26.566236Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:f71a307db8da8bf0aaade3d68c2834a535fe82d957e9202f08119d3318d589f8","observation_id":"f2308e59-9a08-42ce-a73a-64f2db7c1330","resolution":{"observed_at":"2026-08-06T14:43:26.566236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-03T13:01:58.045344Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01095","last_updated":"2026-08-02T22:17:06Z","snapshot_observed_at":"2026-08-13T09:25:59.560851Z","submitted_at":"2026-01-03T07:12:55Z","title":"NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T13:01:58.045344Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2601.01095"},"observation_digest":"sha256:65307f0e279b9d7a9e2d548e4dca58b702766fbf7c6d8b738a6d7b3e7caeabf3","observation_id":"070e9f70-c0f7-4fc6-813a-ad34bd17ea0e","resolution":{"observed_at":"2026-08-03T13:01:58.045344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-04T06:36:33.811054Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01095","last_updated":"2026-08-02T22:17:06Z","snapshot_observed_at":"2026-08-13T09:25:59.560851Z","submitted_at":"2026-01-03T07:12:55Z","title":"NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T06:36:33.811054Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2601.01095"},"observation_digest":"sha256:49da23e530c2a81f263ac39daafb35137bd38f61de2e038dd712c877141895b3","observation_id":"f7706508-171a-4b27-b1a5-33634d400074","resolution":{"observed_at":"2026-08-04T06:36:33.811054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-08-10T22:34:28.406283Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T03:02:26.084185Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:1ef159503a50baeca8a8f6dda6b41769e3e931d1a8120aff65aba836e412c80e","observation_id":"eed2fe64-e570-4751-8fc1-4a7c37f37f1a","resolution":{"observed_at":"2026-05-10T03:03:37.455762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-08-10T22:34:28.406283Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T06:15:32.881140Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:3c34acf6b5ba5a4c418655ef6e3ab1e2a38064da71d49e2e408011e8426cb6ad","observation_id":"319912a3-7652-4639-ac05-94c56e90beeb","resolution":{"observed_at":"2026-05-15T06:19:50.198674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2605.23699","last_updated":"2026-05-22T14:51:22Z","snapshot_observed_at":"2026-07-06T23:33:53.870540Z","submitted_at":"2026-05-22T14:51:22Z","title":"CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T04:39:22.400458Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2605.23699"},"observation_digest":"sha256:fb0b831cb59b1ef9e56be5cfe0a0044bc191662867850a9a508d257f577a1cdc","observation_id":"d9c6c93f-4d63-40ca-a3a5-deb230cecd16","resolution":{"observed_at":"2026-05-25T04:40:23.130772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:7b69bd3ea0400e385d032e35f5ea8f784680daa9e4cf9c81f3ba9c6e3a131494","observation_id":"42c44632-6e7c-4385-a01e-cb5d6b8075c6","resolution":{"observed_at":"2026-06-29T22:54:00.793852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:208b9f95421d6a29de0c3b14fef51018f72191d719a30f5724e490f2e340035c","observation_id":"b2015940-614c-4655-a5ad-580580669802","resolution":{"observed_at":"2026-07-01T21:06:14.094042Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2606.10620","last_updated":"2026-06-09T09:17:55Z","snapshot_observed_at":"2026-08-12T06:15:10.899267Z","submitted_at":"2026-06-09T09:17:55Z","title":"Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T13:34:25.079037Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2606.10620"},"observation_digest":"sha256:52cc7358bd237c6551b279587d1634697f88dffc904f8b204589ffeb3f7add4a","observation_id":"01349f55-1a4f-44c8-86dd-85674ac5176b","resolution":{"observed_at":"2026-07-03T04:57:38.101059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2606.20545","last_updated":"2026-06-18T17:55:15Z","snapshot_observed_at":"2026-08-09T08:58:43.424376Z","submitted_at":"2026-06-18T17:55:15Z","title":"Current World Models Lack a Persistent State Core","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T17:33:41.461245Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2606.20545"},"observation_digest":"sha256:cb62cb8daa6535892e8109560a8c1107af25c765b36e27dbd5f38445a4b95038","observation_id":"1287a9a5-e700-4982-99b2-cbe2f21ee39a","resolution":{"observed_at":"2026-07-04T03:49:31.006734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-14T03:51:24.547781Z","title":"arXiv preprint arXiv:2406.08656 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11689","last_updated":"2026-07-13T15:22:56Z","snapshot_observed_at":"2026-08-12T10:42:47.843668Z","submitted_at":"2026-07-13T15:22:56Z","title":"From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-07-14T03:51:24.547781Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2607.11689"},"observation_digest":"sha256:0d0d9ad2b55f4df0d6fa81515b74716bd21c00a396b7dd5f970b81f089537922","observation_id":"e92bca83-aa2c-4ec9-8b0f-80b4951b5ec4","resolution":{"observed_at":"2026-07-14T03:51:24.547781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-02T04:57:34.021666Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-13T13:01:10.238865Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.021666Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:efeccc6cce19fad52a9c81cbafaa1addc347dc079ae53aa00324149b80cca25c","observation_id":"763678e9-f1d8-4bc6-81bc-4e197037d136","resolution":{"observed_at":"2026-08-02T04:57:34.021666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.08656/citation-record","integrity":"/paper/2406.08656/integrity","json":"/paper/2406.08656/citation-record.json","paper":"/paper/2406.08656"},"outbound":[],"paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2406.08656."}