{"as_of":"2026-08-09T09:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee33794e3d33ccbe637efd046041df87ae59539dbb24ad2bc5614e5bc32ac288","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:40:21.573733Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:39:50.643820Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-18T14:39:59.870039Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2410.05363"},"observation_digest":"sha256:757558efea28987294106c341a61e5067851e8b2a97c84615d54c4ab7f9d4eaf","observation_id":"4314d572-971a-4298-8ccd-03925a8e9be6","resolution":{"observed_at":"2026-05-18T14:40:00.025640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2411.15115","last_updated":"2026-04-20T17:59:36Z","snapshot_observed_at":"2026-08-02T10:06:23.710148Z","submitted_at":"2024-11-22T18:31:47Z","title":"Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T08:25:01.468957Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2411.15115"},"observation_digest":"sha256:ed7ffc57cd48767756d3b938c40a5f4c1aa88a06e9e720b77dd5580cf6bfe9ae","observation_id":"991a8122-6b02-489c-83ee-e497003b3735","resolution":{"observed_at":"2026-05-23T08:25:29.416102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-08T23:40:21.573733Z","title":"T2v-compbench: A comprehensive benchmark for compositional text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04076","last_updated":"2025-02-06T13:41:24Z","snapshot_observed_at":"2026-08-08T23:34:41.783986Z","submitted_at":"2025-02-06T13:41:24Z","title":"Content-Rich AIGC Video Quality Assessment via Intricate Text Alignment and Motion-Aware Consistency","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T23:40:21.573733Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2502.04076"},"observation_digest":"sha256:1264bf203881a37680b646c9046426c68c3c931012b0f3cc4137846859fca9dd","observation_id":"abfdd187-1a43-4bf7-bce2-6ed78f0b9b96","resolution":{"observed_at":"2026-08-08T23:40:21.573733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:52d2fbcafaddd7325705eef7aaf21a122c364c33cb45276ca3252b2429167525","observation_id":"c3e7287d-1a9d-48af-9ee4-ebd163dfbe9e","resolution":{"observed_at":"2026-05-14T18:42:03.138921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2504.17180","last_updated":"2026-04-03T02:52:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-24T01:34:12Z","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-22T18:56:39.735334Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2504.17180"},"observation_digest":"sha256:c6741ca15e76ee423a9bab701e282fd187f3349e0dbba80581d7114f0e93f50a","observation_id":"dbaf1bcc-bd34-48b7-88c3-6562d37530b3","resolution":{"observed_at":"2026-05-22T18:56:58.291372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-07T14:39:37.046057Z","title":"T2v-compbench: A comprehensive benchmark for compositional text-to-video generation.arXiv preprint arXiv:2407.14505, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:37.046057Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:0411103850b9a446f86c6878bb866164045ff1021ad5d6dd7877da848641651c","observation_id":"295ef70f-8597-41db-824d-ae06ac631d1a","resolution":{"observed_at":"2026-08-07T14:39:37.046057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-06T16:30:52.375066Z","title":"T2v-compbench: A comprehensive benchmark for compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13428","last_updated":"2026-05-26T08:34:24Z","snapshot_observed_at":"2026-08-06T16:22:35.916708Z","submitted_at":"2025-07-17T17:54:09Z","title":"\"PhyWorldBench\": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:52.375066Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2507.13428"},"observation_digest":"sha256:300bd8ad0e4651baddf6fd5f55a87420c20d9245f6272b2d6a0f6d2c8fa419c1","observation_id":"e9c22929-79e6-4272-95b3-dc5859d79c97","resolution":{"observed_at":"2026-08-06T16:30:52.375066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T21:28:41.904725Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2508.05635"},"observation_digest":"sha256:e7a53c50216174e6cdd7a9e86b05a82b5e1d3ce934591e2b21bf7296e7307cdc","observation_id":"2c7118b9-ed99-4b24-a5e8-b6ac002c0669","resolution":{"observed_at":"2026-05-15T21:28:42.060128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-05T23:17:31.309031Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05636","last_updated":"2025-08-07T17:59:59Z","snapshot_observed_at":"2026-08-07T21:51:21.989392Z","submitted_at":"2025-08-07T17:59:59Z","title":"FaceAnonyMixer: Cancelable Faces via Identity Consistent Latent Space Mixing","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:31.309031Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2508.05636"},"observation_digest":"sha256:a524e9e54949f13814301e64d3e1baab416217c4dbcd37126665f634247ab7dc","observation_id":"48546cb2-cd8b-442f-891b-28f49d5ca583","resolution":{"observed_at":"2026-08-05T23:17:31.309031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2510.20206","last_updated":"2026-05-14T08:53:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-23T04:45:09Z","title":"RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T05:13:42.934115Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2510.20206"},"observation_digest":"sha256:998d3c51671cc0784bc9adecc0a0d2cbbe1e134d9db7ef35fad96bfb14f40973","observation_id":"d487a349-1bf0-491c-aebc-9b6f35056bb6","resolution":{"observed_at":"2026-05-18T05:15:54.355622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-02T14:24:57.691309Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.10579","last_updated":"2026-07-30T05:06:10Z","snapshot_observed_at":"2026-08-02T23:16:55.313881Z","submitted_at":"2026-05-11T13:50:47Z","title":"VISTA: A Controllable Platform for Generating and Auditing Egocentric Assistance Scenarios","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T14:24:57.691309Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2605.10579"},"observation_digest":"sha256:9c61de18b9ee8557a35e0810a71a2a38d1669bd79f993bfdd7d7bc110bd39923","observation_id":"da9d1af9-c0c1-4893-98ca-f018a65e10ee","resolution":{"observed_at":"2026-08-02T14:24:57.691309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2605.14269","last_updated":"2026-05-14T02:12:13Z","snapshot_observed_at":"2026-08-02T12:45:57.975749Z","submitted_at":"2026-05-14T02:12:13Z","title":"PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T02:49:21.291716Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2605.14269"},"observation_digest":"sha256:261eb83b119d5d78156b9a16a3064fa662661b57c97d0c95c2f7684a8ef756a0","observation_id":"cac5b9e1-84df-4e74-adba-e8b1e2f91ecc","resolution":{"observed_at":"2026-05-15T02:49:41.450400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2605.15185","last_updated":"2026-05-14T17:59:04Z","snapshot_observed_at":"2026-08-03T12:57:56.209990Z","submitted_at":"2026-05-14T17:59:04Z","title":"Quantitative Video World Model Evaluation for Geometric-Consistency","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T03:11:03.060052Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2605.15185"},"observation_digest":"sha256:cd5cdde9f962a0a7050ebea6a1e96e5c8157aba9280cf37d6c7e505932bfe875","observation_id":"1893dce7-7ebd-43a9-ba47-f36ad7896b2b","resolution":{"observed_at":"2026-05-15T03:14:53.044179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2605.29360","last_updated":"2026-05-28T04:58:15Z","snapshot_observed_at":"2026-08-06T11:23:36.274726Z","submitted_at":"2026-05-28T04:58:15Z","title":"MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T07:46:28.469913Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2605.29360"},"observation_digest":"sha256:5ec4c259c0eb4db37839259c24b5d34de43c58e31a901672d22afd3334c445b5","observation_id":"0248baeb-cf3c-4be0-96fe-2dc3abe2c403","resolution":{"observed_at":"2026-06-29T07:53:13.902525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2606.01481","last_updated":"2026-05-31T22:46:35Z","snapshot_observed_at":"2026-08-06T16:16:18.407347Z","submitted_at":"2026-05-31T22:46:35Z","title":"SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:57.685728Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2606.01481"},"observation_digest":"sha256:bb5eaeecdd8c7cb4ae7462dd4084301bee25e5a7038126a4dbbe49e19e817714","observation_id":"d57fe3b7-a99a-4b5a-86bb-b7540b419bf8","resolution":{"observed_at":"2026-06-28T17:12:25.192683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2606.26769","last_updated":"2026-06-25T08:54:17Z","snapshot_observed_at":"2026-08-04T06:31:49.540535Z","submitted_at":"2026-06-25T08:54:17Z","title":"ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-26T05:03:22.182138Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2606.26769"},"observation_digest":"sha256:ff1b2eeaef0912e7bff03538569dad1f6f9938478ca717c6dd6df72d774f7d08","observation_id":"1ae5a96b-ff39-49e1-9527-3163a8c5ce69","resolution":{"observed_at":"2026-07-04T13:39:50.645701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":"2407.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-04T13:39:50.643820Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":"d104f321-3656-450b-b1de-7988c88d9b8e","year":2024},"citing_paper":{"arxiv_id":"2606.31026","last_updated":"2026-06-30T01:46:54Z","snapshot_observed_at":"2026-08-03T00:20:08.577196Z","submitted_at":"2026-06-30T01:46:54Z","title":"OTCache: Optimal Transport for Geometry-Aware Caching in Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-01T06:21:22.905093Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2606.31026"},"observation_digest":"sha256:64872e2a5c279ba87830d40ca1efdac8f6ab2c23809d23c80cd7c0cefdc5143c","observation_id":"5c6e1ef0-5f68-456e-91c7-3e8ea85a550a","resolution":{"observed_at":"2026-07-01T09:45:39.517240Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-07-14T03:51:24.547781Z","title":"arXiv preprint arXiv:2407.14505 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11689","last_updated":"2026-07-13T15:22:56Z","snapshot_observed_at":"2026-08-02T18:20:32.168835Z","submitted_at":"2026-07-13T15:22:56Z","title":"From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence","version":1},"reference_index":172,"source":"arxiv_source","source_observed_at":"2026-07-14T03:51:24.547781Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2607.11689"},"observation_digest":"sha256:c2e9e70f6c915fbe6eb8f1e53ad223a4db35d7903d9f15233a0eff48aa5ce81c","observation_id":"bde72b70-1241-49ce-9aa6-f821b323897d","resolution":{"observed_at":"2026-07-14T03:51:24.547781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-02T02:56:21.282757Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14202","last_updated":"2026-07-15T17:46:12Z","snapshot_observed_at":"2026-08-07T15:13:00.036289Z","submitted_at":"2026-07-15T17:46:12Z","title":"KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T02:56:21.282757Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2607.14202"},"observation_digest":"sha256:5e662a5ffdaad89c6221d7bd69d117096bfcea3c443fc15950424548ad9f1b21","observation_id":"afc33395-3294-46e4-92b3-c5ad9d5b2ddc","resolution":{"observed_at":"2026-08-02T02:56:21.282757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-01T20:07:42.500888Z","title":"T2v- compbench: A comprehensive benchmark for compositional text-to- video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:42.500888Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:b63f34885462e798326a1c5edffbbf8f0683d6a90ef6e73b3b2399247705c7c7","observation_id":"2a76ccff-3e84-469b-ac40-77cb35f8d457","resolution":{"observed_at":"2026-08-01T20:07:42.500888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.14505/citation-record","integrity":"/paper/2407.14505/integrity","json":"/paper/2407.14505/citation-record.json","paper":"/paper/2407.14505"},"outbound":[],"paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2407.14505."}