{"as_of":"2026-08-14T16:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff050bad4daef3f297888b23fdf2db999c10482041b86de904b4708baffbab9b","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:26:22.185125Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.16718/citation-record","integrity":"/paper/2411.16718/integrity","json":"/paper/2411.16718/citation-record.json","paper":"/paper/2411.16718"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:26:21.840317Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.840317Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:f307956b4dca43178ccbcb743e840db8c7573252f456839b121424ef27b6e9b1","observation_id":"2012c825-aedf-489b-ac78-0f628535be39","resolution":{"observed_at":"2026-08-12T14:26:21.840317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.418489Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models","venue":null,"work_id":"e223c1d8-5ca1-4c69-93d4-112440a80637","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.846209Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:9f74267a3bdbe2b4a5b0fec50ed8cbfd159b73551a60c66474af1cc536e3a321","observation_id":"e40035c4-23c2-4057-a9d7-4fc2f9cda136","resolution":{"observed_at":"2026-08-12T14:26:23.424276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.403406Z","title":"Principles of Model Checking","venue":null,"work_id":"be7bba6c-e7e5-4ce8-ae9c-b9d57bc0b2e9","year":2008},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.851321Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:597faa56b0d297019d064f3e8d82d3f8d364e378cfbbf83a95fe09655247cbf0","observation_id":"964aef64-e29a-4662-8678-1704332f6d35","resolution":{"observed_at":"2026-08-12T14:26:23.408131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:21.856160Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.856160Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:73aea0e5b9e6ae99438431761794b0a43a34e2831c1f2d24cf883a8aa718a21a","observation_id":"e5ad5ca7-8e41-4990-b1c6-0164cd217775","resolution":{"observed_at":"2026-08-12T14:26:21.856160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.377872Z","title":"Synthesis of LTL Formulas from Natural Language Texts: State of the Art and Research Directions","venue":null,"work_id":"ec3674ee-2b39-47a7-afc3-9b924ccb9a08","year":2019},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.860847Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:9ad3b90b2646600a8424a47ea3e2a1f7528b8f453d3d9748399784126499e2c7","observation_id":"23cf971d-dffd-4190-8e34-376f11f239f6","resolution":{"observed_at":"2026-08-12T14:26:23.383281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.346592Z","title":"Storybench: A multifaceted benchmark for continuous story visualization, 2023","venue":null,"work_id":"8503de9a-4db0-4be2-bed8-6ac530bc0f3b","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.870301Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:bf3f4fdccc161006eca677f4695eb53eb8fb07fc9b1332890ccd903578132bd6","observation_id":"b72d4162-44bd-444d-b53f-5b945079acab","resolution":{"observed_at":"2026-08-12T14:26:23.351588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-12T14:26:21.875007Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.875007Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:2f4f5bde32faa52c2ebb3de4a1be45934e4fb946da9f48cccf62705ceb35fdd3","observation_id":"d94f6ee4-7cfc-4c7c-9d70-5ddd02f89d3e","resolution":{"observed_at":"2026-08-12T14:26:21.875007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.332121Z","title":"Nl2tl: Transforming natural languages to temporal log- ics using large language models, 2024","venue":null,"work_id":"011f6871-a19c-4166-b809-8075bc3ba67e","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.879891Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:36e647ace6a37f3856596e9727de59aa120a9041a282849e3ecfdc0e16d9c0e4","observation_id":"10a2d920-50de-468b-9b90-14dc47075204","resolution":{"observed_at":"2026-08-12T14:26:23.336966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08009","last_updated":"2023-09-14T19:35:53Z","snapshot_observed_at":"2026-08-13T10:13:22.430769Z","submitted_at":"2023-09-14T19:35:53Z","title":"Measuring the Quality of Text-to-Video Model Outputs: Metrics and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08009","snapshot_observed_at":"2026-08-12T14:26:21.884353Z","title":"Measuring the quality of text-to-video model out- puts: Metrics and dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.884353Z"},"links":{"cited_paper":"/paper/2309.08009","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:2acdcf97e25de0c9938cad206eaacf1eff45a16d4293cc3e764c69e8bf481d75","observation_id":"51f155c3-3c35-45f9-a22a-44d4299e0997","resolution":{"observed_at":"2026-08-12T14:26:21.884353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.316761Z","title":"Towards neuro- symbolic video understanding","venue":null,"work_id":"b2b577db-ee38-46c2-bb8d-26d4815e51da","year":2025},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.889305Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:6df2a1d424b2dd99f259efba754c61c185b93ddf4cc9c939ae9729afe910a4fa","observation_id":"77a0696e-5338-491b-a46c-c10a4250b74b","resolution":{"observed_at":"2026-08-12T14:26:23.321679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04180","last_updated":"2024-05-07T10:39:14Z","snapshot_observed_at":"2026-08-13T00:13:15.734303Z","submitted_at":"2024-05-07T10:39:14Z","title":"Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04180","snapshot_observed_at":"2026-08-12T14:26:21.893694Z","title":"Sora detector: A unified hallucination detection for large text-to-video models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.893694Z"},"links":{"cited_paper":"/paper/2405.04180","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:804384100d6be093af733b12adf1366184c74d193d2c3c2cc5e6fe3cc7705994","observation_id":"5558303e-58d1-48f1-b6a6-15dd5d2fafff","resolution":{"observed_at":"2026-08-12T14:26:21.893694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.300109Z","title":"Clarke, Orna Grumberg, and Doron A","venue":null,"work_id":"2dddc82f-30f6-49f0-ba71-7081715f00c9","year":1999},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.898716Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:627c5972f0484058eb952e3954573da72c0b2ca60a266d9eafaef0332c65a9c5","observation_id":"8a9954c8-2d77-47bc-aaf7-649240347a71","resolution":{"observed_at":"2026-08-12T14:26:23.306128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.284846Z","title":"Allen Emerson","venue":null,"work_id":"bab35b30-a4c1-4389-906e-bd6971f9ff17","year":1991},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.902923Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:9a4138ef65781e6a42eccc91d67053c9bdbdb14dc8a29ab53748b88b015e8fd8","observation_id":"08ea9a92-4ca8-4e71-8425-78735c7a8242","resolution":{"observed_at":"2026-08-12T14:26:23.289731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:21.907665Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.907665Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:aa4bd49d20501754319fa0260dabed7fcdd97ce22e96e51b0f89581650043411","observation_id":"fe51edc2-47a4-44ed-9664-c86e5b3728bb","resolution":{"observed_at":"2026-08-12T14:26:21.907665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.259689Z","title":"Pytorchvideo: A deep learning li- brary for video understanding","venue":null,"work_id":"6d70eec9-c815-4bb7-9e09-58cf272a4244","year":2021},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.912293Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:9aa29340d00975c4c8d2b984cef2e7c3350da661bc88f16f8a4c5f2ef2756bd2","observation_id":"73f59b18-2fb3-434c-a8a2-29ec999419c5","resolution":{"observed_at":"2026-08-12T14:26:23.264254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-12T14:26:21.916622Z","title":"Tc-bench: Benchmark- ing temporal compositionality in text-to-video and image-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.916622Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:7211c29f0bb9ea194b803dda2964391e55b10681bc3a0e16d5d9b4b6ce96f0fb","observation_id":"281c7401-6ffb-457a-b9d7-48afa78b3874","resolution":{"observed_at":"2026-08-12T14:26:21.916622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.243576Z","title":"Nl2ltl – a python package for converting natural language (nl) instruc- tions to linear temporal logic (ltl) formulas","venue":null,"work_id":"33840378-2408-42aa-beb1-d6c1c9cc983a","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.921254Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:f20c8f184ca40a1303cbf4c045de2a65ea8211dd95162c62f05f910a2c645fb4","observation_id":"2507997f-e589-431d-b227-3b0d89e3ab26","resolution":{"observed_at":"2026-08-12T14:26:23.249571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.228875Z","title":"Videoscore: Building auto- matic metrics to simulate fine-grained human feedback for video generation, 2024","venue":null,"work_id":"5501d29e-f216-4ee1-b033-6444ec746aaf","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.925775Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:169aeb7e7c78517f64c8e9bb75ca5803d18a0b8a76efcee5b7ee6bf42c432622","observation_id":"9b728dc2-e6bb-418e-bd17-64e86c720cbd","resolution":{"observed_at":"2026-08-12T14:26:23.233599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07080","last_updated":"2020-10-06T19:43:24Z","snapshot_observed_at":"2026-08-10T20:46:27.164358Z","submitted_at":"2020-02-17T17:19:40Z","title":"The Probabilistic Model Checker Storm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07080","snapshot_observed_at":"2026-08-12T14:26:21.930057Z","title":"The probabilistic model checker storm","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.930057Z"},"links":{"cited_paper":"/paper/2002.07080","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:d3ed2ab424c8315e78f2b9f1b537d37f5c2702b3b16440c7083ba2cc26e50dda","observation_id":"13d02dc8-5f20-4edd-af67-1f5cecbf94b9","resolution":{"observed_at":"2026-08-12T14:26:21.930057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:21.934999Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.934999Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:ae6bccce1784804a97b37e4dad0826ce8da8c201d5234723f0e0c8c9f409f895","observation_id":"93b46110-81d0-43bf-96c1-eb831e269877","resolution":{"observed_at":"2026-08-12T14:26:21.934999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.204466Z","title":"Make it move: Controllable image-to-video generation with text descrip- tions, 2022","venue":null,"work_id":"0657b130-65bb-486d-8f0e-f9a122d0c447","year":2022},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.939410Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:71de9242850812c7d994d6823b6c5e80470a13d73fbdbdfb44bfd2614fea8f60","observation_id":"6a97a529-eda6-4b44-9424-aec28eb66a84","resolution":{"observed_at":"2026-08-12T14:26:23.209310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.189229Z","title":"T2i-compbench: A comprehensive bench- mark for open-world compositional text-to-image genera- tion","venue":null,"work_id":"29e7fc4a-fce4-4ad4-bbbe-747438f418cb","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.943705Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:e2a6eedd6cc80d1394626d6ac63b71a2460a71e191f5f5b6bbdb8ab3d7800713","observation_id":"548969c0-6e22-434e-8eb1-b76015f588da","resolution":{"observed_at":"2026-08-12T14:26:23.194025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:21.947981Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.947981Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:822c1f5ef40396efd7262c6f1f54a93bfd24b032aa803f9fa9765355d4df56f2","observation_id":"9bf8b5e0-75b9-48a5-8ee2-c5c9b9223871","resolution":{"observed_at":"2026-08-12T14:26:21.947981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.164655Z","title":"Logic in Computer Science: Modelling and Reasoning about Systems","venue":null,"work_id":"b84946c2-dfd1-42b4-b8f6-234239e75530","year":2004},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.952180Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:b40a3016f2b172091aa5faaa5c4ef17e021a9d9e69c9a1618df7b93e8f599923","observation_id":"a6e60b85-d3fa-4b24-a418-fcc645c65939","resolution":{"observed_at":"2026-08-12T14:26:23.169428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.150411Z","title":"Peekaboo: Interactive video generation via masked- diffusion, 2024","venue":null,"work_id":"bcd16441-300f-4a10-91f3-aea34c94c9aa","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.956444Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:90edc2a500451d7f8c67f1de2acdaebcd4aa998ff046462589b7add306708d12","observation_id":"722f48ea-01b1-47b6-be50-336cbe588147","resolution":{"observed_at":"2026-08-12T14:26:23.155080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.135783Z","title":"T2vbench: Benchmarking temporal dynamics for text-to- video generation","venue":null,"work_id":"ce451c7c-1087-4cfd-baa4-bb50055d3c9e","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.960900Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:762f20ab7151d23957b51447c5a0db3c1243be71840abca311b4ad586696ed1f","observation_id":"e8202b47-3b36-48cc-b4ae-7a7da1db6785","resolution":{"observed_at":"2026-08-12T14:26:23.140851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.120884Z","title":"T2vbench: Benchmarking temporal dynamics for text-to- video generation","venue":null,"work_id":"e19283a0-cf68-4233-ad91-73d936f2e1bd","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.965283Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:b454996f70424df137406c415875bc773e04d0465a01e95fbc875b83c84f617d","observation_id":"451f920c-dbe0-4b2f-bc29-0c5d8893ca45","resolution":{"observed_at":"2026-08-12T14:26:23.125611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.106055Z","title":"Stormpy - python bind- ings for storm, 2021","venue":null,"work_id":"6c5dfe6c-e112-49c8-9152-2ab69647e10c","year":2021},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.969536Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:89346ea45db1c2fd1f574b8d1dbc07682f93dbbe978658f5eb219345fae1e8d2","observation_id":"8ff4d888-bd39-4f56-83dc-e42099dc3c3e","resolution":{"observed_at":"2026-08-12T14:26:23.110995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.090994Z","title":"Kemeny and J.L","venue":null,"work_id":"2674ef3a-82ee-4cc8-9bce-1086328e4a5f","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.973749Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:0235a43301f2e44cff67959be868733e33b877de31eeae5ff60c35618180e593","observation_id":"fa4a580f-1d92-41bc-b7ae-e6d5b0759e1f","resolution":{"observed_at":"2026-08-12T14:26:23.095564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.076407Z","title":"Joshi, Hanna Moazam, Heather Miller, Matei Zaharia, and Christopher Potts","venue":null,"work_id":"dcc02e46-d498-4741-a873-c5778457e169","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.978158Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:8f5bc813a8ae59ec9b19987e2ccb66bde83edb6acbf12e81db3a6fdc56202e38","observation_id":"94e37493-9c39-46ef-a091-6a4cdf4c3ee7","resolution":{"observed_at":"2026-08-12T14:26:23.081041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.061787Z","title":"Subjective-aligned dataset and metric for text-to-video qual- ity assessment, 2024","venue":null,"work_id":"5eb4944d-1a67-43e4-ad5e-cfdc635f6eba","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.982492Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:6c61683b8195cdc0b6069ca05c7ff6612b791aa1e3b8946b54271613e1fe7c7d","observation_id":"779a7ad8-e2e0-4852-91c1-3fe7079539a5","resolution":{"observed_at":"2026-08-12T14:26:23.066555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.046660Z","title":"Evaluating and improving com- positional text-to-visual generation","venue":null,"work_id":"0b119140-3417-4576-ac0a-607084f5ff59","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.986872Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:40e4799758073ce37275e72ef18f62db2a8f1217b55a02d9ab408af81e9b4a8a","observation_id":"50f4f1b9-a681-42ca-83e3-cb91a5bd82af","resolution":{"observed_at":"2026-08-12T14:26:23.051498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11027","last_updated":"2024-10-07T18:47:47Z","snapshot_observed_at":"2026-08-14T09:42:05.101379Z","submitted_at":"2024-03-16T22:14:56Z","title":"Reward Guided Latent Consistency Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11027","snapshot_observed_at":"2026-08-12T14:26:21.991425Z","title":"Reward guided latent consistency distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.991425Z"},"links":{"cited_paper":"/paper/2403.11027","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:fd2af3de00e6e0986a81647d021f49c984e29cea721335a2e974e192cb4d6c8d","observation_id":"5c9ca3b3-9ba9-4567-bbee-5a2766463675","resolution":{"observed_at":"2026-08-12T14:26:21.991425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18750","last_updated":"2024-10-11T07:50:49Z","snapshot_observed_at":"2026-08-14T11:05:26.691265Z","submitted_at":"2024-05-29T04:26:17Z","title":"T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18750","snapshot_observed_at":"2026-08-12T14:26:21.996386Z","title":"T2v- turbo: Breaking the quality bottleneck of video consis- tency model with mixed reward feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.996386Z"},"links":{"cited_paper":"/paper/2405.18750","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:9bfff1cf04f147809470017b547161c0a5b9addefa3a4ff597942c17de8caf95","observation_id":"5d4e8c6e-447c-451c-8788-3dcf96766249","resolution":{"observed_at":"2026-08-12T14:26:21.996386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.001017Z","title":"T2v- turbo-v2: Enhancing video generation model post-training through data, reward, and conditional guidance design.arXiv preprint arXiv:2410.05677, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.001017Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:d3cfc87ad340901da3b78798e4ee3d7579280873cc4d8ac7aba8fcc2a39ba4b7","observation_id":"f63e0955-cdaa-4896-893c-86203099c359","resolution":{"observed_at":"2026-08-12T14:26:22.001017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.032153Z","title":"Ground- ing complex natural language commands for temporal tasks in unseen environments","venue":null,"work_id":"e97be4de-dc24-4a76-91bd-211a07f071ec","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.015707Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:3d9a83cf68916d3e05712d42d8b77bcf79b51fd939612d616603c08b9499835d","observation_id":"889db70a-03c4-491a-9925-7e6f5dc397b9","resolution":{"observed_at":"2026-08-12T14:26:23.036965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.017121Z","title":"Fetv: A bench- mark for fine-grained evaluation of open-domain text-to- video generation, 2023","venue":null,"work_id":"070b548d-3e56-43aa-b4ff-ffef8f1c8ee2","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.020155Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:c18804acb7150a0a330ca8ae49591ef596e94a28231d9a99d098959f45fa14a4","observation_id":"dee4706e-ac74-4d53-bc5e-bbc4cb3942e3","resolution":{"observed_at":"2026-08-12T14:26:23.022279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.001943Z","title":"Evalcrafter: Benchmarking and eval- uating large video generation models","venue":null,"work_id":"abcfa618-2bfc-4496-b428-5c77671282cc","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.024525Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:a501ccb9b383b24c93d55fbc6b413927424846a74c023ca88f7bdb01ec146ded","observation_id":"f905f5d2-ef16-447a-b3fa-5ed569070427","resolution":{"observed_at":"2026-08-12T14:26:23.006849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.985960Z","title":"Evalcrafter: Benchmarking and eval- uating large video generation models, 2024","venue":null,"work_id":"8eea1439-3638-4231-b3d6-53a5e47806f4","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.028931Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:beed8306ea518dbc71ca569029e04f3d28c7f7767bb5fa3bd6a30ab1a5f852c6","observation_id":"49286adc-1389-4adb-9945-ed3d1b1de31d","resolution":{"observed_at":"2026-08-12T14:26:22.991516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.970614Z","title":"Fetv: A bench- mark for fine-grained evaluation of open-domain text-to- video generation","venue":null,"work_id":"5fbb2769-b4ed-469a-9411-fd2812812026","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.033729Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:d598c0630d6dc6e16a430d8d9297d27aacaedbf2eb5cd82a8780a8e3ea840b7e","observation_id":"d2853179-ad90-4173-aedf-6e97d4d4b553","resolution":{"observed_at":"2026-08-12T14:26:22.975519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-12T14:26:22.038206Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.038206Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:a7363ca286152b564d332317961d01515289bced2cbf713953937001c207c2b3","observation_id":"3a3b1ba7-8cfb-46a6-8704-21059dde86ed","resolution":{"observed_at":"2026-08-12T14:26:22.038206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.955944Z","title":"The Temporal Logic of Re- active and Concurrent Systems: Specification","venue":null,"work_id":"775b6075-f3b4-47ab-b6a2-1ceaf334b420","year":1992},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.043006Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:e58cf3eb7023a213389ae767d90a5bc5397ac5addff7383e293de50c4253e9bb","observation_id":"4629eb44-2be6-459f-9cb0-249e236e39ea","resolution":{"observed_at":"2026-08-12T14:26:22.960489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.941550Z","title":null,"venue":null,"work_id":"2246f2c6-e272-4883-a9bd-357239d71cdd","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.047321Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:d7207026fc17f5ee95b947196b4be6755e183db3e754f7adffe6af1b0256303c","observation_id":"9bf9101c-a398-467a-96f7-2834d7ad3373","resolution":{"observed_at":"2026-08-12T14:26:22.946138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.926525Z","title":"Internvl 2.0: A suite of multimodal large lan- guage models for vision and language tasks","venue":null,"work_id":"88bc3ea9-c2cb-4690-a2a0-57532afee6a0","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.051553Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:05b50d881921a8b7ff7e7cf3b4d8b1dfccb84e96366e4879a93604faa238e4b0","observation_id":"534af4a2-759d-4a76-a15f-fb596604b1d8","resolution":{"observed_at":"2026-08-12T14:26:22.931423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.911872Z","title":"Optimizing instructions and demonstrations for multi-stage language model programs, 2024","venue":null,"work_id":"f29efa99-3e4f-48e0-a2df-6adc0302f8d4","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.055798Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:b6742d65b0474d2b4b3504c21daf6fe56c63b4d988215ab0140e698262cf185e","observation_id":"1d8d5084-9c3e-4567-a35b-ed7710a71376","resolution":{"observed_at":"2026-08-12T14:26:22.916732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.896351Z","title":"Data-efficient learning of natural language to linear temporal logic transla- tors for robot task specification, 2023","venue":null,"work_id":"13fdb784-dcc9-44f9-92a4-d2954edef3c7","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.060922Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:0f01dfc7a842d370833d62a08908ad3a5817fadd3c84b4b0a6c77763e47a0f21","observation_id":"3c1873eb-368e-419c-9b9e-cdda00a0204e","resolution":{"observed_at":"2026-08-12T14:26:22.901958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.880995Z","title":"Graph neural network (gnn) in image and video understanding using deep learning for computer vision applications","venue":null,"work_id":"f28a89a3-49a6-4247-adce-9680d6f1afe0","year":2021},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.065382Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:80253ccf013b9df4990dca9f416af92fb6f86f9e3c2c7b9efa91569ba8df716b","observation_id":"21b8fc4a-dd8c-46f6-9be8-573271c2f008","resolution":{"observed_at":"2026-08-12T14:26:22.886161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.865399Z","title":"The lost melody: Empirical observations on text-to-video generation from a storytelling perspective, 2024","venue":null,"work_id":"a580f328-b96a-469a-8bc0-e535e1530ad5","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.069819Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:32f27e56eed1ba51e442b2fe703af4087f5fd1bde8cc2a93654616fcc467e948","observation_id":"cc835c26-698c-41bb-9cc1-e3ba70a273b6","resolution":{"observed_at":"2026-08-12T14:26:22.871122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-14T09:31:46.610962Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-12T14:26:22.074051Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.074051Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:8ccf7054066f69c67b461867a787d92ec77aca3ddbb9e70dc0055f4a366e669e","observation_id":"dbcd6b75-21b6-4a85-b860-d075f2f730d1","resolution":{"observed_at":"2026-08-12T14:26:22.074051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-13T04:42:41.081798Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-12T14:26:22.078469Z","title":"Towards a better metric for text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.078469Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:0c3d14c38cfd452512da4b12e47217092068bfcd50bde61afa7b514ae6470959","observation_id":"b12f0e9c-2bdb-4259-ae5f-bed25f8e91d2","resolution":{"observed_at":"2026-08-12T14:26:22.078469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.850245Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"614864f6-c417-4e28-8319-852974061f87","year":2016},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.083315Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:05d58a2ef9acbedaa2ae6d89711f7098c6cd12cfa0554e338f1694d2522d59e5","observation_id":"dda00750-4a51-45f1-b84a-eb0b1201c09f","resolution":{"observed_at":"2026-08-12T14:26:22.855253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10171","last_updated":"2023-09-18T21:40:08Z","snapshot_observed_at":"2026-08-13T10:10:29.002953Z","submitted_at":"2023-09-18T21:40:08Z","title":"Specification-Driven Video Search via Foundation Models and Formal Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10171","snapshot_observed_at":"2026-08-12T14:26:22.087637Z","title":"Specification-driven video search via foundation models and formal verification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.087637Z"},"links":{"cited_paper":"/paper/2309.10171","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:146f67903ecb42fb34f2b1cdd19cd7a574b812f35b77fafbeb48f7174c859981","observation_id":"52422dc3-e595-4642-8c24-e2b87d1fa2dc","resolution":{"observed_at":"2026-08-12T14:26:22.087637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-12T14:26:22.092279Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.092279Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:859a34ae62d266f45bf42b7ec32fd65192e49cbd495c5b862ac6b04578b12eef","observation_id":"03bbbbc8-0f23-4abe-bab2-6225fd5a8d1d","resolution":{"observed_at":"2026-08-12T14:26:22.092279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.834984Z","title":"Celebv-text: A large-scale facial text-video dataset, 2023","venue":null,"work_id":"fe06b26d-ade3-4a8b-b8af-d37e316b39e6","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.096996Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:743a3cb6a7de8a4885637a53a73a4f1c371dd088fa8592eef56f5018bb188c66","observation_id":"ba2bab75-923e-476d-8fdc-18f7c68451d3","resolution":{"observed_at":"2026-08-12T14:26:22.839826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T14:26:22.101268Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.101268Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:9a6685488a39c1595d8dc4b7544c86fc0980f27b70e8664af8d494c3e6b0f1f9","observation_id":"831c313d-ab1d-4c0a-9d16-62e4c81bfd8c","resolution":{"observed_at":"2026-08-12T14:26:22.101268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-12T14:26:22.106169Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.106169Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:3a655574c3bb529a87b601170bf4bd83f3fe9812e42704b6e2856837c45af790","observation_id":"1f8edac9-55ac-4fe8-9dcc-178f6a7b44b8","resolution":{"observed_at":"2026-08-12T14:26:22.106169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.819249Z","title":"Benchmarking aigc video quality assessment: A dataset and unified model, 2024","venue":null,"work_id":"07fcccfb-1a23-4464-92e8-d4ed334c01f6","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.110899Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:9eefafbc5b788ba65337b9c6b76cfecbbe5e3c8d2e3a9f197ed48a1300282833","observation_id":"af2b9744-cf36-4cc6-b554-ca5339e951d5","resolution":{"observed_at":"2026-08-12T14:26:22.824728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.804389Z","title":"Always Event A","venue":null,"work_id":"2c719e92-f8a6-4dbe-8dbe-eeb041df501f","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.115464Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:ba89a5d58f4e63d473067588e59b954b3335671f2b937be27c44c8ddde58b334","observation_id":"1d2d5f29-f18b-4918-b37a-d44bb086ff2c","resolution":{"observed_at":"2026-08-12T14:26:22.808978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.790025Z","title":"X i∈Ds max 0≤j≤k fT2P(Ds, i, j) # (17) DT2TL|train = arg max Ds⊂D′ T2TL,|Ds|=N","venue":null,"work_id":"cbcc25e8-207d-4614-b47f-2ce07c56e40b","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.120112Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:9cc278df699d01b7a5cefbc0eb7c7b5e72bfcc021e0b23606d854599acbd3240","observation_id":"b0c350ae-f69e-4cd0-bba5-cd6077df3c80","resolution":{"observed_at":"2026-08-12T14:26:22.794588Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.773921Z","title":"Your output fields are:","venue":null,"work_id":"c20e15ee-5a00-4669-9704-5280c7fdea79","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.124855Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:48364a77892606340f5dee651c01271303bd67d0652155b0a831bb61795ea948","observation_id":"9d8d85c8-4d5a-4d41-9416-aec33114694c","resolution":{"observed_at":"2026-08-12T14:26:22.779338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.758117Z","title":"Overall Consistency","venue":null,"work_id":"8e336516-31db-4c3a-8a9a-fb32f7c03fce","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.129848Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:9764fc34c617e3bc40ba2d6e1e5a426c2e083ce644e9647972221d9d51fdf9df","observation_id":"d30fb7e1-c241-455b-8ab0-144ac9315f71","resolution":{"observed_at":"2026-08-12T14:26:22.762687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.742828Z","title":"person”, “car","venue":null,"work_id":"522c6146-2379-4ff7-9915-b4cc56c0706d","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.134378Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:9624fe18a11b321dc4295da61b3f32ae244af8004719a263e9ed646edd4c9ca1","observation_id":"9bac22df-1b23-4cbc-8de5-97630b3ac504","resolution":{"observed_at":"2026-08-12T14:26:22.747310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.727761Z","title":null,"venue":null,"work_id":"7402a16c-6177-41b0-b180-396c965c792e","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.138878Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:660013679aee65f22f4cd98401951ef4036751c5e3535e982704dd900c0dd6b9","observation_id":"cff271a8-2c5d-47e4-bb1e-e38ce80730be","resolution":{"observed_at":"2026-08-12T14:26:22.732317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.712948Z","title":"Your output fields are:","venue":null,"work_id":"c1fd1d32-e0e4-4f8d-9f27-421e1a8c222a","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.143686Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:f1b63a9f3ffc9ef37ba2fbcb0f912ddefcc95dc94f0a4084132ff7eabd2adfce","observation_id":"55ac61ef-b3de-4860-800e-9e2d60051a74","resolution":{"observed_at":"2026-08-12T14:26:22.717354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.698330Z","title":"Overall Consistency","venue":null,"work_id":"732ed53a-9715-4c63-956a-9fe20d7093e1","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.148306Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:78bc66ae859efe2367569b944b7b413fcc4eee4e2995b9f531ae7efbf7131d9b","observation_id":"30c0455f-3ccb-4160-a863-13c9e603508a","resolution":{"observed_at":"2026-08-12T14:26:22.702885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.153051Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.153051Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:4e10784398e4f596085e149628bbb72d7702e6ff9e8884f3c7cc8876591cb3f5","observation_id":"55cf7e32-1fc1-40b3-89c4-c3bacf75397e","resolution":{"observed_at":"2026-08-12T14:26:22.153051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.671953Z","title":"Prompt 3","venue":null,"work_id":"be885211-9caa-4461-a5e9-3b75cf0c0309","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.157436Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:79d035d7964e6c5a81153bd95cc98276410f6baae9b08496394d39c92975a0d7","observation_id":"afb95f78-5486-46ca-bc04-4838435e09df","resolution":{"observed_at":"2026-08-12T14:26:22.677290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.655548Z","title":null,"venue":null,"work_id":"26415866-8d6e-441d-853d-de3895c6a01c","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.162143Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:c414720fe6347c52ff39d3104e4278ef6d1e0a377f3d737d863f697ff9a0f1f7","observation_id":"236cc62b-c292-4cf5-a5e1-d608b252fd98","resolution":{"observed_at":"2026-08-12T14:26:22.660968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.639323Z","title":"Calibration Plots","venue":null,"work_id":"f723bbd0-3bad-4be5-ae18-21d285b6c5fc","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.166484Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:682205bb01c243e22f2b3a473bc47af469af8294bd7cc61a6633db6f0f2bc71e","observation_id":"44439d73-5234-4358-8148-e8af95f45bac","resolution":{"observed_at":"2026-08-12T14:26:22.644076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.622798Z","title":"Nature”, “Human & Animal Activities","venue":null,"work_id":"c37109ef-c13d-40c3-a3c1-2d0ed81201d1","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.171031Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:d638a709d021b7c252b7903db861f59c76e263da586f60d389f8b475885ce516","observation_id":"a4e05ca4-afe6-455e-9ff8-ace2dbb5eeb4","resolution":{"observed_at":"2026-08-12T14:26:22.627904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.606974Z","title":null,"venue":null,"work_id":"b34c82e7-05e4-4081-86a1-5557e3cc8b94","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.176100Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:fc9a23b77808ddaf615c15d5326ef8732be17a7a3fbb30c038beb6326e13a3af","observation_id":"7a4feb80-19e9-4884-935e-a725342bdad7","resolution":{"observed_at":"2026-08-12T14:26:22.611633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.591506Z","title":"Always,\"","venue":null,"work_id":"34f3a6df-179f-4708-a1ca-c0ab590b0ac0","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.180814Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:e8e1e61b3339c8ab9a2db15d93ef40fe2b100018a6176bc706cdd0b8bab0a8aa","observation_id":"5983ba1e-af9a-4a90-9b67-a6fe4660e60a","resolution":{"observed_at":"2026-08-12T14:26:22.596570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.573994Z","title":"Always\"**: Describes an event that continuously occurs in the background or context. - **","venue":null,"work_id":"884678b7-5a6e-4603-bab8-12ea71363d90","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.185125Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:6707111034a9e5af61e86cfeba9c58ddc87204dd838ce64792ed7775b51bd377","observation_id":"0ab11e5f-c694-4d72-a4da-495505349824","resolution":{"observed_at":"2026-08-12T14:26:22.580643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.362302Z","title":null,"venue":null,"work_id":"38741a63-4de6-40b8-8d23-6f1e00c0198c","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.865728Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:c87ccee77d99b17feab908c8b6883be050e1fea5ab0faf7c2257c3f8f16a2162","observation_id":"f8636d89-cde1-4b8c-8523-89a29b2bff3d","resolution":{"observed_at":"2026-08-12T14:26:23.367082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T14:26:22.010844Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.010844Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:d89d4575e7f0d7377b2a6804e067e1feba856006e175dad077e3f0700025cb1d","observation_id":"c9afa0cf-12c1-4f28-9dcb-4334ecd84a03","resolution":{"observed_at":"2026-08-12T14:26:22.010844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":47},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2411.16718."}