{"as_of":"2026-08-18T09:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f78a2ae28445cbf92b09faf72b60aa2c62e695278fdf2dc6f98743c93ba816ea","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:46:46.884251Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:28:57.467161Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:31:00.382938Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"cited_work":{"arxiv_id":"2504.19894","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19894","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2504.19894 (2025) 4","venue":null,"work_id":"caef605d-f897-4e44-9037-bde4f89b096e","year":2025},"citing_paper":{"arxiv_id":"2604.10456","last_updated":"2026-04-12T04:39:09Z","snapshot_observed_at":"2026-08-14T07:37:19.031942Z","submitted_at":"2026-04-12T04:39:09Z","title":"A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:28:57.467161Z"},"links":{"cited_paper":"/paper/2504.19894","citing_paper":"/paper/2604.10456"},"observation_digest":"sha256:88cfb2bf7ebdd66f8e85e00d330cccf1a139fc51846f7e2ebceb290ca180b0cf","observation_id":"c7142bfa-8b64-4021-8072-02793df7d915","resolution":{"observed_at":"2026-05-11T10:31:00.390054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.19894/citation-record","integrity":"/paper/2504.19894/integrity","json":"/paper/2504.19894/citation-record.json","paper":"/paper/2504.19894"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.775482Z","title":"The anatomy of video editing: A dataset and benchmark suite for ai-assisted video editing","venue":null,"work_id":"23423449-8ddf-4fa5-bb4c-f7df14760d13","year":2022},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.666099Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:ee9945aa8d4cccbd9d60d03aa155380fa0d39c814e06e6ec02da0d03b6441dc7","observation_id":"0b502b63-4c88-4aca-9748-f81ea48840f1","resolution":{"observed_at":"2026-08-16T05:46:47.781954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.758669Z","title":null,"venue":null,"work_id":"ccf8a314-04c8-49f4-8544-dead43df119c","year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.671442Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:0eef0d1905efde3841642789b74fa2bb173bf1a6c24f02256bbcc7440fab493a","observation_id":"66783202-b640-46e3-83c1-dfe00a91b558","resolution":{"observed_at":"2026-08-16T05:46:47.763697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-08-17T00:52:15.316289Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-16T05:46:46.676720Z","title":"Dream- sim: Learning new dimensions of human visual similar- ity using synthetic data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.676720Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:3af6acf46f1687fa81060bedc515507c231024296e1b169ff8952720b60e1cac","observation_id":"521a1018-fb4f-4e07-bb3f-581f267278dd","resolution":{"observed_at":"2026-08-16T05:46:46.676720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.739524Z","title":"Videostu- dio: Generating consistent-content and multi-scene videos","venue":null,"work_id":"2cfd5f88-27e6-41c2-86d1-a875c83a10c8","year":2024},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.683037Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:7a4a5dd64af06afc1683e115fcc17b3a42870516ae466434d1351f5948a9a187","observation_id":"c5499d7a-38a6-4e65-843a-e9ee580f5058","resolution":{"observed_at":"2026-08-16T05:46:47.745539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-16T05:46:46.688134Z","title":"Seed-x: Mul- timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.688134Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:c8b65aaec9ae6b99de99f1543d2f6017811bd3b91c187ba6cf4f2b63ee76189c","observation_id":"717d6a37-dddc-48ef-8e27-99439a6f5d71","resolution":{"observed_at":"2026-08-16T05:46:46.688134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T05:46:46.693345Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.693345Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:e09eda1ad29604dc98b310a3c1b6729e10071e18651d343f13171711a7842611","observation_id":"71b5541b-a46b-4be5-a771-9ab958af8dfe","resolution":{"observed_at":"2026-08-16T05:46:46.693345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:46.698197Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.698197Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:b1353300a9d20f9149e0fab1c1a9ef568000b136779b86c3215927917dbb5f8f","observation_id":"28d3fdf9-d8fa-41bc-aa13-fdac206abecb","resolution":{"observed_at":"2026-08-16T05:46:46.698197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-16T14:39:31.347488Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-16T05:46:46.703321Z","title":"Shot2story20k: A new benchmark for comprehen- sive understanding of multi-shot videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.703321Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:0848e781238e2ac2de81454c6f32f56d672dcfc433fce05f30899823578a19c0","observation_id":"1f2d2717-0b01-48cd-a7f3-00a5d09e097d","resolution":{"observed_at":"2026-08-16T05:46:46.703321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:46.708569Z","title":"CLIPScore: a reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.708569Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:68148b90d83cee58a256d29d39b002fb57bc1b2695157355fd8820492c697993","observation_id":"92f5a18f-f019-470c-86f5-099026f1cee3","resolution":{"observed_at":"2026-08-16T05:46:46.708569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.693093Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"dcc79de7-50be-432b-879e-13bdb26b870a","year":2020},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.713675Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:e92134c69577bd19c642db52ae53b1f0b0e63ed7686a7970b44a9e75a8b7cdbf","observation_id":"67289621-c0de-4394-8da9-36441f7508a1","resolution":{"observed_at":"2026-08-16T05:46:47.698475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.675777Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"62e91e1d-91fd-4550-bf74-1121fb8dc785","year":2022},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.718671Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:2552a32f8b556eec575cff28cb8578de46cc91ee56684dbe7ed3adc72adab040","observation_id":"a3edd0a5-063d-4507-809f-a6c4e3dcaf12","resolution":{"observed_at":"2026-08-16T05:46:47.681219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23775","last_updated":"2024-11-05T06:41:27Z","snapshot_observed_at":"2026-08-17T23:31:59.305347Z","submitted_at":"2024-10-31T09:45:00Z","title":"In-Context LoRA for Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23775","snapshot_observed_at":"2026-08-16T05:46:46.724060Z","title":"In-context lora for diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.724060Z"},"links":{"cited_paper":"/paper/2410.23775","citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:b8e44e1b6574fa27e5eea1735f3a3fb4133b605aab3a9fe3b379b5be68ea49ac","observation_id":"3a850ad1-ee88-49ed-9ab4-a1c80b80cdf2","resolution":{"observed_at":"2026-08-16T05:46:46.724060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.658927Z","title":"Movienet: A holistic dataset for movie under- standing","venue":null,"work_id":"3bf1276a-decd-45df-aa3b-b71225d39d5a","year":2020},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.729349Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:700bf3331f2610c11696a6cd254c4ef548bfa07736b91eb7c04fd13840d2cea6","observation_id":"c973308e-7579-4410-82eb-bd9b2aa49cf4","resolution":{"observed_at":"2026-08-16T05:46:47.664194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:46.734327Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.734327Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:36a6093909c8dae82e3c0179ac7ea3c8b89c1445437be13e9403e2d16ef8793d","observation_id":"fd877680-f7c4-419c-be2e-3e137113eb59","resolution":{"observed_at":"2026-08-16T05:46:46.734327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T05:46:46.740030Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.740030Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:cd174a0a8522c52024dba682bbd74dbe2bc6e44482bb1ac5103defa0f5e15832","observation_id":"3539c40d-4c94-43fe-910d-92e1c30e9153","resolution":{"observed_at":"2026-08-16T05:46:46.740030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:46.745527Z","title":"Storygan: A sequential conditional gan for story vi- sualization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.745527Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:ac27c77c6cd83e09be9e0d18f19a2f3c3ed3c2c52c10cd3ab2d46bf5d9e7dca2","observation_id":"15ce7069-9f2a-4612-af4c-a8cc2d315a22","resolution":{"observed_at":"2026-08-16T05:46:46.745527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.620603Z","title":"A lightweight weak semantic framework for cinematographic shot classification","venue":null,"work_id":"75a3cd00-0c37-4506-b751-16f65b0c04df","year":2023},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.750857Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:77e4b057824020bff0808292d0408a84e949cf4c425243e9907abdfdb2b99047","observation_id":"b7715806-5851-4823-ba96-7e489e199f3c","resolution":{"observed_at":"2026-08-16T05:46:47.626161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-17T17:58:35.312920Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13554","snapshot_observed_at":"2026-08-16T05:46:46.755933Z","title":"One-prompt-one-story: Free-lunch consistent text-to-image generation using a single prompt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.755933Z"},"links":{"cited_paper":"/paper/2501.13554","citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:6736dfaf4c8b9937e18668a574c8eead850c1c7b2ef0a0e9ec0efa211a0416ef","observation_id":"bbae49f9-15e9-443d-b8a4-0257c2492d3d","resolution":{"observed_at":"2026-08-16T05:46:46.755933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.603586Z","title":"Storydall-e: Adapting pretrained text-to-image transformers for story continuation","venue":null,"work_id":"a783e6ac-ab87-4e55-9996-951d4996f832","year":2022},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.760997Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:b17b5bcddfcef8d9909ee19da60fe59e844919b37f4d882cbaf88b7f5d966950","observation_id":"4986f0b4-8334-4734-84ab-c4d7fe8a5b5c","resolution":{"observed_at":"2026-08-16T05:46:47.609020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.587578Z","title":"Ac- tions in context","venue":null,"work_id":"ac59d3cc-74a5-48f2-92f4-0163bbbc5003","year":2009},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.766790Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:fb5e490d45474c1e17d96a5022d20fbdb206f50472e334a824be90240d1a28d1","observation_id":"a8565a7c-8d78-409a-9a0b-d9175381b27b","resolution":{"observed_at":"2026-08-16T05:46:47.592707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.571862Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":"864ef5db-08a0-4bf4-9035-3ec576bdd482","year":2023},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.771359Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:62c9a9d4b6e9bf33d609ea61061fa50177f56361f1af4ea68184c141fc74c659","observation_id":"844f1d83-0fa8-40ef-ba07-6309e27cfb92","resolution":{"observed_at":"2026-08-16T05:46:47.576319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:46.776085Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.776085Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:54940be4a0e2caff39ba5329acc7af3caccf89bbb1d2e8aa7a62089ef2ae6291","observation_id":"1f644dd6-661c-4d78-99e6-15b9d8e4bfc0","resolution":{"observed_at":"2026-08-16T05:46:46.776085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.545225Z","title":"A unified framework for shot type classification based on subject centric lens","venue":null,"work_id":"7175d286-92f9-41b8-999e-deb6ecd06c65","year":2020},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.781187Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:9bf47580064d740a3cbbe8f5121023248a3ba21360f2df871c0409f40fda711f","observation_id":"260b71a9-4b5a-4359-b873-18065db22b6b","resolution":{"observed_at":"2026-08-16T05:46:47.550252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.528854Z","title":"Movie description","venue":null,"work_id":"7d87802f-bf42-4a56-8dc7-6e9b3294322a","year":2017},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.786813Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:fa62e55096a44639e4ec3877eb7d4d31d37280b0f190f55cab32bd49798a4977","observation_id":"40391337-3c48-4b65-9b99-435d170a484d","resolution":{"observed_at":"2026-08-16T05:46:47.534548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:46.791777Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.791777Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:b7ad8d8b4d18b3517120af3934abbfa1cecc029bf7e99a59408974d67b7ec169","observation_id":"7cdbf0d8-3242-4f30-a46b-5d790416180a","resolution":{"observed_at":"2026-08-16T05:46:46.791777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.503220Z","title":"Cinescale: A dataset of cinematic shot scale in movies","venue":null,"work_id":"d7a5922f-c072-474d-b5a1-7ef0737ce395","year":2021},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.796596Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:ca94d77a1f2461e362a4cdbb793e350d6d5c916d53f12ecfe0ea2467411b4cc1","observation_id":"8ff018f8-d535-427e-9b8a-423c7e822d1a","resolution":{"observed_at":"2026-08-16T05:46:47.508149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01572","last_updated":"2025-02-05T02:44:42Z","snapshot_observed_at":"2026-08-17T09:25:55.758278Z","submitted_at":"2025-02-03T17:55:30Z","title":"MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01572","snapshot_observed_at":"2026-08-16T05:46:46.801330Z","title":"Makeany- thing: Harnessing diffusion transformers for multi- domain procedural sequence generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.801330Z"},"links":{"cited_paper":"/paper/2502.01572","citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:aae49d01c2e04d2a65b1870c65dcc3c1e3bdaac4c2bb5961fae2e25f92dac359","observation_id":"e8ec263a-0240-437d-905e-534b3b71a9be","resolution":{"observed_at":"2026-08-16T05:46:46.801330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.488342Z","title":"Movieqa: Understanding stories in movies through question- answering","venue":null,"work_id":"0e3e8fe1-05ae-491a-be59-20147f4abf51","year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.806754Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:7e3d3015a812564697490001e2315b7e50062ada18908500834052dddc93fc93","observation_id":"308cefbb-eebd-4f47-b12e-dd6ea59d9f06","resolution":{"observed_at":"2026-08-16T05:46:47.493434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.472146Z","title":"Training-free consis- tent text-to-image generation","venue":null,"work_id":"293827b9-8431-4344-a5fc-a8dd45ce91b5","year":2024},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.813016Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:0756542ed986f56ee297b153663f07d4374574dfc9e67dd6078f8223ea944ce7","observation_id":"0a4e2217-7e62-43b9-ab8d-776d017b2938","resolution":{"observed_at":"2026-08-16T05:46:47.477984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.455855Z","title":"Thinking like a director: Film editing patterns for virtual cinematographic storytelling","venue":null,"work_id":"300a66c1-851b-47bb-8637-a16ac2b9db41","year":2018},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.818792Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:aad638fe44bbe6fa2313553fe1188c7efc270e0156b93c6446f1c705277d7512","observation_id":"3007bb3e-934c-484f-b3b5-5be6b687ceb2","resolution":{"observed_at":"2026-08-16T05:46:47.460977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15909","last_updated":"2024-04-24T15:03:53Z","snapshot_observed_at":"2026-08-16T13:58:11.363677Z","submitted_at":"2024-04-24T15:03:53Z","title":"Learning Long-form Video Prior via Generative Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15909","snapshot_observed_at":"2026-08-16T05:46:46.824001Z","title":"Learning long-form video prior via generative pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.824001Z"},"links":{"cited_paper":"/paper/2404.15909","citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:14440b703441847fdeb4865ce6d95ad15c26583aff314c56d46aa121d4d952c2","observation_id":"77fa39e0-840b-4b69-a0f8-33ccff389edd","resolution":{"observed_at":"2026-08-16T05:46:46.824001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-16T05:46:46.829185Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.829185Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:9ca5296e124f97c768f3e3d9e9c4b0380ff86348130d2bfae000022a42ccc65d","observation_id":"1efc7f86-ed1f-4538-99f3-e94b789b7669","resolution":{"observed_at":"2026-08-16T05:46:46.829185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-16T13:35:00.531280Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-16T05:46:46.835013Z","title":"Seed-story: Multimodal long story generation with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.835013Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:dc80fd2fa0145a54d569075fbb003f64b83712eb98f3ea3f954dcc17be8e46c0","observation_id":"1b6bf300-0782-4bd2-a95d-d118452250fe","resolution":{"observed_at":"2026-08-16T05:46:46.835013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:46.840197Z","title":"Moviedreamer: Hierarchical generation for coherent long vi- sual sequence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.840197Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:1387d6d61571922a2b7097c10f758b4383c4f134a6453411e763b42e947fb0e3","observation_id":"13ee55fa-b0de-42d2-b37d-e16038fd7890","resolution":{"observed_at":"2026-08-16T05:46:46.840197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.436642Z","title":"Storydiffusion: Consistent self- attention for long-range image and video generation","venue":null,"work_id":"7baa5ce5-d3fc-459e-969b-3443b90f3b99","year":2025},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.845033Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:974f102bf303169ddaaa2ef82127c7da83520e145848205bcb7feed30ada2f3c","observation_id":"04e02bf3-8ec7-4010-87c9-a4c67a94af58","resolution":{"observed_at":"2026-08-16T05:46:47.442756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.419906Z","title":null,"venue":null,"work_id":"7563b536-d182-43dc-b65c-86e6e6be8f83","year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.850405Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:558d6351cde7d8af5382bbf1e918e5be2279323d80d8a7f9eb0ffcb29cc24b83","observation_id":"cbaaf16a-c420-4b54-97a8-daf78e6c101e","resolution":{"observed_at":"2026-08-16T05:46:47.424902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.404495Z","title":"halo\" device around the<Culprit>'s head, [SHOT-3] close-up shot of the","venue":null,"work_id":"732289c7-b525-4686-8077-f53198c867b9","year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.855577Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:159ff62d40498535c6f69c57c42b0aa4f3baa4505e11a61860e5bf50ef85e2fd","observation_id":"dd2afc8e-d6f2-43db-86bc-c8075da4d426","resolution":{"observed_at":"2026-08-16T05:46:47.409516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.385405Z","title":"* Shot Details: Evaluate how accurately each keyframe reflects the detailed descriptions provided for individual shots","venue":null,"work_id":"9d5c9ce5-e9f0-4598-9857-6b58c3f01c1e","year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.860933Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:fdaa0e2629f085e6f920104651b1f7321f59b7637e332c64a141b553d27f2f36","observation_id":"0c6c6b87-04b5-4f9d-995c-a36cd8cf37a3","resolution":{"observed_at":"2026-08-16T05:46:47.392966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.366683Z","title":"* Background Consistency: Verify that the backgrounds, although possibly shown from different perspectives, clearly indicate the same location","venue":null,"work_id":"443baa88-eaf9-4913-a7e7-88c5e53d8cb5","year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.865582Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:f481b97ef68ceecc169bd2453f77525e7ea8f784020177d30fd2e7a0f1fa3ccc","observation_id":"60c831e7-deed-4ceb-9751-8f10aef22e6f","resolution":{"observed_at":"2026-08-16T05:46:47.372937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.348872Z","title":null,"venue":null,"work_id":"50cbda57-9d98-489a-bc6d-a687c34aba98","year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.870027Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:500d17311e609c1c8d034cf2c6a18ca77e2c98c278cc2211d986bdbdcebd0298","observation_id":"2c44f707-becd-4efb-83d2-3386ff30f171","resolution":{"observed_at":"2026-08-16T05:46:47.354495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.331665Z","title":null,"venue":null,"work_id":"b339ad9d-f1bf-4fd3-b617-b0f9ba1c0a43","year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.874828Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:7945756c12e9105da587683540c53e03ad73670ec8148d970eceedfa6bcb297d","observation_id":"310a80ce-5761-40b4-a90c-4f3d851e7a95","resolution":{"observed_at":"2026-08-16T05:46:47.336725Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.312080Z","title":null,"venue":null,"work_id":"ab31512f-c22b-464e-b7a7-0fb59e9f5384","year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.879476Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:655e9cd890dae6c581d40ed46b55ce95ce79aeb75c10a8b78b33c8cef18f648a","observation_id":"7946a017-24c0-48e3-a5b7-e638acc83227","resolution":{"observed_at":"2026-08-16T05:46:47.317059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:46:47.291320Z","title":"Evaluation instruction prompt","venue":null,"work_id":"947adf23-6198-47a7-a675-f7ac91a5a7d2","year":null},"citing_paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:46.884251Z"},"links":{"citing_paper":"/paper/2504.19894"},"observation_digest":"sha256:7b513e86dbf28de5f3dd6a9d1f3488f7b65def9ddd0bd5c67537b1402b3359b5","observation_id":"2cdbac2f-12d9-4231-9f8b-6216e47e0c34","resolution":{"observed_at":"2026-08-16T05:46:47.298381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.19894","last_updated":"2025-04-28T15:28:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T01:50:51.373925Z","submitted_at":"2025-04-28T15:28:14Z","title":"CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2504.19894."}