{"as_of":"2026-08-11T00:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:116b8eca2e50d83b37e1707e1bd8373e8496fe5ba72f8bb919e5da1e5bb3971c","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:52:24.986017Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:39:33.443014Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T16:39:34.724653Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"cited_work":{"arxiv_id":"2505.20827","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20827","snapshot_observed_at":"2026-08-06T16:39:34.724653Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","venue":"cs.CV","work_id":"754c9ce9-ac48-4861-a9b2-ec051c8e8b59","year":2025},"citing_paper":{"arxiv_id":"2507.12952","last_updated":"2025-07-17T09:46:43Z","snapshot_observed_at":"2026-08-07T11:02:23.505503Z","submitted_at":"2025-07-17T09:46:43Z","title":"LoViC: Efficient Long Video Generation with Context Compression","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-06T16:39:33.443014Z"},"links":{"cited_paper":"/paper/2505.20827","citing_paper":"/paper/2507.12952"},"observation_digest":"sha256:fab6e7a0867e9a5cbaed51d094456ef2feafe5a05bdbc379a108d341a4b7b945","observation_id":"672da83a-bf59-448e-b9c2-ffe3a00488e4","resolution":{"observed_at":"2026-08-06T16:39:34.798842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20827/citation-record","integrity":"/paper/2505.20827/integrity","json":"/paper/2505.20827/citation-record.json","paper":"/paper/2505.20827"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:28.365288Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":"24cf9388-e95a-4acc-9e58-f3b26a77c6c3","year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:20.619862Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:5a69627a8621eb9047f27df423b6e50ff77360ed159aa008069097e2f510c7f7","observation_id":"326a447c-60ba-46d3-a187-c57f939e92e8","resolution":{"observed_at":"2026-08-07T13:52:28.475980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:52:20.736392Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:20.736392Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:31ff487e737b8273562f8a8c4cceec86c3907aa5e615eaaab0318c6d29dac4e0","observation_id":"d58735dd-48a3-4813-89ea-9807fa66f72b","resolution":{"observed_at":"2026-08-07T13:52:20.736392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:20.841396Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:20.841396Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:d7bfa6b68990f54e498826138592a797aee781347d94d6c1282dc9b48f927129","observation_id":"a57090df-d86f-46bc-bfce-6382860c7b8d","resolution":{"observed_at":"2026-08-07T13:52:20.841396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:20.907024Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:20.907024Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:ddd368d59caaf2f2b675a277578bfd7c6409f376bbfa2d9734d22e98397ac7e5","observation_id":"1d51cc5a-4ff0-4606-a8f0-7645f5a55768","resolution":{"observed_at":"2026-08-07T13:52:20.907024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:28.145922Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"5f9abe1e-c801-4192-baea-be12c680524c","year":2015},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:20.983081Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:0645dbb33c8500941b44a7253bf9d0144bcb340c72ae56a96f9ae15254662e70","observation_id":"44bba26c-5ef4-4aac-a2ab-af2857f75a54","resolution":{"observed_at":"2026-08-07T13:52:28.241900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:21.064096Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.064096Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:ae127495461b2f2d18517d7012d3ad59b11db3b9836f05bb9899c4e6a5d9b246","observation_id":"c3721de0-7be4-461d-a563-a61dbd409232","resolution":{"observed_at":"2026-08-07T13:52:21.064096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-07T13:52:21.230585Z","title":"Skyreels-v2: Infinite-length film generative model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.230585Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:b9a8b7ea59fa6de14e03b2c3dfbe23f7b926694196b175cf0d9abd0f4bbac77a","observation_id":"3038fb96-a49c-4bb0-a81f-681711bf0412","resolution":{"observed_at":"2026-08-07T13:52:21.230585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:27.982064Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"3560005e-4dbc-4c38-91dd-2e2fca114de7","year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.313961Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:da3d47e60f466bf905edaf3aadf18d85219a04dcb3d1e297c7e26455b15fa426","observation_id":"f2cd86fe-fcb3-4001-a2cc-2ac94e8811e4","resolution":{"observed_at":"2026-08-07T13:52:28.033266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:27.819022Z","title":"Learning temporal coherence via self-supervision for gan-based video generation","venue":null,"work_id":"a677b598-2a29-4eb5-8773-727b2b06894e","year":2020},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.429053Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:4988ea94658a063945950ef65bcf0b5fbfcbcf0adfda7a9937e9511d0afc2655","observation_id":"b2f7a23e-1389-4327-b6fa-4601eda84a77","resolution":{"observed_at":"2026-08-07T13:52:27.875131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:27.669453Z","title":"Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"f798df6d-bd21-48de-abee-fe0ea865718f","year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.543209Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:0c1edb21f8a8303f779f56a02222e4ae24c867c304e2f7a683e95bfd0dbd55bc","observation_id":"15b9771c-e22f-4231-adeb-d36464455b75","resolution":{"observed_at":"2026-08-07T13:52:27.757449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T13:52:21.675607Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.675607Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:a647a32e851b62ba3e8a0e5f10ae621d6b0fb8b31e1e0204b137077657ee6a05","observation_id":"fa7f08fb-4ff9-4ff0-b7f1-7d20d9a4f1f1","resolution":{"observed_at":"2026-08-07T13:52:21.675607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-07T17:06:18.944213Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-07T13:52:21.800462Z","title":"Long context tuning for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.800462Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:9fc2cc10b4b0c1cacfab3a33ba769b46187cc4f924199d2c0d323a647a0b2f8a","observation_id":"b625c430-1f3c-43d7-ab62-2dd8f00864fd","resolution":{"observed_at":"2026-08-07T13:52:21.800462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-09T14:37:44.086189Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-07T13:52:21.866461Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.866461Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:bf596f740b9dddc31dbb75363b07a9d946fe838c075ef948b8a97a63dbfd3396","observation_id":"80296d13-3267-4b87-99b6-ede1ccec4070","resolution":{"observed_at":"2026-08-07T13:52:21.866461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:27.524620Z","title":"Autoregressive diffusion models","venue":null,"work_id":"c8152d05-1fcc-4087-9cd6-06e6a264139c","year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.937109Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:94c43ff378095b029b31bb737ae59b560a1016ba40ac6e062ce765c74c3d9ea1","observation_id":"438697a2-2e0d-43c2-b8ab-abc715c43277","resolution":{"observed_at":"2026-08-07T13:52:27.602519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11251","last_updated":"2025-03-14T10:01:55Z","snapshot_observed_at":"2026-08-09T05:35:15.000362Z","submitted_at":"2025-03-14T10:01:55Z","title":"Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11251","snapshot_observed_at":"2026-08-07T13:52:22.021206Z","title":"Step-video-ti2v technical report: A state-of-the-art text-driven image-to-video generation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.021206Z"},"links":{"cited_paper":"/paper/2503.11251","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:2ddd0c4b6f73443c2638e8e21656c88d7d6613360ab3474f3748b73ea8e32e77","observation_id":"8b9fdd70-f981-4764-a3ae-3e19a022e48e","resolution":{"observed_at":"2026-08-07T13:52:22.021206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11473","last_updated":"2024-11-03T12:40:41Z","snapshot_observed_at":"2026-08-10T11:24:16.483474Z","submitted_at":"2024-05-19T07:48:41Z","title":"FIFO-Diffusion: Generating Infinite Videos from Text without Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11473","snapshot_observed_at":"2026-08-07T13:52:22.117866Z","title":"Fifo-diffusion: Generating infinite videos from text without training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.117866Z"},"links":{"cited_paper":"/paper/2405.11473","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:115fcc64cfe8004ee7276cbafc89129bb702484dce3bc13a5cbe94a885fbd42c","observation_id":"b13f9e56-6b9f-4ea2-a976-c9b6e453d8ee","resolution":{"observed_at":"2026-08-07T13:52:22.117866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T13:52:22.237972Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.237972Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:7bdaf16c7f20170a4e4e405477db18b5f6e0869225ae499d8b6e80ece21275ee","observation_id":"d12f45af-4f3b-4d6f-9679-3cce42ef9b65","resolution":{"observed_at":"2026-08-07T13:52:22.237972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16407","last_updated":"2024-03-25T03:47:53Z","snapshot_observed_at":"2026-08-10T15:44:10.785685Z","submitted_at":"2024-03-25T03:47:53Z","title":"A Survey on Long Video Generation: Challenges, Methods, and Prospects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16407","snapshot_observed_at":"2026-08-07T13:52:22.315530Z","title":"A survey on long video generation: Challenges, methods, and prospects, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.315530Z"},"links":{"cited_paper":"/paper/2403.16407","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:acbfb06a4c30b6851f68b52a0d9f0d75cd8d6ad99eb6db6b97d6a96a3eed9c8e","observation_id":"a307adf3-e2ac-4d93-8f34-e9cdbdb6e240","resolution":{"observed_at":"2026-08-07T13:52:22.315530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-08-07T13:52:22.397770Z","title":"Unified video action model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.397770Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:5ac3c5f80627ee4242ddbe55d2d0ed25ae707bd31b70db4b8ddd50c8735fde73","observation_id":"c4852276-2f62-44ff-88f6-1bece02499fe","resolution":{"observed_at":"2026-08-07T13:52:22.397770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-09T23:28:59.299375Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-07T13:52:22.472441Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.472441Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:1d854ab9beb7d0679e74d10031196a590f30da6a868bb50f9075e90849ab0f34","observation_id":"4ecca3c2-367f-4ce3-a333-0d009eac451e","resolution":{"observed_at":"2026-08-07T13:52:22.472441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:27.332896Z","title":"Videostudio: Generating consistent-content and multi-scene videos","venue":null,"work_id":"645760cd-3d49-4287-a673-1b24b657c2a8","year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.546815Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:8c9b03e4613fd73af18d41838732d50d875a7fcbf6ff427e52d11371cfa16e33","observation_id":"a076bb32-7a26-45d0-a597-80329400b0b5","resolution":{"observed_at":"2026-08-07T13:52:27.452934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-07T13:52:22.696814Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.696814Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:50a64ba72633d9c5a51836d13de63c7f1cceb3ca4405d8ab6ab628720b4256a3","observation_id":"e8eed2f6-a220-4570-a159-41bfa82eb6c3","resolution":{"observed_at":"2026-08-07T13:52:22.696814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:27.101673Z","title":"Mevg: Multi-event video generation with text-to-video models","venue":null,"work_id":"a637dea2-a968-41ec-9338-cce3a71b26b3","year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.790070Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:95ec1290d981824ff0effef8b9c4c389bcfc487ccac794a926ef45ebc50094a7","observation_id":"e77a915f-003e-4247-86e2-ad20030aba1a","resolution":{"observed_at":"2026-08-07T13:52:27.206936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:22.881341Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.881341Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:52a6bb267ff661c0674045e18e543855a4e9d7e772cd99eb7d15d0a95da24c2a","observation_id":"c9b86993-63dc-4c26-ba95-210aa7a8b470","resolution":{"observed_at":"2026-08-07T13:52:22.881341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19881","last_updated":"2025-03-25T17:46:50Z","snapshot_observed_at":"2026-08-07T16:37:42.099795Z","submitted_at":"2025-03-25T17:46:50Z","title":"Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19881","snapshot_observed_at":"2026-08-07T13:52:22.951099Z","title":"Mask2dit: Dual mask-based diffusion transformer for multi-scene long video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.951099Z"},"links":{"cited_paper":"/paper/2503.19881","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:2bbc644603ac8e3f8a0914fc2c8b5fc3ca40342a5e59ead39ed61f74e3d11864","observation_id":"f227f7fc-c4cc-4f16-ad55-e6e0e7674011","resolution":{"observed_at":"2026-08-07T13:52:22.951099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:26.843550Z","title":"Freenoise: Tuning-free longer video diffusion via noise rescheduling","venue":null,"work_id":"f486a23e-ffa5-4ef7-99f1-4ca92ddb66bb","year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.997892Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:540dba6e8f72d33477b1a26525b1e55ea50448030e413dc660772eadf7da3ccd","observation_id":"2cb4abcb-3de5-4d37-a93b-5e1a93019b13","resolution":{"observed_at":"2026-08-07T13:52:26.911330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-08-09T05:24:50.195241Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-07T13:52:23.076920Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.076920Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:7118062e08595026d06c282fd36f6698b552520fc4a4528feede3fb43886ec14","observation_id":"c69b16a1-53d6-411e-920f-de6d91f91e68","resolution":{"observed_at":"2026-08-07T13:52:23.076920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:26.661814Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"d3bd9cbf-5b19-41fe-807b-3f0c2e30f54f","year":2022},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.143892Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:e54262f813fc00acb9af4ae79bf10f6a46336d56cf5d349339a19707aca4c49a","observation_id":"70b1d677-ea3a-4e73-802a-d1c568ef8139","resolution":{"observed_at":"2026-08-07T13:52:26.761609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14065","last_updated":"2024-02-05T01:29:35Z","snapshot_observed_at":"2026-08-08T07:47:25.519307Z","submitted_at":"2023-04-27T09:52:35Z","title":"Lightweight, Pre-trained Transformers for Remote Sensing Timeseries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14065","snapshot_observed_at":"2026-08-07T13:52:23.239488Z","title":"Lightweight, pre-trained transformers for remote sensing timeseries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.239488Z"},"links":{"cited_paper":"/paper/2304.14065","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:b756f23af94d86ecc0aafc6f7e9681606352478bd4d1222879ee22bc8bc67d58","observation_id":"212a9cf1-50d9-48f8-bbad-7a0f8af8487d","resolution":{"observed_at":"2026-08-07T13:52:23.239488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:26.418829Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":"d0ed9920-f4f8-44a2-9e03-987e5c3a9229","year":2018},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.335228Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:0f075397243ee862ce3cabe61bf84c8f40570c8d821db8fca9428cd6f7587946","observation_id":"a1d42ff8-58c3-4633-ba3c-39b2f7a4c21f","resolution":{"observed_at":"2026-08-07T13:52:26.532001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T13:52:23.434779Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.434779Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:6fb922e3bbc1606289d0c78b673b4f5834f3e324c62cd75d249197a9d21610be","observation_id":"55bd74b1-3bf0-40f5-9594-e1a9d0f0218d","resolution":{"observed_at":"2026-08-07T13:52:23.434779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08350","last_updated":"2025-05-17T00:50:44Z","snapshot_observed_at":"2026-08-09T10:48:05.916933Z","submitted_at":"2025-05-13T08:48:10Z","title":"STORYANCHORS: Generating Consistent Multi-Scene Story Frames for Long-Form Narratives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08350","snapshot_observed_at":"2026-08-07T13:52:23.548609Z","title":"Storyanchors: Generating consistent multi-scene story frames for long-form narratives, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.548609Z"},"links":{"cited_paper":"/paper/2505.08350","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:e22d1c234d05c5c5ce512c1ba5c659165b99521b9ee296ae9a63024ccab70b07","observation_id":"f999d2fb-6d40-4027-9760-581b287740b2","resolution":{"observed_at":"2026-08-07T13:52:23.548609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-09T05:07:43.219616Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-07T13:52:23.659573Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.659573Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:9fbef2e95f5d9b2b5a37a7989e12d078e452a6a8106f5a08142eecd51a06d765","observation_id":"d5bea886-b2d0-455b-af90-1c8903bcb576","resolution":{"observed_at":"2026-08-07T13:52:23.659573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-01T11:16:30.883699Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-07T13:52:23.736263Z","title":"Koala-36m: A large-scale video dataset improving con- sistency between fine-grained conditions and video content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.736263Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:5a0228944f5aefa3dfb54bee5973d898363e6a05bccef10d614c254e6edcd263","observation_id":"a5e26b97-9690-40db-85af-400913c64a0e","resolution":{"observed_at":"2026-08-07T13:52:23.736263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:23.833995Z","title":"Lvbench: An extreme long video understanding benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.833995Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:8ad82726e5afac9094f1db8cccf47f5276c278e9ffc33ba414e22a41c45ea58c","observation_id":"8ffd8aa8-5ad0-40cc-a4ae-1faf228dae00","resolution":{"observed_at":"2026-08-07T13:52:23.833995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10517","last_updated":"2024-03-15T17:57:52Z","snapshot_observed_at":"2026-08-10T13:01:51.637119Z","submitted_at":"2024-03-15T17:57:52Z","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10517","snapshot_observed_at":"2026-08-07T13:52:23.917757Z","title":"Videoagent: Long-form video understanding with large language model as agent, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.917757Z"},"links":{"cited_paper":"/paper/2403.10517","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:75ae57e4892a72e36de9e63fab26e292724f880db234a55d5a8e62f2b10f73ca","observation_id":"7246b089-de6e-49b3-9bd5-6dd77cde997e","resolution":{"observed_at":"2026-08-07T13:52:23.917757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:26.238349Z","title":"Vatex: A large-scale, high-quality multilingual dataset for video-and-language research","venue":null,"work_id":"fcce0fd0-642d-4a91-9e94-e14813cfc352","year":2019},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.045232Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:46a2e27594065a1e2da348fe477ca13f1c71e3f3121a92e98ff2f8e7a47b9768","observation_id":"0b4f6d54-734f-4648-98e3-9798e16b796c","resolution":{"observed_at":"2026-08-07T13:52:26.296919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:26.085507Z","title":"Imaginator: Condi- tional spatio-temporal gan for video generation","venue":null,"work_id":"0ae6e72b-d425-405a-9d59-1ea33a9686cf","year":2020},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.153790Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:aab522bdebf545376ec2fdf946fdc70d7b84cb0f95ecb067beaa5d26c334c90c","observation_id":"83bf8499-8c7c-4f69-83f8-60277cbbbae4","resolution":{"observed_at":"2026-08-07T13:52:26.128349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:24.252204Z","title":"Advancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.252204Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:bd039cdea23442d3a280608724b9c5e34cf03d8d360ac350c18e5c167ca62fd9","observation_id":"8e9afcf7-8ae4-48b7-97b1-71253170f820","resolution":{"observed_at":"2026-08-07T13:52:24.252204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01316","last_updated":"2025-03-29T08:56:56Z","snapshot_observed_at":"2026-07-06T20:00:05.118831Z","submitted_at":"2024-12-02T09:32:36Z","title":"Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01316","snapshot_observed_at":"2026-08-07T13:52:24.370109Z","title":"Long video diffusion generation with segmented cross-attention and content-rich video data curation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.370109Z"},"links":{"cited_paper":"/paper/2412.01316","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:dbde353212e0d0142ca610c7c3110f426dc7a113d951c50a8f7f7cc6b0fba6c8","observation_id":"40835e76-76e2-4297-bbc0-8aeaf401f988","resolution":{"observed_at":"2026-08-07T13:52:24.370109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T13:52:24.467700Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.467700Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:ffc076538f5a5c9656dc980aff9052e1303bf27d42a7266cd74700b898e2d335","observation_id":"1861851a-92b6-47e7-94ad-99d54fc6287e","resolution":{"observed_at":"2026-08-07T13:52:24.467700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:25.898637Z","title":"Merlot: Multimodal neural script knowledge models","venue":null,"work_id":"2a124b39-e283-48f1-ad99-156383d83378","year":2021},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.570316Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:b88c2bbe10c8aa5a5cc93f6aa275f8999a5e105456c4369e21db986a4085755e","observation_id":"f68c7dbf-cef9-4122-9acc-69273d4938b4","resolution":{"observed_at":"2026-08-07T13:52:25.994105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:24.643654Z","title":"Moviedreamer: Hierarchical generation for coherent long visual sequence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.643654Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:5b425543201b085ec559c9e2bf9e21c9f33aee98fed935144f5118b20c97a624","observation_id":"4cd00ff3-e07a-4ac9-b454-5e03a94706d1","resolution":{"observed_at":"2026-08-07T13:52:24.643654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-08-10T02:47:20.223653Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-07T13:52:24.723287Z","title":"Vbench-2.0: Advancing video generation bench- mark suite for intrinsic faithfulness, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.723287Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:de69e3d5de99940864dc9955ae39ae7808dcc3afb67011c9031bdf9c0a003e88","observation_id":"bfaca529-075e-4c00-81e6-caaaf624d3f9","resolution":{"observed_at":"2026-08-07T13:52:24.723287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:24.804117Z","title":"Videogen-of-thought: A collaborative framework for multi-shot video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.804117Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:abacb9b07e0f769cfe571ad054fe9a262771184bc11153f4aeeaa9fa4b29c7d9","observation_id":"1a69e4fa-55ef-4a37-bc3e-75fd0c59ff2a","resolution":{"observed_at":"2026-08-07T13:52:24.804117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:25.666657Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"64503f3d-a80e-4c5b-ac4c-da325302509c","year":2018},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.885503Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:394abf8af3bc54fb5d049b311c3fdc583f3b0a1953a87e0990507ca36b24190e","observation_id":"63da9f05-e6a4-45aa-a677-27469349e31c","resolution":{"observed_at":"2026-08-07T13:52:25.793585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:25.505530Z","title":"Storydiffusion: Consistent self-attention for long-range image and video generation","venue":null,"work_id":"e2b261d4-50d0-48de-b224-b202960c78e2","year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.986017Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:9967ea122dbab4233030d52749745c8cf206a441f24f677edf9cca5a8b3ad488","observation_id":"614f1169-0a76-4a97-82d3-70953de36695","resolution":{"observed_at":"2026-08-07T13:52:25.576965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2505.20827."}