{"as_of":"2026-08-09T22:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7830fc411316b8185a0f26d6148b321531532007b50ad188917498a4b13e94ad","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:44:03.931604Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T18:17:54.943863Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T18:17:55.117028Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"cited_work":{"arxiv_id":"2507.01945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01945","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longanimation: Long animation genera- tion with dynamic global-local memory","venue":null,"work_id":"20faf197-5d9f-4664-8ec1-11bbd71a8f52","year":2025},"citing_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-08-04T14:52:25.854038Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T18:17:54.943863Z"},"links":{"cited_paper":"/paper/2507.01945","citing_paper":"/paper/2512.04678"},"observation_digest":"sha256:0f209efdf8f79a8c31d8a16ad5ea34086f030fa7b478bc877ed70d1b512fccb0","observation_id":"4a4d34ff-8602-4496-9c66-5c01e7acaa49","resolution":{"observed_at":"2026-05-16T18:17:55.118925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01945/citation-record","integrity":"/paper/2507.01945/integrity","json":"/paper/2507.01945/citation-record.json","paper":"/paper/2507.01945"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-06T20:43:59.621124Z","title":"Training diffusion models with reinforce- ment learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:59.621124Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:32ca30e40e0da2452a101df422f88eb5b61558d81b22c59ded1e7e6a494b0efd","observation_id":"00f25352-b54c-4f45-8439-ad9e254dafd7","resolution":{"observed_at":"2026-08-06T20:43:59.621124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18597","last_updated":"2025-03-26T09:05:41Z","snapshot_observed_at":"2026-08-05T17:03:47.891638Z","submitted_at":"2024-12-24T18:51:19Z","title":"DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18597","snapshot_observed_at":"2026-08-06T20:43:59.732717Z","title":"Ditctrl: Exploring attention control in multi-modal dif- fusion transformer for tuning-free multi-prompt longer video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:59.732717Z"},"links":{"cited_paper":"/paper/2412.18597","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:8e048a84a10afcccc93ab6002a9d8d9a9c817e0f5354dc66fab3a5c949888a8a","observation_id":"c4eedb55-943f-46b7-9367-bc32b0de7f9e","resolution":{"observed_at":"2026-08-06T20:43:59.732717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:06.637760Z","title":"Learning to generate line drawings that convey geometry and semantics","venue":null,"work_id":"88692ee5-f681-4f0a-98de-1f13ea38e7ba","year":2022},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:59.846894Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:db72b6bdc5530d8991979a49d1777f6c1f6a6e0527ebe4fe01c47e7868900152","observation_id":"cc439907-a4b8-4d7d-9dcf-21fb86bdf8ea","resolution":{"observed_at":"2026-08-06T20:44:06.830589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02104","last_updated":"2024-12-03T02:54:31Z","snapshot_observed_at":"2026-07-06T20:00:37.331726Z","submitted_at":"2024-12-03T02:54:31Z","title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02104","snapshot_observed_at":"2026-08-06T20:43:59.901023Z","title":"Explainable and interpretable multimodal large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:59.901023Z"},"links":{"cited_paper":"/paper/2412.02104","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:be60ad5ab6d88e6c02768c7c72d6d6834d80471efa7acf813a42259ebdc43934","observation_id":"6f02e5a7-a4d0-4819-a23e-96ab81ce1ba8","resolution":{"observed_at":"2026-08-06T20:43:59.901023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:06.416047Z","title":"Re- inforcement learning for fine-tuning text-to-image diffusion models","venue":null,"work_id":"09610224-27ff-425b-a154-3cb1b66c0e2b","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.042250Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:0a3c2c2cf15ae902d08a7aeab516b3aa7d62286a01113935fb25c75f6a09778d","observation_id":"36123fe9-f56c-49ea-bfad-ce3e346c98f4","resolution":{"observed_at":"2026-08-06T20:44:06.487219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-06T20:44:00.121528Z","title":"Video-ccam: Enhancing video-language un- derstanding with causal cross-attention masks for short and long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.121528Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:daf0c1349cc73286dde92851cebeb491bc485100825ae3b44e452295d0555148","observation_id":"bb93b653-36b1-4e29-a744-433a9651ab04","resolution":{"observed_at":"2026-08-06T20:44:00.121528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-06T20:44:00.249078Z","title":"Ltx-video: Realtime video latent diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.249078Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:ae93c410f739e6f6d30aca1c8e8824311fc84be5cc70b1d566d3cdd4e142b7ad","observation_id":"251df458-85a0-45fb-bdfe-64df25ec0872","resolution":{"observed_at":"2026-08-06T20:44:00.249078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-09T14:37:44.086189Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-06T20:44:00.321655Z","title":"Streamingt2v: Con- sistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.321655Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:831a0bc35ee188b702e15eb561cd82565b47a7fe716022716671814789634979","observation_id":"8b95a9da-a355-40f2-a6f9-9a23a96dd17c","resolution":{"observed_at":"2026-08-06T20:44:00.321655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:00.395146Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.395146Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:31b84ea72f01db7aded66639bc85cb92f9411d774cef4a090f2212d3f2bce9cf","observation_id":"4fa334b5-a214-4127-bb87-b88ee039f7b1","resolution":{"observed_at":"2026-08-06T20:44:00.395146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T20:44:00.477581Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.477581Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:ab973dba1cddb017da2776c41ed6cf5e189ee09d03f6441d68aeb8346028e16b","observation_id":"cf4e2d1c-22da-461c-97af-ba5d821a63f1","resolution":{"observed_at":"2026-08-06T20:44:00.477581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23277","last_updated":"2024-10-31T18:03:51Z","snapshot_observed_at":"2026-07-06T19:42:25.742756Z","submitted_at":"2024-10-30T17:55:52Z","title":"SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23277","snapshot_observed_at":"2026-08-06T20:44:00.572745Z","title":"Slowfast-vgen: Slow- fast learning for action-driven long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.572745Z"},"links":{"cited_paper":"/paper/2410.23277","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:bdafb64210785f25d75709571bc6e2f32d6b96f85ac4a089f23ed17d050b4f26","observation_id":"07da051e-fc5f-43b6-8cd7-41a0a3009c79","resolution":{"observed_at":"2026-08-06T20:44:00.572745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:00.669451Z","title":"Lvcd: reference-based lineart video colorization with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.669451Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:93ce397cc971b1e3d352b5642b3431597dfe4932f6f9740de679ab97ec444037","observation_id":"1ac5451d-c6a8-4109-ad23-047be7e6a172","resolution":{"observed_at":"2026-08-06T20:44:00.669451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:06.222862Z","title":"Dˆ 2it: Dynamic diffusion transformer for accurate image generation","venue":null,"work_id":"7265a960-0742-4717-a8b7-019309a44224","year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.738720Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:363226845eb56c9852017866108c97e19d714bffb398893c53312e3ed76859c4","observation_id":"d5644349-a2dd-44f8-bb8c-c175d3b0fbd4","resolution":{"observed_at":"2026-08-06T20:44:06.319724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T20:44:00.826789Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.826789Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:e5cdda1a9f769de2c91dded274d4bb56b226cf306ef8c0de47ebc996774ae5a2","observation_id":"34d52832-099f-4295-bdcd-744cd7b7b786","resolution":{"observed_at":"2026-08-06T20:44:00.826789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:06.075057Z","title":"Parrot: Pareto-optimal multi-reward reinforce- ment learning framework for text-to-image generation","venue":null,"work_id":"aac821da-2304-4d8e-bebb-4afd7b20a055","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.900950Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:6bbcb8c4e4175163859d2ccc431a4fa7807ffd0fbb52e943de594a42e657b43a","observation_id":"04f3d7b5-9bf9-4139-9457-a78c993db9f5","resolution":{"observed_at":"2026-08-06T20:44:06.124611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:00.992058Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.992058Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:681ceb78daa2504e801c2b5cbbc77c42023280f23053fe13fa623273198c7e7e","observation_id":"3b6e2d5a-4e97-497a-81dd-5d23077180f5","resolution":{"observed_at":"2026-08-06T20:44:00.992058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:05.830829Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"48b2fa90-2388-4234-8fc8-c628671ff17a","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.085013Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:45c1847a863d557724d90c0cc94f1d74786ddab8216c495ba34bf8c31183e7d1","observation_id":"2fc64a55-c5f3-43f2-bf47-f1c1f02f1c50","resolution":{"observed_at":"2026-08-06T20:44:05.915619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T20:44:01.201211Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.201211Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:bcb8ffd419bc7d1842a95c717fd86ae888e641d937968c633a4d5b78488599ab","observation_id":"3c9d6383-e9ec-4e90-bd01-65d812cad34d","resolution":{"observed_at":"2026-08-06T20:44:01.201211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10406","last_updated":"2025-07-20T08:44:35Z","snapshot_observed_at":"2026-08-07T17:06:58.996059Z","submitted_at":"2025-03-13T14:31:52Z","title":"RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10406","snapshot_observed_at":"2026-08-06T20:44:01.273125Z","title":"Realgeneral: Unifying visual generation via tempo- ral in-context learning with video models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.273125Z"},"links":{"cited_paper":"/paper/2503.10406","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:62d02f9482fdca92db28e2dabd77c048a047bc4e51016966a149b88c99f909a0","observation_id":"0c6ece53-9425-423a-b191-8fd2a77041cb","resolution":{"observed_at":"2026-08-06T20:44:01.273125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19918","last_updated":"2024-07-29T11:52:07Z","snapshot_observed_at":"2026-07-06T18:53:18.201717Z","submitted_at":"2024-07-29T11:52:07Z","title":"FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19918","snapshot_observed_at":"2026-08-06T20:44:01.344606Z","title":"Free- long: Training-free long video generation with spectralblend temporal attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.344606Z"},"links":{"cited_paper":"/paper/2407.19918","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:1f8b68fe7799017332e8927ae23fab065d35ace5f59c416d7c3ca297d367f27b","observation_id":"d1f57265-4aea-479b-8832-6c41368a66d8","resolution":{"observed_at":"2026-08-06T20:44:01.344606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:01.415755Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.415755Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:46c76d4a01c223f95126467bdabae76f29044a05450090aedc9e9bb795e6b62c","observation_id":"21bed869-f858-40dd-ab46-c6d897973bf6","resolution":{"observed_at":"2026-08-06T20:44:01.415755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:05.526119Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":"9860a788-8e72-4cae-92c6-d0dcde46717f","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.514050Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:46b1fd1838876cda074b06d4559af9a3f9c8744cf18d2b1f4a843ee71fc7bf08","observation_id":"79b816f9-bce3-4ebe-a27e-e1687aebbc0d","resolution":{"observed_at":"2026-08-06T20:44:05.670363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:05.220087Z","title":"Follow-your-click: Open-domain regional image animation via motion prompts","venue":null,"work_id":"8e203fcd-d754-4f6b-8bcc-0ef565761a7d","year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.650856Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:180eb8c945c699061048d3737e2c6e433f489f007a47230ea79835c6a9025139","observation_id":"a5b0eed3-9818-4bab-bb27-f37aa04c8f90","resolution":{"observed_at":"2026-08-06T20:44:05.354867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:01.737118Z","title":"Follow-your-motion: Video motion transfer via efficient spatial-temporal decoupled finetuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.737118Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:377e0b0a999e0591961249c2eebf10fd67f902b330c31572dd5e5fcfe8236b99","observation_id":"3733c586-6015-49dd-9fcb-2b1211d6072d","resolution":{"observed_at":"2026-08-06T20:44:01.737118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14173","last_updated":"2025-01-30T11:28:17Z","snapshot_observed_at":"2026-08-08T19:41:05.590368Z","submitted_at":"2024-12-18T18:59:59Z","title":"AniDoc: Animation Creation Made Easier","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14173","snapshot_observed_at":"2026-08-06T20:44:01.846272Z","title":"Anidoc: Animation creation made easier","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.846272Z"},"links":{"cited_paper":"/paper/2412.14173","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:c746daf1ebafa29cb7277821dfeaf1c96216099b7f7cb74ae57bebe89ae75af6","observation_id":"9c37ea60-1d32-442c-b3b7-f199dc2c89a9","resolution":{"observed_at":"2026-08-06T20:44:01.846272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07425","last_updated":"2024-05-13T01:50:05Z","snapshot_observed_at":"2026-07-06T18:13:16.171803Z","submitted_at":"2024-05-13T01:50:05Z","title":"Sakuga-42M Dataset: Scaling Up Cartoon Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07425","snapshot_observed_at":"2026-08-06T20:44:01.983722Z","title":"Sakuga-42m dataset: Scaling up cartoon research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.983722Z"},"links":{"cited_paper":"/paper/2405.07425","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:cbe6829c7969d1d4822fe377c955214599bab150a6bfc726bc7a7396a7decab8","observation_id":"0dd5ea05-4e83-4055-a70c-c4843b72788b","resolution":{"observed_at":"2026-08-06T20:44:01.983722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:02.147334Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.147334Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:feb94ba54b0eb9703232f3c8400f7045396356fcb01ad29e4444167930dde4aa","observation_id":"f52c8dbf-68cb-46a3-9846-1ba67b399feb","resolution":{"observed_at":"2026-08-06T20:44:02.147334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15169","last_updated":"2024-01-30T16:44:20Z","snapshot_observed_at":"2026-08-03T19:40:46.693368Z","submitted_at":"2023-10-23T17:59:58Z","title":"FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15169","snapshot_observed_at":"2026-08-06T20:44:02.239414Z","title":"Freenoise: Tuning-free longer video diffusion via noise rescheduling.arXiv preprint arXiv:2310.15169, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.239414Z"},"links":{"cited_paper":"/paper/2310.15169","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:de9aeae9bdabdd9cce0cbaceb679a13e7765be6407601e5b6fc5e74ad5e53016","observation_id":"55aec288-e13e-4a46-9503-143893af8070","resolution":{"observed_at":"2026-08-06T20:44:02.239414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:02.319811Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.319811Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:324459e70a6c90cf404987dc87874c8fb51363a8d82b200f9219108b75304ffe","observation_id":"1ad4202e-f42e-401d-b574-8d8bfb281b0d","resolution":{"observed_at":"2026-08-06T20:44:02.319811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-04T02:26:31.748049Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-06T20:44:02.396979Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.396979Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:9cf5f07449532c3cb9bdfb6c82c9f804c88b374e79eee7ea76716e9750fc1ea2","observation_id":"0e9d9cd6-f653-43ae-84d8-114b51743f50","resolution":{"observed_at":"2026-08-06T20:44:02.396979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T20:44:02.472353Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.472353Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:d5bd26df6a6762b9ae390009f609eef2980b2df6af2988f86a934aa147ff5006","observation_id":"402060c6-11ee-452e-afb6-8d77ad4cb01e","resolution":{"observed_at":"2026-08-06T20:44:02.472353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:05.135330Z","title":"Inception transformer","venue":null,"work_id":"1491d0b9-d70a-4ee9-917b-38b19a1d668d","year":null},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.602200Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:d81046ea18c784d872f040e99e0efaea6e676890c4076f6713966393d7db48ae","observation_id":"d51b70ec-8bd1-4b6b-9165-ed2ca6a491cb","resolution":{"observed_at":"2026-08-06T20:44:05.208434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:05.008671Z","title":"Probing multimodal large lan- guage models for global and local semantic representations","venue":null,"work_id":"2907fcac-d361-4599-bf7e-8ebe5668a4c9","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.703575Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:506c9ba2cdf8c371761ab21816d41f4cd3b9b98dd7f9f211f3605449b59ef66c","observation_id":"17d2a476-2584-4063-926b-2195fdc6f1df","resolution":{"observed_at":"2026-08-06T20:44:05.064454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-06T20:44:02.787099Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.787099Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:f78afde47915e85d592e7901e4460ee5ad3d5db285548350ec16d0bb97bb6e6f","observation_id":"5decbd04-0f3b-447a-9014-812ce65d4961","resolution":{"observed_at":"2026-08-06T20:44:02.787099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05962","last_updated":"2022-03-09T23:55:24Z","snapshot_observed_at":"2026-07-06T12:46:48.184877Z","submitted_at":"2022-03-09T23:55:24Z","title":"Anti-Oversmoothing in Deep Vision Transformers via the Fourier Domain Analysis: From Theory to Practice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05962","snapshot_observed_at":"2026-08-06T20:44:02.857894Z","title":"Anti-oversmoothing in deep vision trans- formers via the fourier domain analysis: From theory to practice","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.857894Z"},"links":{"cited_paper":"/paper/2203.05962","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:e2503da8b91094052d83f7de6968d2cbccc60c268afbab149e7b3b7bf8d1fb30","observation_id":"afb30076-2c66-46ce-bedc-3cb48b30dce4","resolution":{"observed_at":"2026-08-06T20:44:02.857894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02192","last_updated":"2025-07-20T07:07:13Z","snapshot_observed_at":"2026-08-07T15:56:36.657828Z","submitted_at":"2025-05-04T17:19:20Z","title":"DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02192","snapshot_observed_at":"2026-08-06T20:44:02.935387Z","title":"Dualreal: Adaptive joint training for loss- less identity-motion fusion in video customization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.935387Z"},"links":{"cited_paper":"/paper/2505.02192","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:020e5523e9d142b0600aef8c80c20944a6fc5aa7c7ba1af994a0984509f11149","observation_id":"5b800691-8ff4-450a-a543-366bc7720bc9","resolution":{"observed_at":"2026-08-06T20:44:02.935387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20504","last_updated":"2025-03-24T02:17:34Z","snapshot_observed_at":"2026-07-06T20:14:22.094082Z","submitted_at":"2024-12-29T15:42:24Z","title":"ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20504","snapshot_observed_at":"2026-08-06T20:44:03.079113Z","title":"Retake: Reducing temporal and knowledge redundancy for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.079113Z"},"links":{"cited_paper":"/paper/2412.20504","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:2c345be56ab4e05b4259ea9e227d315a048189e215f963d73193f043888f7dfd","observation_id":"3fbb95af-caf3-4d79-a8bc-191d95e8f8e2","resolution":{"observed_at":"2026-08-06T20:44:03.079113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:03.202268Z","title":"Longllava: Scaling multi-modal llms to 1000 images efficiently via a hybrid architecture","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.202268Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:2a8cc45fb6c8cb6d6e6c86220272e8c0db79e91d6fa3bbb796c4d14c1f0be10e","observation_id":"934ffdaf-9814-4917-b425-ddcc1df4661d","resolution":{"observed_at":"2026-08-06T20:44:03.202268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01071","last_updated":"2025-08-02T13:32:09Z","snapshot_observed_at":"2026-07-06T19:09:10.244642Z","submitted_at":"2024-09-02T08:52:58Z","title":"VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01071","snapshot_observed_at":"2026-08-06T20:44:03.238976Z","title":"Videollamb: Long-context video understanding with recur- rent memory bridges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.238976Z"},"links":{"cited_paper":"/paper/2409.01071","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:f34a612647bc931643f9f470ea4cedca2c6463ac27d0512f0ff9984ca87bfecd","observation_id":"ca68543e-d87a-4c79-9db9-02a69d12bdf8","resolution":{"observed_at":"2026-08-06T20:44:03.238976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:03.340554Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.340554Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:d2ec9598a32c51b56d70a760e19a396fc2737012ee19f12098054876f8e22073","observation_id":"b43cc7b9-7520-4e32-99bd-c706d025c075","resolution":{"observed_at":"2026-08-06T20:44:03.340554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:03.403346Z","title":"Longvlm: Efficient long video understand- ing via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.403346Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:56520a26397f246c0085bac6d4d8995a971b4390301baf3159dbfd204f851ef3","observation_id":"aff3db0b-262a-4c15-9e01-c0d3f4ca5240","resolution":{"observed_at":"2026-08-06T20:44:03.403346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:04.871515Z","title":"Deep reward supervisions for tuning text-to-image diffusion models","venue":null,"work_id":"853d7805-c032-4ccc-a739-1542a1e3606d","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.447993Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:768b4fa950cd3f2b7171e13a4e408243247d1401bbc0659418b3f8228ce6bcc7","observation_id":"aa0bf80d-b286-46d1-9ee8-d63a5a31ae21","resolution":{"observed_at":"2026-08-06T20:44:04.937092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:04.760594Z","title":"Tooncrafter: Generative cartoon interpolation","venue":null,"work_id":"66d3706c-c212-4cac-9619-e5cee482b450","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.552164Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:bd2c39a8a7468d7a0750f601ec7dcc458297209ed00e02d009de46026bd13b57","observation_id":"ac667245-c17c-4537-83cb-bd07bf772ee1","resolution":{"observed_at":"2026-08-06T20:44:04.805445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:04.660949Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"d95f4603-587f-417c-8339-c0fee21ee7e1","year":2023},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.620317Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:7b89f79fb91fbcba1874a5539d682e6f8e2c88b71b47513df7fbc95b9a35144a","observation_id":"ecd540ba-027e-42f1-ba64-2a3e24665a9a","resolution":{"observed_at":"2026-08-06T20:44:04.710878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08295","last_updated":"2025-03-22T14:09:40Z","snapshot_observed_at":"2026-08-07T04:02:16.440219Z","submitted_at":"2025-01-14T18:22:21Z","title":"LayerAnimate: Layer-level Control for Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08295","snapshot_observed_at":"2026-08-06T20:44:03.687210Z","title":"Layeranimate: Layer-specific control for anima- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.687210Z"},"links":{"cited_paper":"/paper/2501.08295","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:4bd41550c48736fb741713f69fcdf8302e96cb9886bd5eb2fc5b3880ed718149","observation_id":"2fc57576-a339-4c26-909a-43dc356b3a52","resolution":{"observed_at":"2026-08-06T20:44:03.687210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T20:44:03.739778Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.739778Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:b6884e23b942f3d93d6fbe0805a9be6dff42455547eddb09370f644f4111f28a","observation_id":"de44c0f2-b7e3-483d-ac2e-9e230e352d7e","resolution":{"observed_at":"2026-08-06T20:44:03.739778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:04.540636Z","title":"Animation line art colorization based on the op- tical flow method","venue":null,"work_id":"3c72ea35-b770-451b-93cc-4c659c4521cd","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.774727Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:af2d36221983afbdbd9bd18088c422eae748cf23d456a08e8ced4a7f350c4151","observation_id":"bb6e6654-375e-4c02-a9a4-4c3c4add112e","resolution":{"observed_at":"2026-08-06T20:44:04.589919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:04.440519Z","title":"Make pixels dance: High- dynamic video generation","venue":null,"work_id":"c59f3a9a-80a4-4e4e-9a55-4c949800a117","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.820747Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:e213f25e9262cb63e03c80a1e093c22f2e6f012b26a0a562c24a95f2667b27e4","observation_id":"f4a4d1bd-a069-4727-89f4-7cbce5f8b49c","resolution":{"observed_at":"2026-08-06T20:44:04.488221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-09T19:19:40.842650Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-06T20:44:03.876972Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.876972Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:3d9bc1ce8a450d3166e1631b1e92fcbb9e47744cef8533f5ddefe68971d3a583","observation_id":"2b6eb28b-ed98-4ca9-b951-d01c3c376df7","resolution":{"observed_at":"2026-08-06T20:44:03.876972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16948","last_updated":"2025-08-07T08:42:42Z","snapshot_observed_at":"2026-08-08T12:12:41.617999Z","submitted_at":"2025-03-21T08:53:14Z","title":"Follow-Your-Color: Multi-Instance Sketch Colorization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16948","snapshot_observed_at":"2026-08-06T20:44:03.931604Z","title":"Magiccolor: Multi-instance sketch colorization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.931604Z"},"links":{"cited_paper":"/paper/2503.16948","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:da00f4c0d3dbe0ea24d0c6573d6260439bc6dcdfb2c460ea84a9c8768d16501e","observation_id":"64f42629-0620-4ee0-9e7e-297deb3cfb32","resolution":{"observed_at":"2026-08-06T20:44:03.931604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2507.01945."}