{"as_of":"2026-08-13T22:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ebcf7861670472fc1c9fe47080fb291155997e7598b1d7597b10dcc2cd35e63","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:12:11.643982Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T12:23:05.876881Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T02:40:14.528606Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03126","snapshot_observed_at":"2026-07-13T12:23:05.876881Z","title":"Animeshooter: A multi-shot animation dataset for reference-guided video generation.arXiv preprint arXiv:2506.03126, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03738","last_updated":"2026-04-04T13:50:38Z","snapshot_observed_at":"2026-08-06T04:04:52.686841Z","submitted_at":"2026-04-04T13:50:38Z","title":"Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T12:23:05.876881Z"},"links":{"cited_paper":"/paper/2506.03126","citing_paper":"/paper/2604.03738"},"observation_digest":"sha256:80f671ed3e9d8fae525a5cf85f00cd99df2eaf81e131bd25c83f6daefb32a8f6","observation_id":"12a9d3e5-c4e3-4a23-a319-0bec9d33f43d","resolution":{"observed_at":"2026-07-13T12:23:05.876881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"cited_work":{"arxiv_id":"2506.03126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03126","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animeshooter: A multi-shot animation dataset for reference-guided video generation","venue":null,"work_id":"e38e35fc-a3e9-47ab-81c6-dd7d2b449865","year":2025},"citing_paper":{"arxiv_id":"2604.23789","last_updated":"2026-08-11T17:07:14Z","snapshot_observed_at":"2026-08-13T22:02:42.664759Z","submitted_at":"2026-04-26T16:28:46Z","title":"MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T06:28:42.129881Z"},"links":{"cited_paper":"/paper/2506.03126","citing_paper":"/paper/2604.23789"},"observation_digest":"sha256:01bff56ad8339c913b81cb1956a5fedc0e430b34cfc64f8a30c741e1f1ed4a5f","observation_id":"03dd8ea7-b774-48bf-ab89-aa092011185b","resolution":{"observed_at":"2026-05-11T21:11:19.182772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"cited_work":{"arxiv_id":"2506.03126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03126","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animeshooter: A multi-shot animation dataset for reference-guided video generation","venue":null,"work_id":"e38e35fc-a3e9-47ab-81c6-dd7d2b449865","year":2025},"citing_paper":{"arxiv_id":"2604.23789","last_updated":"2026-08-11T17:07:14Z","snapshot_observed_at":"2026-08-13T22:02:42.664759Z","submitted_at":"2026-04-26T16:28:46Z","title":"MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:10.509727Z"},"links":{"cited_paper":"/paper/2506.03126","citing_paper":"/paper/2604.23789"},"observation_digest":"sha256:dbc38812df2435730d14d42d295f716b47ef71a7a3fcb06756e403d29888eee3","observation_id":"1cf7ef51-3212-4406-ac33-bd2199c83f1a","resolution":{"observed_at":"2026-05-12T00:51:15.171755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"cited_work":{"arxiv_id":"2506.03126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03126","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animeshooter: A multi-shot animation dataset for reference-guided video generation","venue":null,"work_id":"e38e35fc-a3e9-47ab-81c6-dd7d2b449865","year":2025},"citing_paper":{"arxiv_id":"2605.23508","last_updated":"2026-05-22T11:16:05Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T11:16:05Z","title":"DrawVideo: Generating Long Video from Storyboard Keyframe Sketches","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T02:40:00.873188Z"},"links":{"cited_paper":"/paper/2506.03126","citing_paper":"/paper/2605.23508"},"observation_digest":"sha256:1859ec4cce6cfb130d49883abceac85586141de7d21c528c32018ff63eda4722","observation_id":"0495b8e7-e0f5-4b47-8fb6-7ae4308d815c","resolution":{"observed_at":"2026-05-25T02:40:14.532466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03126/citation-record","integrity":"/paper/2506.03126/integrity","json":"/paper/2506.03126/citation-record.json","paper":"/paper/2506.03126"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:07.596205Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:07.596205Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:0917cb8169b8bd7b241d42abf82539ec576f8c94859b54ab66f96d2df9c4590c","observation_id":"389f885a-2c05-4557-aa24-30917415e80d","resolution":{"observed_at":"2026-08-07T11:12:07.596205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:07.662318Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:07.662318Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:22ba31d84cbb2d4669b73c9a57eb1b464d08990dce010d0bd6a830d53606b045","observation_id":"dd058a13-c529-4a70-ab25-e2538c4a7612","resolution":{"observed_at":"2026-08-07T11:12:07.662318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:07.730235Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:07.730235Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:59d7ce994b366b784f41c0c2a31903da949abe13717418ca1fa5725b25d9ddad","observation_id":"8af38723-941f-4c8c-a6f2-d8a21683ed7c","resolution":{"observed_at":"2026-08-07T11:12:07.730235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06187","last_updated":"2025-03-20T17:59:56Z","snapshot_observed_at":"2026-08-10T21:03:25.212313Z","submitted_at":"2025-01-10T18:59:54Z","title":"Multi-subject Open-set Personalization in Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06187","snapshot_observed_at":"2026-08-07T11:12:07.805412Z","title":"Multi- subject open-set personalization in video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:07.805412Z"},"links":{"cited_paper":"/paper/2501.06187","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:14daa0f7fd274af49fd43e66d263e33b5652b0a30d1222efc9e004d6aadc1aa5","observation_id":"da75d926-c224-400f-916a-84cd7e90880d","resolution":{"observed_at":"2026-08-07T11:12:07.805412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:07.888630Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:07.888630Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:3277b34c80840b50748ebc8e1caf43ab203b0e76960a1762124d98359dbd5390","observation_id":"7a32cccd-bf7b-4da4-9bb8-7731c437384d","resolution":{"observed_at":"2026-08-07T11:12:07.888630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01014","last_updated":"2025-05-30T14:00:25Z","snapshot_observed_at":"2026-08-10T07:12:22.855260Z","submitted_at":"2025-04-01T17:57:18Z","title":"AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction","version":2},"cited_work":{"arxiv_id":"2504.01014","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.01014","snapshot_observed_at":"2026-08-07T11:12:12.011804Z","title":"AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction","venue":"cs.CV","work_id":"8ec1f20f-905a-45b6-aabf-ac74db814abf","year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:07.996721Z"},"links":{"cited_paper":"/paper/2504.01014","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:3b44f42a85d2269e5f728eb6f099b50d2b3e9fc7cf98698bdc851dc095e45006","observation_id":"2ad33bc0-f505-474e-b8ce-99f722b5d127","resolution":{"observed_at":"2026-08-07T11:12:12.106906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:14.099451Z","title":"Gemini, 2024","venue":null,"work_id":"334bd114-c08f-4f3f-9d8e-438941427f00","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.133677Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:aad31b232e8dc0f637d17af927cff9285d0218910a4041a47dc03ddd97814d08","observation_id":"42f72ecf-dc28-47aa-828b-08c5f6d867ff","resolution":{"observed_at":"2026-08-07T11:12:14.189027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10391","last_updated":"2025-03-13T14:07:58Z","snapshot_observed_at":"2026-08-12T21:41:00.865544Z","submitted_at":"2025-03-13T14:07:58Z","title":"CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10391","snapshot_observed_at":"2026-08-07T11:12:08.227600Z","title":"Cinema: Coherent multi-subject video generation via mllm-based guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.227600Z"},"links":{"cited_paper":"/paper/2503.10391","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:47c87998e6b2d4a496d7ede7ae6c2f3ff53ec39f392a148adefb4f9d18a5c8a1","observation_id":"10bbdf14-7a25-4c48-bb27-3789b2a20813","resolution":{"observed_at":"2026-08-07T11:12:08.227600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-08-13T11:15:48.595279Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-07T11:12:08.339057Z","title":"Dreamsim: Learning new dimensions of human visual similarity using synthetic data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.339057Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:7e358d407630b340247bb7209ded820953eac21b0b0dd623c3f41eff541a5534","observation_id":"374fa6d5-8d77-432a-8862-f6ea8f81c154","resolution":{"observed_at":"2026-08-07T11:12:08.339057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18247","last_updated":"2023-05-30T08:54:42Z","snapshot_observed_at":"2026-08-13T11:30:07.342470Z","submitted_at":"2023-05-29T17:11:39Z","title":"TaleCrafter: Interactive Story Visualization with Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18247","snapshot_observed_at":"2026-08-07T11:12:08.485043Z","title":"Talecrafter: Interactive story visualization with multiple characters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.485043Z"},"links":{"cited_paper":"/paper/2305.18247","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:51a208131309ed2a03eb16b332710dad084783b2c0fd159b7fb5af0c78b9b33e","observation_id":"8a36178e-afd2-410e-a11e-03b8c7f5c3c3","resolution":{"observed_at":"2026-08-07T11:12:08.485043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:12:08.630129Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.630129Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:c5837a4d35925560fae23e1fafe3f7fa48d617b9dfc2447b364bddcf73d39fdc","observation_id":"d64ba14d-5ff1-4bed-9806-cc8749ca3d35","resolution":{"observed_at":"2026-08-07T11:12:08.630129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:08.729397Z","title":"Mix-of-show: Decentralized low-rank adaptation for multi-concept customization of diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.729397Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:511303d98696d7a05c4fc697cabf0d9e5bf0ea947be80ad14025108f55f3b008","observation_id":"b90d077f-4e9f-4da3-a746-15ea5e9d7b81","resolution":{"observed_at":"2026-08-07T11:12:08.729397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17949","last_updated":"2024-11-27T00:10:27Z","snapshot_observed_at":"2026-08-12T17:12:54.075325Z","submitted_at":"2024-11-27T00:10:27Z","title":"ROICtrl: Boosting Instance Control for Visual Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17949","snapshot_observed_at":"2026-08-07T11:12:08.846411Z","title":"Roictrl: Boosting instance control for visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.846411Z"},"links":{"cited_paper":"/paper/2411.17949","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:e923d9af60cb32f8ffa49f77017a0f1895103fc9a18c715ba7101962c1bae707","observation_id":"9356d9de-e9d4-44bb-bcb6-f78c65570da9","resolution":{"observed_at":"2026-08-07T11:12:08.846411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:12:08.909571Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.909571Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:21e8b947503df51bdba14abcef5181b6897a08723e1d77b53143bbbc06f12dc4","observation_id":"f573cba1-365b-462e-8c50-832797999e3e","resolution":{"observed_at":"2026-08-07T11:12:08.909571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-13T05:58:35.441148Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-07T11:12:08.965970Z","title":"Long context tuning for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.965970Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:e04f73b93aea5bcb46c75f68f08fc9993539a9363fe350284c131111e7bcb7b6","observation_id":"0ffec6cb-a1a0-4858-b45a-43d583ac1ff2","resolution":{"observed_at":"2026-08-07T11:12:08.965970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09503","last_updated":"2025-05-01T09:16:20Z","snapshot_observed_at":"2026-08-12T03:10:07.710252Z","submitted_at":"2025-01-16T12:28:39Z","title":"AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09503","snapshot_observed_at":"2026-08-07T11:12:09.048829Z","title":"Anys- tory: Towards unified single and multiple subject personalization in text-to-image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.048829Z"},"links":{"cited_paper":"/paper/2501.09503","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:1d666da85d46698b3d522ff2b058123213198e8076a078c16dcb49f6d1e41e4a","observation_id":"e051b2b5-5fe8-4eb4-944e-760793cdaaea","resolution":{"observed_at":"2026-08-07T11:12:09.048829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-08-13T00:23:35.730517Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-08-07T11:12:09.126710Z","title":"Id-animator: Zero-shot identity-preserving human video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.126710Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:561392a7e339e3583eb24cce04456f2fc3d67c38091b18a5c8d837e7dba9196f","observation_id":"7fa80870-4be0-4fc5-a828-286d8f634c71","resolution":{"observed_at":"2026-08-07T11:12:09.126710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-07T11:12:09.189653Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.189653Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:7de33e695374d4663025b42ecb15b958f474378777ab9efba4c31ffd478f6652","observation_id":"aaf0aeb4-19f8-4519-9e5d-d7174043c9cf","resolution":{"observed_at":"2026-08-07T11:12:09.189653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09600","last_updated":"2024-12-12T18:59:01Z","snapshot_observed_at":"2026-08-13T06:08:40.399835Z","submitted_at":"2024-12-12T18:59:01Z","title":"Owl-1: Omni World Model for Consistent Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09600","snapshot_observed_at":"2026-08-07T11:12:09.266583Z","title":"Owl-1: Omni world model for consistent long video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.266583Z"},"links":{"cited_paper":"/paper/2412.09600","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:b731f2e5af1c351f408ed105f4fa4e4c2e78edc322caa4fa388370e189ab9813","observation_id":"a40c66a4-0d8e-408a-a927-93464dff33f3","resolution":{"observed_at":"2026-08-07T11:12:09.266583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04698","last_updated":"2025-05-13T06:42:52Z","snapshot_observed_at":"2026-08-10T21:24:08.597398Z","submitted_at":"2025-01-08T18:59:01Z","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04698","snapshot_observed_at":"2026-08-07T11:12:09.347154Z","title":"Conceptmaster: Multi-concept video customization on diffusion transformer models without test-time tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.347154Z"},"links":{"cited_paper":"/paper/2501.04698","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:52f4460c0788ae4b19bc2597f473105d9260c3aca50b654b515019d0e5e68277","observation_id":"bc92ba84-61f2-483c-bbe5-3ecf2d2c648f","resolution":{"observed_at":"2026-08-07T11:12:09.347154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-08-07T11:12:09.446928Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.446928Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:107221465c51ed0856c07594cd78088445baa1097d6319c26fbcb9022a1a1f21","observation_id":"ae659b54-8ae6-4d0f-8e35-7eb036357a6c","resolution":{"observed_at":"2026-08-07T11:12:09.446928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10255","last_updated":"2025-05-22T07:45:19Z","snapshot_observed_at":"2026-08-13T12:47:39.419030Z","submitted_at":"2024-12-13T16:24:58Z","title":"AniSora: Exploring the Frontiers of Animation Video Generation in the Sora Era","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10255","snapshot_observed_at":"2026-08-07T11:12:09.494420Z","title":"Exploring the frontiers of animation video generation in the sora era: Method, dataset and benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.494420Z"},"links":{"cited_paper":"/paper/2412.10255","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:ddc4ca0ba71f00dbba35fe37b6e21d79a0a07b9a650c3366f7c255f61d1551bd","observation_id":"75efc4a0-733f-4862-8af8-bcd8407e95e1","resolution":{"observed_at":"2026-08-07T11:12:09.494420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.905649Z","title":"Videobooth: Diffusion-based video generation with image prompts","venue":null,"work_id":"4d8ea5ca-b552-4d98-ab5a-a7d93a5e08cc","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.571073Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:7f8786b913673d9ed69fc9f56be1b6e771521cbc534e1c928ac71167d122aff3","observation_id":"eb25d9f7-ac88-4b57-a016-a3eefcb212da","resolution":{"observed_at":"2026-08-07T11:12:13.999178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.736345Z","title":"Miradata: A large-scale video dataset with long durations and structured captions","venue":null,"work_id":"53a03318-c0da-4533-b052-bcb193f45c77","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.665314Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:2423c0cfdfe2878a267ee64c13e40969bf9c2f41843899b8d7c6fbad367af05b","observation_id":"cca380a1-eb77-432b-aa22-f71f09fbdc11","resolution":{"observed_at":"2026-08-07T11:12:13.803816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.629214Z","title":"Animeceleb: Large-scale animation celebheads dataset for head reenactment","venue":null,"work_id":"0c229959-596c-4af9-876a-91d34fcfa198","year":2022},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.757488Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:79439ad9f58215fee6a0b1bef13022f917a89d9cfe79213700347ed97ed3da2a","observation_id":"35e5e471-8e47-4d3f-a3e5-44aaacf52b8a","resolution":{"observed_at":"2026-08-07T11:12:13.699408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:09.813019Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.813019Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:e11de54fc4313dfffb2319501088aa2aa669375ed58e259097d122502294ce85","observation_id":"24929bb3-2b7c-47be-be85-b7fb14f89aa9","resolution":{"observed_at":"2026-08-07T11:12:09.813019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:09.891514Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.891514Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:b7825f876cb4fdbc0225216119b5378e6f6debffbab2b594e8f99caed1315e4f","observation_id":"a86e30b0-d6d0-4c61-96be-3e92e6e1f0ac","resolution":{"observed_at":"2026-08-07T11:12:09.891514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.483417Z","title":"Anim-director: A large multimodal model powered agent for controllable animation video generation","venue":null,"work_id":"9b15ecf1-92f0-4ba9-9427-2ada5c7d12ea","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.969711Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:187a48bc4619a8e6a43dc5181c455ba2764dfd61fe410b1effe61c913f67921b","observation_id":"36f8d7e7-a113-43b8-a597-b8278264c7b6","resolution":{"observed_at":"2026-08-07T11:12:13.577772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T11:12:10.052472Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.052472Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:aea4bbf7de48d6993dc7f896d448632c434f2cdcf1963aea41f3989b8dfb9a6d","observation_id":"820661d1-558e-4c66-b64a-1d735b45ff39","resolution":{"observed_at":"2026-08-07T11:12:10.052472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.287293Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"07631ecf-a049-4d8b-8d35-f24412fb0da8","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.127134Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:7b295b086c404395241ab35b41c29b3852fc0b800487a2b1befe16c166f8141d","observation_id":"bfb470b3-7a96-427b-b7df-d31c0b71d6d1","resolution":{"observed_at":"2026-08-07T11:12:13.409848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T11:12:10.219918Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.219918Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:c55c9bd55de2fa8cbe7806d43c77164caf16e7b0c8caba0748bc03073f5e183a","observation_id":"54f3858b-f0ae-4f61-9f1b-9fe9c8f76c74","resolution":{"observed_at":"2026-08-07T11:12:10.219918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.161049Z","title":"Videostudio: Generating consistent-content and multi-scene videos","venue":null,"work_id":"008aa8bb-8bd1-4a6d-b257-06a54d7b6106","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.299362Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:8e02c00fc081384c296b3b68e9db9e1cce3d5f6bdab7f084bfb754bab49b291b","observation_id":"ec6cd1af-2c39-4fe7-ba93-a9203c189b99","resolution":{"observed_at":"2026-08-07T11:12:13.247077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.036742Z","title":"Gpt-4o: Multimodal large language model, 2025","venue":null,"work_id":"4b66fae8-7828-49c9-aa86-4da25dab8c0a","year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.378355Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:04e1386b42577573a78c4d787c50f1d3f48e4323ad9eb31dd3ce4c89c6c6b38d","observation_id":"07fdbe30-a898-4f35-893a-7e0a49723455","resolution":{"observed_at":"2026-08-07T11:12:13.078271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07425","last_updated":"2024-05-13T01:50:05Z","snapshot_observed_at":"2026-07-06T18:13:16.171803Z","submitted_at":"2024-05-13T01:50:05Z","title":"Sakuga-42M Dataset: Scaling Up Cartoon Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07425","snapshot_observed_at":"2026-08-07T11:12:10.466249Z","title":"Sakuga-42m dataset: Scaling up cartoon research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.466249Z"},"links":{"cited_paper":"/paper/2405.07425","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:2573514586dc201977742b1bd63de231b3e8671bc6f0534ed5508fd0d01399fb","observation_id":"8c0100f0-a661-4ea9-be03-c8bdda53aa7a","resolution":{"observed_at":"2026-08-07T11:12:10.466249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:10.547419Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.547419Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:3f923ffd92808ac5371a3c3883b9ec22c5119e1b24c2a391ebcab926e86f2228","observation_id":"555b527d-8b63-4e0f-9bd6-be90d689a97a","resolution":{"observed_at":"2026-08-07T11:12:10.547419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T11:12:10.655648Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.655648Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:46b0a3cfb5399c2b8dc12ff664071e636ab06881d5484851ae426f526446d257","observation_id":"db3ff834-c87b-4a72-8b25-6c91f900c8d6","resolution":{"observed_at":"2026-08-07T11:12:10.655648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:10.735546Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.735546Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:f593134d9367442dd91c9e19bce5252bae4e30e186bf72519b93ceebec195694","observation_id":"ef22b037-3bb6-4cbe-b768-acdf42d65130","resolution":{"observed_at":"2026-08-07T11:12:10.735546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:12.751487Z","title":"Videofactory: Swap attention in spatiotemporal diffusions for text-to-video generation","venue":null,"work_id":"8bb40c02-31d2-4ab5-81a2-e4edde4909df","year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.816759Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:7b7e75d5eda127e1221da83773d328bad8f365e53ea2e4a5f55ee7dd16615673","observation_id":"67e8c4e3-c52d-46b9-9d04-ae9478b51db7","resolution":{"observed_at":"2026-08-07T11:12:12.866309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T11:12:10.899127Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.899127Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:e47610944228afdadf297a9a3d1c8622a1e45189dbed10e2dde9834f9d3a8324","observation_id":"d9559444-4464-46cf-b125-2bc3146cfffa","resolution":{"observed_at":"2026-08-07T11:12:10.899127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:10.988953Z","title":"Dreamrunner: Fine-grained storytelling video generation with retrieval-augmented motion adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.988953Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:c0a7836c51152b9abf1a73033f88afd740383c39f3353e8394855c00715ed7f5","observation_id":"a3ff8ddc-5acc-4107-97cd-f55f3767ee50","resolution":{"observed_at":"2026-08-07T11:12:10.988953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:12.567107Z","title":"Understanding animation","venue":null,"work_id":"d5a42623-49e4-4105-8f9b-22582c494e10","year":2013},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.080666Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:0af9a470aca94b09b93745627c0648269184d25cedbccd8593a1b21c13fe824c","observation_id":"6eb2fcc0-3d80-460c-8e33-0dc1fa6869a5","resolution":{"observed_at":"2026-08-07T11:12:12.648824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07314","last_updated":"2025-03-10T13:33:27Z","snapshot_observed_at":"2026-08-07T17:16:48.946119Z","submitted_at":"2025-03-10T13:33:27Z","title":"Automated Movie Generation via Multi-Agent CoT Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07314","snapshot_observed_at":"2026-08-07T11:12:11.166087Z","title":"Automated movie generation via multi-agent cot planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.166087Z"},"links":{"cited_paper":"/paper/2503.07314","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:af8e56d19688e9886beb7cb5b255ae86ddeff612f3b8149f3bf45b96784a2e7f","observation_id":"6a6aa371-4938-48d2-90ad-025c4183ff3d","resolution":{"observed_at":"2026-08-07T11:12:11.166087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-12T23:44:12.344796Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-07T11:12:11.222249Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.222249Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:06e16c54f7aa846666c490922dcf2c18ce6deedfcf27ac96815e0f4d4a53c697","observation_id":"30381dfa-6f88-438b-a9c9-990b24562a6d","resolution":{"observed_at":"2026-08-07T11:12:11.222249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:12.437344Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"e1d8e717-5a50-4e0d-821f-aac55f74e263","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.286902Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:e0a50a9df44a305444658b7037bbdd494f9afb1ad83ddf22ae9294f35ed13c08","observation_id":"f75afb69-c4ce-4946-a2e8-a6659b257310","resolution":{"observed_at":"2026-08-07T11:12:12.492949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10816","last_updated":"2024-10-14T17:59:56Z","snapshot_observed_at":"2026-08-12T22:23:27.485897Z","submitted_at":"2024-10-14T17:59:56Z","title":"LVD-2M: A Long-take Video Dataset with Temporally Dense Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10816","snapshot_observed_at":"2026-08-07T11:12:11.338933Z","title":"Lvd-2m: A long-take video dataset with temporally dense captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.338933Z"},"links":{"cited_paper":"/paper/2410.10816","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:0a93bff4144a0e0783f80e4be9944cb5502186b6108f2960eafa23a12c2549c6","observation_id":"c906f12f-548a-4246-a263-f63b490a5dfd","resolution":{"observed_at":"2026-08-07T11:12:11.338933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:12.307202Z","title":"Vript: A video is worth thousands of words","venue":null,"work_id":"1dc247a1-a038-4b2d-97d7-3deff4d93e19","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.402600Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:3db6c467828d614310f90e04f240caf0dab363a115655ff9efd51b08fb189163","observation_id":"50a82ba6-d370-4019-b301-e78b5afa1694","resolution":{"observed_at":"2026-08-07T11:12:12.358110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-12T23:24:01.714587Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-07T11:12:11.474850Z","title":"Seed-story: Multimodal long story generation with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.474850Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:b93f19a7bbf407abc3ed28a007b78e2218efb0a694a3f2be138f7699868c1b90","observation_id":"bc59aa92-dab7-4113-ae87-2e9112b87892","resolution":{"observed_at":"2026-08-07T11:12:11.474850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-07T11:12:11.511487Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.511487Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:63e3dff6df0a0c2668d18ac7d41b0eb2a8654dcd362051015c35147cae89519a","observation_id":"2be077c8-5812-4e90-beb0-51b75fdd6892","resolution":{"observed_at":"2026-08-07T11:12:11.511487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-07T11:12:11.581622Z","title":"The girl said goodbye to the bear","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.581622Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:f5fcc17e04a66941022ca8648efcc494926865a201c0b9e56ce8bf6443fd7bf3","observation_id":"babab955-deef-496a-a763-52bb4fe2f02c","resolution":{"observed_at":"2026-08-07T11:12:11.581622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:12.182460Z","title":"a cow is mooning","venue":null,"work_id":"7828e83f-0f4d-448d-9af0-7bf522616d41","year":null},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.643982Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:a41d927ee84e0e7b28c007c9f750e12f26df2fb6e6d4ba9f6db806d3f6bc71a6","observation_id":"3056d301-ef7b-43d8-90cb-904e1dcc52be","resolution":{"observed_at":"2026-08-07T11:12:12.237359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 4 inbound Pith citation observations for arXiv:2506.03126."}