{"as_of":"2026-08-15T23:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee17500b6e7265acc622c7d15591c12e0df7a7158cb4bf933fec3072a1df67f5","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:03:13.651954Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.03006/citation-record","integrity":"/paper/2501.03006/integrity","json":"/paper/2501.03006/citation-record.json","paper":"/paper/2501.03006"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.383790Z","title":"One transformer fits all distributions in multi-modal diffu- sion at scale","venue":null,"work_id":"97066091-94f5-4d68-8833-d0ea933cccf2","year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.424433Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:d271a8340283e4e31fd36e6a82eb5cf1502bedc45212aeb1ea5ea68450fecd41","observation_id":"802c79ed-11f4-4261-89c1-f9c40e8215a3","resolution":{"observed_at":"2026-08-10T22:03:14.388236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T22:03:13.428470Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.428470Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:93f1fbfc1fbe6def17680874546ef7260a3375541b2aff9ea8b5f0f3b10f8a15","observation_id":"b7601d13-fbb2-4539-8cc5-fd1a613a5774","resolution":{"observed_at":"2026-08-10T22:03:13.428470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.432127Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.432127Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:5c89f782537cb48d4657e7ed153b750a883f4cd71bcf0d33e4469dd9039a9906","observation_id":"629939d6-0a1d-4c3e-8059-093ec09859ee","resolution":{"observed_at":"2026-08-10T22:03:13.432127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.367755Z","title":"Magick: A large-scale captioned dataset from matting generated images using chroma keying","venue":null,"work_id":"4e8a62ab-c0a9-4caf-8acf-4d3aaeb03bed","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.435878Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:b6cd6c226f1ea1702f9e0a0ae234fbdb5d1bf66f8f84a78892abdd809c0e2703","observation_id":"79175ade-57a9-4ab9-8336-9af812f98ec1","resolution":{"observed_at":"2026-08-10T22:03:14.371380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.358393Z","title":"zeroscope v2","venue":null,"work_id":"e641596c-8661-4196-acb2-f5b1adb822c4","year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.439450Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:952849fb538c96eead59a62109d63d3b2ceda1ee58a6e729eaed373a056257e4","observation_id":"44460e55-b00b-4dc2-9814-7c50ce0f1c7e","resolution":{"observed_at":"2026-08-10T22:03:14.361772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09433","last_updated":"2022-04-20T12:54:06Z","snapshot_observed_at":"2026-08-13T15:59:02.099117Z","submitted_at":"2022-04-20T12:54:06Z","title":"PP-Matting: High-Accuracy Natural Image Matting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09433","snapshot_observed_at":"2026-08-10T22:03:13.443451Z","title":"Pp-matting: high-accuracy natural image matting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.443451Z"},"links":{"cited_paper":"/paper/2204.09433","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:6a293c78aaa72cd2ce09211415b03c494159e7c5d9b3f0960fa44811bae5318b","observation_id":"53addafb-f405-455f-9d7c-2be7e37aeacd","resolution":{"observed_at":"2026-08-10T22:03:13.443451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-13T01:39:12.659510Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-10T22:03:13.447836Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.447836Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:fbaacc4cf92ace6365e34b26c55abb6c8b4c57ed902ce4a123348bc93e315973","observation_id":"034e862b-e019-4f0a-88d4-7a587affd2c1","resolution":{"observed_at":"2026-08-10T22:03:13.447836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09047","last_updated":"2024-01-17T08:30:32Z","snapshot_observed_at":"2026-08-13T04:40:49.704758Z","submitted_at":"2024-01-17T08:30:32Z","title":"VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09047","snapshot_observed_at":"2026-08-10T22:03:13.452815Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.452815Z"},"links":{"cited_paper":"/paper/2401.09047","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:8380e658710df263f0d6be6102cd4c48f791a3ad255d81d2465f57aed62c517d","observation_id":"7dd7c79c-d318-43fa-941a-28b93962ab1d","resolution":{"observed_at":"2026-08-10T22:03:13.452815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-10T22:03:13.457302Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.457302Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:c215076d9a543b9fb26ab1f9131791f2a2cede4eb394e11dc7609c340844e6c3","observation_id":"58a51d4e-9345-4b65-b35a-6255df38eaac","resolution":{"observed_at":"2026-08-10T22:03:13.457302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-10T22:03:13.462730Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.462730Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:81a55eb99bbcb546cdb4345a27dd1db2b2ac506375b9c785ef57c3e04aca91ea","observation_id":"a30c5492-528c-4b5d-aaac-d095a551f953","resolution":{"observed_at":"2026-08-10T22:03:13.462730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13840","last_updated":"2024-08-12T08:30:05Z","snapshot_observed_at":"2026-08-13T11:35:48.187609Z","submitted_at":"2023-05-23T09:03:19Z","title":"Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13840","snapshot_observed_at":"2026-08-10T22:03:13.466003Z","title":"Control-a-video: Controllable text-to-video generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.466003Z"},"links":{"cited_paper":"/paper/2305.13840","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:6bdffc84652b217c73dcc5d319332cc431987c5251aac6ff37f9ef65d8ee8634","observation_id":"6fceeca7-5cc1-4d81-8ac3-98cba82c8e3d","resolution":{"observed_at":"2026-08-10T22:03:13.466003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.348186Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens","venue":null,"work_id":"264ecc08-c08c-4f1f-9ef7-f81226039166","year":null},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.468903Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:b6b865aab674191fe92d35c5e5303f8fecfeebacbb26abebbe87aa7852805b41","observation_id":"167a6211-dec9-4903-9357-17bd340a63dc","resolution":{"observed_at":"2026-08-10T22:03:14.351711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.338380Z","title":"Two-frame motion estimation based on polynomial expansion","venue":null,"work_id":"e5b791ee-7c93-46f4-94a2-f197b5791b2e","year":2003},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.475167Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:78b1947e2037cb729c772e3299768cf187712239ed2dd94ea40f909745f80685","observation_id":"6e77cf48-e743-40b7-9195-4595c0c5f3c0","resolution":{"observed_at":"2026-08-10T22:03:14.341940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-15T03:17:05.670808Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-10T22:03:13.477931Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.477931Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:77ef9cfb2db82c6ecd4ecbc11bf525d32d164e8307b40385919ee1a7001950f7","observation_id":"628f1105-f5b1-436c-81ff-6567d904b1cc","resolution":{"observed_at":"2026-08-10T22:03:13.477931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-15T04:41:40.053257Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-10T22:03:13.481255Z","title":"Livepor- trait: Efficient portrait animation with stitching and retarget- ing control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.481255Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:6a236a17a262ad274891c4affdf40ddcc4cc82baa8f49a67a970b224586b2709","observation_id":"fd197d53-291d-47a6-82d0-6fe9a6de6704","resolution":{"observed_at":"2026-08-10T22:03:13.481255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16693","last_updated":"2024-06-26T18:00:02Z","snapshot_observed_at":"2026-08-14T09:08:38.585343Z","submitted_at":"2023-12-27T19:11:50Z","title":"I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16693","snapshot_observed_at":"2026-08-10T22:03:13.484792Z","title":"I2v-adapter: A general image- to-video adapter for video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.484792Z"},"links":{"cited_paper":"/paper/2312.16693","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:f4e9505484de418e51960c033134ccbffb7c55a8fccc2412ab5de467077aa099","observation_id":"14579c03-51cc-479a-80ad-a5641f5ab87d","resolution":{"observed_at":"2026-08-10T22:03:13.484792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-10T22:03:13.488150Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.488150Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:072d4064156efb5e09893ee487b1c8ed0d47d77a5c120da4f56ffcfb0d413ca1","observation_id":"88b1f8a7-6b39-4b6c-aed8-6c7887d3e3ff","resolution":{"observed_at":"2026-08-10T22:03:13.488150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.327891Z","title":"Lu- cidfusion: Generating 3d gaussians with arbitrary unposed images, 2024","venue":null,"work_id":"e8b4fd46-4f86-4b22-afa5-074da069e286","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.491488Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:a5c76e0147441039dbfe054de1fb4aa6657f799d6a0c92e3433e753609acf656","observation_id":"c3e8f7b8-b204-4140-832b-f58a943943ca","resolution":{"observed_at":"2026-08-10T22:03:14.332283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-14T21:26:22.545457Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-10T22:03:13.494418Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.494418Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:d44808b5dc893974f55f20dcb0104d5ea7e668d5087d29f591d45f9c6b0d3a89","observation_id":"7da24728-5fa5-4ac4-bb6c-4ed251ddbe54","resolution":{"observed_at":"2026-08-10T22:03:13.494418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18124","last_updated":"2025-01-18T20:14:54Z","snapshot_observed_at":"2026-08-15T14:15:09.968049Z","submitted_at":"2024-09-26T17:58:55Z","title":"Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18124","snapshot_observed_at":"2026-08-10T22:03:13.497600Z","title":"Lotus: Diffusion-based visual foundation model for high-quality dense prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.497600Z"},"links":{"cited_paper":"/paper/2409.18124","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:ae11058505097857dcfc56d8c23d4709612f76e8c30bf75bcb35c9730e42608c","observation_id":"3b0a4cdd-7e3a-4945-852c-cf785ee4056f","resolution":{"observed_at":"2026-08-10T22:03:13.497600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-13T08:59:59.906684Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-10T22:03:13.500825Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.500825Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:82d790ba5313a59feb44d7ba3716cda6b4e1c2f4cc6bc47780cea72a3dd6fdaa","observation_id":"36563d41-0e49-4420-b8b2-1753fc1c840b","resolution":{"observed_at":"2026-08-10T22:03:13.500825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.503727Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.503727Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:d03a5811af601897b0c99652c33f5a4e65f23289d225cdcdf52cb436c31752d4","observation_id":"e818f96d-3bcd-4db9-95e1-3fe1ecaaf7f7","resolution":{"observed_at":"2026-08-10T22:03:13.503727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.311913Z","title":"Determining opti- cal flow","venue":null,"work_id":"d9a801f2-a1fc-47c2-9908-782c48060747","year":1981},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.506571Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:b18e0fc066983e61e6270c0cb91ea410bc18f3d74a6bb5a4e3802d3a625a2559","observation_id":"a02183b4-8321-4586-9b97-7f256fc0ae9f","resolution":{"observed_at":"2026-08-10T22:03:14.315439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T22:03:13.509331Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.509331Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:fe3d56b06e7568a6f58e65a852f451af36944720e25737ff18e5f5e4cd2e2098","observation_id":"452ce017-7d37-4721-be4e-4459bfacf3a1","resolution":{"observed_at":"2026-08-10T22:03:13.509331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12002","last_updated":"2024-07-15T13:34:29Z","snapshot_observed_at":"2026-08-13T00:51:02.345172Z","submitted_at":"2024-03-18T17:38:53Z","title":"DreamMotion: Space-Time Self-Similar Score Distillation for Zero-Shot Video Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12002","snapshot_observed_at":"2026-08-10T22:03:13.512595Z","title":"Dreammotion: Space-time self-similarity score distillation for zero-shot video editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.512595Z"},"links":{"cited_paper":"/paper/2403.12002","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:323eb75f2ab6e75fed1de16ca8ce0a439116009442084abbdcc1407fa2483a93","observation_id":"38dd361e-257e-4160-adad-5bf8905f4452","resolution":{"observed_at":"2026-08-10T22:03:13.512595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.515644Z","title":"Repurpos- ing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.515644Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:3b912f627250815f4a549edbab55ae549fdd21eca73d26f1b9c47cce577c243a","observation_id":"038d4fee-4f6c-4919-8394-f41e2f340969","resolution":{"observed_at":"2026-08-10T22:03:13.515644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.295030Z","title":"Open-sora-plan, 2024","venue":null,"work_id":"6828f647-fc9c-40d8-a167-3360c8459046","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.518388Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:9345a34e1f6fa8e74009a1dac849cd3d67a2eef7b08cc1f649bf934683cd1ee9","observation_id":"f188966a-a10f-48d0-b405-4de32e1ee50a","resolution":{"observed_at":"2026-08-10T22:03:14.298555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.283702Z","title":"Matting anything","venue":null,"work_id":"dd67dee5-a532-4fb7-81e9-e49a149dea2f","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.521329Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:f81a97389928fe6d9cf16d118cac91cf2692074672747a0aee03cf9ce3aba2fe","observation_id":"5327516c-8149-4c04-9c1a-a909ba28ef4b","resolution":{"observed_at":"2026-08-10T22:03:14.287705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.270116Z","title":"Omnimat- terf: Robust omnimatte with 3d background modeling","venue":null,"work_id":"668defbc-5628-439c-8f29-2217f60deb8b","year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.524446Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:663207e3a3d7cb36797ca9faa3d707110214ba69f26df15bb22f0becf6064104","observation_id":"45d6a804-9eaf-44b9-9a22-2a894a107d0a","resolution":{"observed_at":"2026-08-10T22:03:14.274367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.259220Z","title":"Real-time high-resolution background matting","venue":null,"work_id":"d26771e8-ea45-4271-a13b-c3466c2e9414","year":2021},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.527761Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:4d15c465faec9c9926662c909dbf2e4b7459c02c355614b2c7c36b220f535769","observation_id":"69ad9895-e05f-4f2c-91a8-11653903f275","resolution":{"observed_at":"2026-08-10T22:03:14.262900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.247522Z","title":"Robust high-resolution video matting with tempo- ral guidance","venue":null,"work_id":"aeb70584-0813-4f49-a333-d8fbacb99a91","year":null},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.530996Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:db7b323926d8441da5f40b4357478e3a8a91a2d3fca693a808f05dc0aa1864f2","observation_id":"edb28094-cde5-4fbe-98ba-ef51ca91fd3b","resolution":{"observed_at":"2026-08-10T22:03:14.251951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05338","last_updated":"2024-10-22T04:22:16Z","snapshot_observed_at":"2026-08-12T23:47:28.499464Z","submitted_at":"2024-06-08T03:44:25Z","title":"MotionClone: Training-Free Motion Cloning for Controllable Video Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05338","snapshot_observed_at":"2026-08-10T22:03:13.534345Z","title":"Motionclone: Training-free motion cloning for controllable video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.534345Z"},"links":{"cited_paper":"/paper/2406.05338","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:3e6fcf7f6ebb5cd6e1ffdea6f53a983c1368cacbb94af90c631418d5a309c9fd","observation_id":"5c92ac8d-3490-4e9f-8c4d-5a4a67a64fdc","resolution":{"observed_at":"2026-08-10T22:03:13.534345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.537985Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.537985Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:63e77dcaa34d341e346abc9831bd9d1aea2ef301ae55ecefe47f9329de6a3332","observation_id":"e77631c0-2b1c-41d1-8c84-1fe7be37657e","resolution":{"observed_at":"2026-08-10T22:03:13.537985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-10T22:03:13.540995Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.540995Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:ad13ae3c6bb3d1cb0cf6a0c9608b43dc926364c8acc31d42613d7bcbbaf6a3fe","observation_id":"73b3bc10-07f2-49b6-b63d-0d20087e970a","resolution":{"observed_at":"2026-08-10T22:03:13.540995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.230786Z","title":"Wonder3d: Sin- gle image to 3d using cross-domain diffusion","venue":null,"work_id":"50ca43d9-5117-46fa-a35a-2a9226c04d78","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.544546Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:f2799a9f0394b92107619c4cbf84e240d045bded2ddc40792293135afc232494","observation_id":"1f20a71a-6e2e-49a3-aa33-8673cf478c84","resolution":{"observed_at":"2026-08-10T22:03:14.234487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.219796Z","title":"Intrinsicdiffusion: Joint in- trinsic layers from latent diffusion models","venue":null,"work_id":"45652c49-398b-4a70-8b1e-d37f81ece011","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.548015Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:4f4c98f0da1eea2e6eef13cd173246ef7b23abeb13afcc3bcdc5f56c9bd01fd4","observation_id":"6a6090dc-e376-45f9-936f-03ad39ddaaab","resolution":{"observed_at":"2026-08-10T22:03:14.223573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00896","last_updated":"2024-04-08T18:40:31Z","snapshot_observed_at":"2026-08-14T13:29:40.699932Z","submitted_at":"2023-12-31T10:51:52Z","title":"TrailBlazer: Trajectory Control for Diffusion-Based Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00896","snapshot_observed_at":"2026-08-10T22:03:13.551286Z","title":"Trailblazer: Trajectory control for diffusion-based video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.551286Z"},"links":{"cited_paper":"/paper/2401.00896","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:47e6365a5c8bbdcd219c8bfd766d481cd018afc8a8232740133b8452cbc1082c","observation_id":"4b1f40ac-4964-4c72-a75e-24dde494b1ef","resolution":{"observed_at":"2026-08-10T22:03:13.551286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-10T22:03:13.554678Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.554678Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:1568b1bf1be0783f693b325ef02782a72b59b36db47adbf2f86db7809478953f","observation_id":"3db71a60-8289-4f83-91d0-680777d1e82d","resolution":{"observed_at":"2026-08-10T22:03:13.554678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20222","last_updated":"2024-07-11T16:26:03Z","snapshot_observed_at":"2026-08-15T01:04:40.169086Z","submitted_at":"2024-05-30T16:22:22Z","title":"MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20222","snapshot_observed_at":"2026-08-10T22:03:13.557527Z","title":"Mofa-video: Control- lable image animation via generative motion field adaptions in frozen image-to-video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.557527Z"},"links":{"cited_paper":"/paper/2405.20222","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:9232da95e1a2c0168963f0c0c2134c873cddfa65979ef086e3ae32096fa59211","observation_id":"0eaac291-299e-412f-9c83-c30b48190e0c","resolution":{"observed_at":"2026-08-10T22:03:13.557527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.560797Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.560797Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:062ea4bd39a1084074bdc7b5f593ea16e9762e072868369cf6233d618cb63af1","observation_id":"72746aa4-5145-4be5-907d-f8a76d3a14b6","resolution":{"observed_at":"2026-08-10T22:03:13.560797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.202374Z","title":"Bimatting: Efficient video matting via binarization","venue":null,"work_id":"41269c42-c1c5-4612-af52-50d5b59f358a","year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.564688Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:dda0fa561527c75798b45fee2e84827a75cd691a368846dfab4ca991f2a8d52b","observation_id":"db742f99-9932-407b-8807-fe12c9932609","resolution":{"observed_at":"2026-08-10T22:03:14.206501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-10T22:03:13.567677Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.567677Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:1f8597fb3b1653dcda504b154d9307c9f8535be60b7cec034e2f6caee700a5e1","observation_id":"64eed75c-bf0c-4969-83bb-40aaea962e3b","resolution":{"observed_at":"2026-08-10T22:03:13.567677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.571367Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.571367Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:ea8ae78620da87ac26fd0d7b3e223e823473493f75c27e3ef681996e8d2c311f","observation_id":"b109daf2-2980-4743-958d-42f79c300e2f","resolution":{"observed_at":"2026-08-10T22:03:13.571367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.574514Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.574514Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:b8a1fa9c3aba2a5bd3a9a273b23fc1848a2d91f91722b1991f41dbaccf792f97","observation_id":"6b771ff2-5635-44b5-8a17-01c9229c72bc","resolution":{"observed_at":"2026-08-10T22:03:13.574514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.178339Z","title":"Mochi, 2024","venue":null,"work_id":"77953b45-e3e8-49b9-aa69-7bc2ca3a3eef","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.578026Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:7b8459e241aee447bca77b2474fda30824095e225b4f49285150e38df2277db9","observation_id":"4b887705-b724-4b4f-9706-5f674216886e","resolution":{"observed_at":"2026-08-10T22:03:14.182265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.167464Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"c98818b2-dea3-4803-84a8-df5ff7c69f88","year":2019},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.581084Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:3b6ce0a29bc28cbb8720f4cf3247350f5d17ef96fb56fb99ff60805415532f30","observation_id":"2f6809d9-415c-4d7f-b01e-54c197622cf9","resolution":{"observed_at":"2026-08-10T22:03:14.171286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05919","last_updated":"2024-08-23T12:19:54Z","snapshot_observed_at":"2026-08-13T04:23:06.245493Z","submitted_at":"2024-02-08T18:53:21Z","title":"Collaborative Control for Geometry-Conditioned PBR Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05919","snapshot_observed_at":"2026-08-10T22:03:13.584320Z","title":"Collaborative control for geometry-conditioned pbr image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.584320Z"},"links":{"cited_paper":"/paper/2402.05919","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:1d385ba10dfd3be07fefe9363f7aa2da6fd451d54d8771d7280250cdf7e5b457","observation_id":"c2980faf-133d-4ffa-b348-550d351a2b2b","resolution":{"observed_at":"2026-08-10T22:03:13.584320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-10T22:03:13.587944Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.587944Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:6521b8f7b13ff7ebcca395e64d8ce2bad759246f0091caf35c9172b5005fe7b7","observation_id":"6a872c3a-1c30-4301-8639-4cb92218b276","resolution":{"observed_at":"2026-08-10T22:03:13.587944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20193","last_updated":"2024-10-16T18:35:31Z","snapshot_observed_at":"2026-08-13T00:42:02.442232Z","submitted_at":"2024-03-29T14:14:22Z","title":"Motion Inversion for Video Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20193","snapshot_observed_at":"2026-08-10T22:03:13.591248Z","title":"Motion inversion for video customization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.591248Z"},"links":{"cited_paper":"/paper/2403.20193","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:adf809c824fde3c2ba48acd9c40b78cfff95aedc58ff9638cdebe38ae18928ff","observation_id":"6b3dcc44-6f3f-4e3c-8ee4-888028d8e35b","resolution":{"observed_at":"2026-08-10T22:03:13.591248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-10T22:03:13.594637Z","title":"Linformer: Self-attention with linear complexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.594637Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:90f1a30b51d3d285c8ea96d23f976574d7de1f8fc0c52a24850af4122ffc8302","observation_id":"512d08bd-f631-41c7-9d90-58751db2b9c7","resolution":{"observed_at":"2026-08-10T22:03:13.594637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.154943Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"9d310ca8-8b3f-4d10-a32f-cef2b094ac8e","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.598510Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:7aac172627361d39484f5a61b2e7cebafe25efbedae4b18093371f0d058c2cff","observation_id":"63c5cdd1-33ff-4cf2-8e4e-c9a19f0aeeb0","resolution":{"observed_at":"2026-08-10T22:03:14.159682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.141847Z","title":"Matting by gen- eration","venue":null,"work_id":"f8f48722-f83b-49db-9fe9-596261faa49f","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.601790Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:f082fae4d6bf4ec59d28b51bc48f8683fd030c91b3234920ad7188857ee42aa9","observation_id":"b6b97726-9a36-4c7b-a5d5-2d35ee45692c","resolution":{"observed_at":"2026-08-10T22:03:14.146550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.128250Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"167cf42f-35b1-483e-8cbd-aa0a4f876305","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.604754Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:c2720d915f5225c38ed3bb914b2646cd8ecdc0c3997cb687a8a87012d4ac6c35","observation_id":"6ad6d65a-c755-4999-8fd4-84eb1afd773d","resolution":{"observed_at":"2026-08-10T22:03:14.133403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.607961Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.607961Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:342bfd5b52937947e9f5dc6fc47fabdeda198bdb332de64c7788d08c270d6a3a","observation_id":"a2292f6f-e30b-407e-8475-aac7795b01d5","resolution":{"observed_at":"2026-08-10T22:03:13.607961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.611264Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.611264Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:21a86c15b6ad3e24cebcc8c86b98c4575105d58904587c00c28e00f5a789067c","observation_id":"cb7266e3-3d5a-4b73-be7b-5e68cfddd3a5","resolution":{"observed_at":"2026-08-10T22:03:13.611264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.092866Z","title":"Defect spectrum: A granular look of large-scale defect datasets with rich semantics, 2023","venue":null,"work_id":"e5907c5b-9fb9-4ae9-b39f-1bfbd2ea2327","year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.614284Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:5ae447d0d98693e6ba38a8d6871a174aa6acda18318e04192cc8ab83c9483659","observation_id":"4d5867ce-f8bf-4556-886f-e54222dece11","resolution":{"observed_at":"2026-08-10T22:03:14.097866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.077463Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":"2a4c48aa-c0f9-488a-923a-053e3ac6033a","year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.617986Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:527ca162a03fca237e203a783dd3b04d36571d0ee31c7c97b089ddea87f24493","observation_id":"17a399d5-c3b3-4574-90ae-9e87fe0a46b0","resolution":{"observed_at":"2026-08-10T22:03:14.082993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-10T22:03:13.621400Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.621400Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:710da8fa5d151f69f52ac397a94751c133a76bf1300974577a56129943dba499","observation_id":"076a4e8c-9e4f-4c45-a651-b7bb78e3a649","resolution":{"observed_at":"2026-08-10T22:03:13.621400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.063793Z","title":"Vitmatte: Boosting image matting with pre- trained plain vision transformers","venue":null,"work_id":"db90ed7d-b266-4d14-95bf-2c2e2ea42773","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.625224Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:7b5b6a53dbf33d121a2cafe0ecd6225ae01dc72255bd66cb5fe79336f8f8de26","observation_id":"fa0a8843-2384-4d79-8045-fada524902e8","resolution":{"observed_at":"2026-08-10T22:03:14.068558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.047493Z","title":"Matte anything: Interactive natural image matting with seg- ment anything model","venue":null,"work_id":"858b5be3-2b49-4b06-96d1-3368b56b89f1","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.628305Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:7be931699f4be3568edf8db050d7e07ab7aa70b4cada86c72d34dfebe457c5fd","observation_id":"d579d974-74f6-4ba5-bc0f-7b745600b61c","resolution":{"observed_at":"2026-08-10T22:03:14.054262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-08-10T22:03:13.631543Z","title":"Dragnuwa: Fine-grained control in video generation by integrating text, image, and trajectory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.631543Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:ba7ed9b13e4194300d31493143ee415ec2d3c38db527af753ddaf43d6cabb304","observation_id":"85d6428e-d914-41d8-81b8-e38b830e588e","resolution":{"observed_at":"2026-08-10T22:03:13.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.034436Z","title":"Rgb ↔x: Image decomposition and synthesis using material-and lighting-aware diffusion models","venue":null,"work_id":"8460ebc7-c4d0-4705-be4b-bd257f984fec","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.635056Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:7110a16ae5570da1cb5c4a15a0bd690397e05712acf1f78f661fe240f02743c0","observation_id":"1372ece5-a478-4521-9186-b3cd2980fe5c","resolution":{"observed_at":"2026-08-10T22:03:14.038519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15818","last_updated":"2025-05-30T03:55:20Z","snapshot_observed_at":"2026-08-14T11:06:08.711477Z","submitted_at":"2023-09-27T17:44:18Z","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15818","snapshot_observed_at":"2026-08-10T22:03:13.638542Z","title":"Show-1: Marrying pixel and latent dif- fusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.638542Z"},"links":{"cited_paper":"/paper/2309.15818","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:af3ef22a1d6af9f0adc3d3267b42f480542de397227975e6c6a7eb3e1047dc85","observation_id":"0a911b25-bec6-4f3e-ae88-c69ad6e900f2","resolution":{"observed_at":"2026-08-10T22:03:13.638542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01827","last_updated":"2024-01-03T16:43:47Z","snapshot_observed_at":"2026-08-14T19:42:45.702204Z","submitted_at":"2024-01-03T16:43:47Z","title":"Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01827","snapshot_observed_at":"2026-08-10T22:03:13.641920Z","title":"Moonshot: To- wards controllable video generation and editing with multi- modal conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.641920Z"},"links":{"cited_paper":"/paper/2401.01827","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:80aca500a22deed266880931a6c79c01e2e0f66b999e3c4ca9495b01cdbef0ff","observation_id":"51f06818-c4bc-4b66-a96d-abe6d9a07655","resolution":{"observed_at":"2026-08-10T22:03:13.641920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17113","last_updated":"2024-06-23T03:47:27Z","snapshot_observed_at":"2026-08-13T04:09:34.694404Z","submitted_at":"2024-02-27T01:19:53Z","title":"Transparent Image Layer Diffusion using Latent Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17113","snapshot_observed_at":"2026-08-10T22:03:13.645613Z","title":"Transparent image layer diffusion using latent transparency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.645613Z"},"links":{"cited_paper":"/paper/2402.17113","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:d4a9de0e00ac5e1860835c54bcc289ef4fde31857b377f27b487db039b4ba925","observation_id":"4ea32c1b-ee0a-4ca0-94af-761e78d1a6d2","resolution":{"observed_at":"2026-08-10T22:03:13.645613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.020604Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"cfe9102d-48f4-4b39-ba91-24a77bbc0325","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.648867Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:4919a72eb1648a3e64df2965d96a75468911dadc4c2f0497bdb03b00da347def","observation_id":"d7f1cd08-dae3-42d8-b294-952a66ebaa54","resolution":{"observed_at":"2026-08-10T22:03:14.024905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.000513Z","title":"Long-short transformer: Efficient transformers for language and vision","venue":null,"work_id":"5f0ca751-2025-407b-914e-3e7845037981","year":2021},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.651954Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:dc733d2f85a58b0f8baa4bdbc4c30de6e8390bac25166e9e2e34ed91621c246f","observation_id":"101c528c-8c6d-47fb-8c0a-7296197812fe","resolution":{"observed_at":"2026-08-10T22:03:14.007505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-15T03:29:22.305477Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-10T22:03:13.472136Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.472136Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:b3f512026210b8e8d18367e48b14080bec310759532ac94cc6fc04ef165f53ce","observation_id":"15c9ba3e-9780-4234-80b1-162c66cc75c6","resolution":{"observed_at":"2026-08-10T22:03:13.472136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T03:27:58.073388Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2501.03006."}