{"as_of":"2026-08-17T05:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:785c87e07a0470d24e1215faaa479ebc4a4e4f0a16e23c1864f40ef92d27a4ea","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:56:59.884771Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T07:59:49.398271Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T08:02:10.321954Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"cited_work":{"arxiv_id":"2412.10533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10533","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sugar: Subject-driven video customization in a zero-shot manner","venue":null,"work_id":"3ed6569e-1ce2-49ae-a8d4-247f85be8cc1","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2412.10533","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:e557fdf651ea71c2fa1523ab0ab9eca842499d0c2ef642bf42be0aaa1c6ecd58","observation_id":"4fa29253-1ce0-4f96-9a5e-93e646f1a396","resolution":{"observed_at":"2026-05-19T08:02:10.325181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10533/citation-record","integrity":"/paper/2412.10533/integrity","json":"/paper/2412.10533/citation-record.json","paper":"/paper/2412.10533"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.708772Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.708772Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:52e919286250832f3ecb44c0473bc1df75eeee0df346d46b27f76f74ddead955","observation_id":"59bbd1ae-a2aa-4e20-a7d3-d2373a329493","resolution":{"observed_at":"2026-08-11T15:56:59.708772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-16T13:54:44.432320Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-11T15:56:59.712836Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.712836Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:5649004bcb97db642d91d58cafcc3cb6dc212157a679e071498b1905eee13c92","observation_id":"2da0f429-201e-4bbc-b52f-3584b8011976","resolution":{"observed_at":"2026-08-11T15:56:59.712836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-16T12:52:49.101262Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T15:56:59.716910Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.716910Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:972c62984ad694fca9deb84c33ebed06baf0bfa0b0c80f19e18cb01f6a364ba3","observation_id":"47ccf589-3e8c-4a81-a250-70e485f63dcb","resolution":{"observed_at":"2026-08-11T15:56:59.716910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.383371Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":"3a76d7cb-03e0-4a88-9cba-7e8e09613f0c","year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.721156Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:3dd4b56d2de1fb2a65aeff0c8af8ac949caece5c4592eac75ad7249850d526d8","observation_id":"a36975d0-24fe-4705-82b5-f943b630e39b","resolution":{"observed_at":"2026-08-11T15:57:00.386952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.724691Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.724691Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:005d0812525b3c7207c6254b0f0b17bf999f4d944787d018680a05b8b685b736","observation_id":"39352f1e-6020-4f50-93e1-e8d983bde9e4","resolution":{"observed_at":"2026-08-11T15:56:59.724691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.728227Z","title":"Video generation models as world simulators,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.728227Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:24fd489bce0b13ea577330356e0b287cfce0e3b0a33d956e7397eb654f77356a","observation_id":"0c507006-2423-4db7-a323-9863727f7743","resolution":{"observed_at":"2026-08-11T15:56:59.728227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.360128Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"c79d848e-b7a6-419b-9708-126447f94dc0","year":2021},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.731701Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:13967f13b609987b36c11b333905d38f97d2f2ffcb1c00ab06a406fc37814a19","observation_id":"19a02f93-75f1-43c3-a073-e295672d3991","resolution":{"observed_at":"2026-08-11T15:57:00.363853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.348747Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers, 2024","venue":null,"work_id":"3856f44e-442c-42f5-8be9-e0ce81958a4e","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.735334Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:7941c6221702d12dd3078d4175dd7155801622f1df7e7b66e14fc8c0fe29045d","observation_id":"b90e1452-3a61-48ec-8aca-a7dcaaf71de6","resolution":{"observed_at":"2026-08-11T15:57:00.352581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00186","last_updated":"2023-10-02T08:08:45Z","snapshot_observed_at":"2026-08-16T17:06:05.825253Z","submitted_at":"2023-04-01T00:47:35Z","title":"Subject-driven Text-to-Image Generation via Apprenticeship Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00186","snapshot_observed_at":"2026-08-11T15:56:59.739929Z","title":"Subject-driven text-to-image generation via apprenticeship learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.739929Z"},"links":{"cited_paper":"/paper/2304.00186","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:09ee081be9e8d72730cd9b62dcb71bee828ffbf4525625f76f8278205f4b397d","observation_id":"1ad3085a-95b8-41f1-b6ef-dbf825b5011b","resolution":{"observed_at":"2026-08-11T15:56:59.739929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09481","last_updated":"2024-05-08T03:21:34Z","snapshot_observed_at":"2026-08-16T15:15:13.894611Z","submitted_at":"2023-07-18T17:59:02Z","title":"AnyDoor: Zero-shot Object-level Image Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09481","snapshot_observed_at":"2026-08-11T15:56:59.743465Z","title":"Anydoor: Zero-shot object-level im- age customization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.743465Z"},"links":{"cited_paper":"/paper/2307.09481","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:0e133d5f2f9a0b3c64bbc3e23656316aeef73a11f01ecc82bdeae0cea7b57e60","observation_id":"de93377e-56ca-4595-afec-b447c7392da1","resolution":{"observed_at":"2026-08-11T15:56:59.743465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.747211Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.747211Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:d22f8bfa0488e6c18414d39b197c5be8b3ec72b85a1f609abae9ed28a69bb928","observation_id":"98d16545-fab3-48ce-9904-a5a0de3c467c","resolution":{"observed_at":"2026-08-11T15:56:59.747211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.330184Z","title":"An image is worth one word: Personalizing text-to-image gener- ation using textual inversion","venue":null,"work_id":"04f8f67e-4ec5-4113-8cbe-69480e2bad61","year":2022},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.750662Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:7abe8a815651273acfb327310f349fdffed7a15ecdbf236514ebc94eafc33b2d","observation_id":"b9daad35-7f56-459e-83d2-4af4696b8dda","resolution":{"observed_at":"2026-08-11T15:57:00.334812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.319699Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"a996abe7-5636-4681-90c4-b6fb6c4518e3","year":2025},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.753971Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:1fd0a32cd32f033e7a93f6f853ab7f30dc1c9c345af033b52eb6173cfcb0e90f","observation_id":"1c6d2022-1679-4b6c-ad95-00f8dd4db59d","resolution":{"observed_at":"2026-08-11T15:57:00.323368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.757231Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.757231Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:4085a56936392b28abbce8c3bdcb7319860e03821e8b1bf9a012a918abb98d0b","observation_id":"1a2aa6c9-2160-4eae-9379-631fb3845d01","resolution":{"observed_at":"2026-08-11T15:56:59.757231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T15:56:59.760051Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.760051Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:03ee754110cde6a08bc24b0cfaff66275f6c02749b2de81434b3c1092dae2832","observation_id":"87563d6d-011a-4ccf-b66f-8fceb9f4dd53","resolution":{"observed_at":"2026-08-11T15:56:59.760051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.763446Z","title":"Vbench: Com- prehensive benchmark suite for video generative models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.763446Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:c0578d49700a605bf89d6218242ace1365df609a7a2b1080fbfc68b8e692cadd","observation_id":"c5225c12-bf47-4636-b644-ba3ba1acf683","resolution":{"observed_at":"2026-08-11T15:56:59.763446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.296614Z","title":"Videobooth: Diffusion-based video generation with image prompts","venue":null,"work_id":"7712953d-3a7b-497e-9c5e-0d0ec0c4b521","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.766888Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:1cefe92218ccc8112b2a1ddaf9706285899f98cd8b9ebbc08addf60dda249ca9","observation_id":"6448f32a-29d8-44cf-a834-14cb6e323c87","resolution":{"observed_at":"2026-08-11T15:57:00.300238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T15:56:59.769753Z","title":"Auto-encoding varia- tional bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.769753Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:8765ced62f0919b656e4df99e605aa445a0a358838df4f13477e27a40db63422","observation_id":"9b7c4109-6273-4269-836a-ad3c8baaf761","resolution":{"observed_at":"2026-08-11T15:56:59.769753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-11T15:56:59.773238Z","title":"Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.773238Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:7643b7063036e59a9f1eb8b74b1992a6b1124d3f0bc4e6b7abb59d35939f8eab","observation_id":"50558660-b6e4-4882-ba4c-733cb2f67264","resolution":{"observed_at":"2026-08-11T15:56:59.773238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04488","last_updated":"2023-06-20T16:26:38Z","snapshot_observed_at":"2026-08-16T16:09:58.653351Z","submitted_at":"2022-12-08T18:57:02Z","title":"Multi-Concept Customization of Text-to-Image Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04488","snapshot_observed_at":"2026-08-11T15:56:59.776657Z","title":"Multi-concept customization of text-to-image diffusion.arXiv preprint arXiv:2212.04488,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.776657Z"},"links":{"cited_paper":"/paper/2212.04488","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:2ce054db2dbffc957a0afc2f8fd5871cdea3e3cc0361bf56b66c7703f5f3e758","observation_id":"633e40d1-d54a-4ff4-9af5-814284aae0de","resolution":{"observed_at":"2026-08-11T15:56:59.776657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.286211Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":"a0141b76-8b64-4dd9-9954-e47bc7512867","year":1931},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.780665Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:bea938d331f7ae4799f6523330cf0cd2e0e2973fc70eb075e85b4353b4f8805d","observation_id":"6f922097-c920-4097-bf7d-78921a88ae39","resolution":{"observed_at":"2026-08-11T15:57:00.289833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.784156Z","title":"Flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.784156Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:c2124eb884987ac4b5759727d415321e3a21a570dc032a67ea3d467c09ee6fb4","observation_id":"d11d5300-00fa-4a67-be32-82579b415bdd","resolution":{"observed_at":"2026-08-11T15:56:59.784156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.268478Z","title":"Luma dream machine, 2024","venue":null,"work_id":"c1878f19-dcf4-4804-a822-72a459dfeafb","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.787688Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:b4e196cab6f5f27f3216c2867d9798d31e54b8c06a98071906ddc8788c3dced4","observation_id":"d95009a3-d759-4854-8e37-0299f77eafaa","resolution":{"observed_at":"2026-08-11T15:57:00.272606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11410","last_updated":"2024-05-19T01:40:39Z","snapshot_observed_at":"2026-08-16T15:14:25.961999Z","submitted_at":"2023-07-21T08:09:47Z","title":"Subject-Diffusion:Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11410","snapshot_observed_at":"2026-08-11T15:56:59.791130Z","title":"Subject-diffusion: Open domain personalized text-to-image generation without test-time fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.791130Z"},"links":{"cited_paper":"/paper/2307.11410","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:7d4f4fb60f7820c2bf6265283901568a92c70ca909fb5fb288f6069cf1aa7fce","observation_id":"e1e03782-b62d-45ab-b5e6-2e7bb7fc09c9","resolution":{"observed_at":"2026-08-11T15:56:59.791130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.257843Z","title":"Dinov2: Learning robust visual features with- out supervision, 2024","venue":null,"work_id":"bb815dfe-ac96-4ae0-9fd9-c457900a72ff","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.794848Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:0a0cdcf7e415d93df0be1482db481bd0359139a8d9c992e55863d74559022b55","observation_id":"d6e1cda3-4448-4b27-a6da-8eb19ecb3b51","resolution":{"observed_at":"2026-08-11T15:57:00.261606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-08-16T14:55:02.836558Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-11T15:56:59.798517Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.798517Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:0f6a7b6a0b7730b04bd81a62483f3b162480e39b9ca8cc282a333cf207549996","observation_id":"4b479e08-728f-4663-b945-eddc8005300b","resolution":{"observed_at":"2026-08-11T15:56:59.798517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.247147Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"77fffbf0-b4ff-4fb0-8de7-7efe75599635","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.802465Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:e7eb28f69c9eb9ae3bfd063487ded5cb0a80a77ee4349a0d23a6fa9442045f88","observation_id":"40c450c9-ddfe-44be-afe6-d3d52000a588","resolution":{"observed_at":"2026-08-11T15:57:00.250736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-11T15:56:59.806149Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.806149Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:1a88991f0ba31d5469817a671d9d0092430bb3f65ac2fe2338aac6361b590376","observation_id":"5e08c81f-3c88-4e61-860c-d37d401936bd","resolution":{"observed_at":"2026-08-11T15:56:59.806149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.236717Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"5095c2e7-3728-4c46-b965-95e350074557","year":2021},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.810182Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:08cab533e2a09d12ccd08f008fecdb3d7e590ab56d729edab9828cd7e3b8283e","observation_id":"158342f1-584f-4a33-843f-9cb45ecf18c3","resolution":{"observed_at":"2026-08-11T15:57:00.240382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.226811Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"02f7fe65-fbfa-4846-886b-d3cf13ed792c","year":2021},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.813440Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:1b0d8e29985835eb70070da63bb08ee2b57fe259777f96b2c46e0174ffa38b3c","observation_id":"b73b69ad-680a-4ed4-9775-650c7037ff28","resolution":{"observed_at":"2026-08-11T15:57:00.230002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.816893Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.816893Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:5220c93781e329f71a33fa46b547e3d727ad95e8e97266be5c1b5470129cbe6a","observation_id":"559d896d-e333-4552-ba5c-dea380914e72","resolution":{"observed_at":"2026-08-11T15:56:59.816893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.820341Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.820341Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:f2cd3bd0c7bbcbd775090e90d9f36efac9772401fdfe8c75cebd11c51a2a0e02","observation_id":"8a12b6b9-2fdc-411d-8db7-aa32eda2861e","resolution":{"observed_at":"2026-08-11T15:56:59.820341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.204591Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"4b676510-59ea-492e-8738-b7db09606779","year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.823699Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:73e229e352147658d7cf013eec47c85059216596580627e60019553685b63e0b","observation_id":"a8414ba3-8c42-49b0-b472-3d24bee5d2c6","resolution":{"observed_at":"2026-08-11T15:57:00.207888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.195405Z","title":"Gen-3 alpha, 2024","venue":null,"work_id":"d9f292d5-9f27-4167-bac2-2e2d8ab5eeb7","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.827139Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:0225d2f987602ae54a140c740dbfeb0e3c5d5a583affb49fb2277e87780e46ac","observation_id":"21ce158a-a063-4d99-b97b-da9aa34c843b","resolution":{"observed_at":"2026-08-11T15:57:00.198475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.830494Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.830494Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:994e4cbe6d732f55b42f530121c209490a4c7b0b9338f6ca32ce2e90587c86cc","observation_id":"5491f2eb-6d4a-4dbb-bd1b-04c6b0d53833","resolution":{"observed_at":"2026-08-11T15:56:59.830494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03411","last_updated":"2023-04-06T23:26:38Z","snapshot_observed_at":"2026-08-16T15:42:07.986767Z","submitted_at":"2023-04-06T23:26:38Z","title":"InstantBooth: Personalized Text-to-Image Generation without Test-Time Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03411","snapshot_observed_at":"2026-08-11T15:56:59.834021Z","title":"Instant- booth: Personalized text-to-image generation without test- time finetuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.834021Z"},"links":{"cited_paper":"/paper/2304.03411","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:a1c6631c104d15e106479e41a6f865bc2f9170503e420857288001ca66d9ad76","observation_id":"db47afd9-34be-4b37-9adb-275cf0cb64e5","resolution":{"observed_at":"2026-08-11T15:56:59.834021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.178484Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"62009d82-d930-4438-a4ac-14b7ea034e70","year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.837693Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:b45cf367d2fa643c2ea3e86ee1dcd121a20c349a87ca4eae07a369d75148a2c9","observation_id":"2571f636-ea87-4d93-a27c-5cc3282ffd47","resolution":{"observed_at":"2026-08-11T15:57:00.182057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.168543Z","title":"Vidu-1.5, 2024","venue":null,"work_id":"4baaa741-7921-4e09-92c6-82ac43cfcd48","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.841160Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:3529419a03aaecfcd5050c2e2aee43e2c069b2c1c4af8ad31e79cb0aa881bedd","observation_id":"140dc4fc-bdbf-4cee-8409-0842352a484e","resolution":{"observed_at":"2026-08-11T15:57:00.171942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.844534Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.844534Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:0fca9534383ecd0b4a11e0f6e3ed758d6d5f6c911983ab1fc8a004087fbc91e9","observation_id":"74d9c82e-6976-4601-90e8-36461d81ec3a","resolution":{"observed_at":"2026-08-11T15:56:59.844534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T15:56:59.847951Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.847951Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:34f087803995161dae7ada854307d5b6f7fd729e0a0d28fd90936b5f2a4e2d6f","observation_id":"b31fab30-08df-4b24-a023-d72695fb7a04","resolution":{"observed_at":"2026-08-11T15:56:59.847951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-16T14:57:26.418806Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-11T15:56:59.851385Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.851385Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:729e28afb3ec0fc69c2eaffa1a7e3d160c15630cab67a09d037b60a775e81589","observation_id":"8cbef5c0-658a-4364-9608-70e79551bd21","resolution":{"observed_at":"2026-08-11T15:56:59.851385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.151551Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":"d185a7fc-cb47-432e-bdab-83f582a3e597","year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.854770Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:f7eeaf49010b2e1be70104b4956efe16b5f438e8ce70bdec6d2dc9ca8eb40751","observation_id":"2773f20a-be5a-40e7-b5f4-45f16055ae43","resolution":{"observed_at":"2026-08-11T15:57:00.155337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13848","last_updated":"2023-08-18T17:12:13Z","snapshot_observed_at":"2026-08-16T15:52:24.593165Z","submitted_at":"2023-02-27T14:49:53Z","title":"ELITE: Encoding Visual Concepts into Textual Embeddings for Customized Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13848","snapshot_observed_at":"2026-08-11T15:56:59.857766Z","title":"Elite: Encoding visual con- cepts into textual embeddings for customized text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.857766Z"},"links":{"cited_paper":"/paper/2302.13848","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:e7825def6985ba0bfb125549be07311e3eef8c2b7ce3c617fc96a6b546b6057f","observation_id":"db47e8a1-1982-4929-bca5-aa81b5b3b573","resolution":{"observed_at":"2026-08-11T15:56:59.857766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.140568Z","title":"Dreamvideo: Composing your dream videos with customized subject and motion","venue":null,"work_id":"c12cc9bb-c658-40de-a5a0-7e6142908948","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.861277Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:df6a22c84e366b4615e3e0e844c37145d289a9804e58b97513cca8b3dcb4ebc9","observation_id":"aca6d5a6-5ab2-4d32-9675-11172a53646f","resolution":{"observed_at":"2026-08-11T15:57:00.144278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13830","last_updated":"2024-10-17T17:52:57Z","snapshot_observed_at":"2026-08-16T13:08:18.039945Z","submitted_at":"2024-10-17T17:52:57Z","title":"DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13830","snapshot_observed_at":"2026-08-11T15:56:59.864206Z","title":"Dreamvideo-2: Zero-shot subject- driven video customization with precise motion control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.864206Z"},"links":{"cited_paper":"/paper/2410.13830","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:29f283b0144eff6cc4842cc45ef1a0b1abfe39bb916d8ebcd054a4a659726a8b","observation_id":"c9b27005-25cd-49eb-8902-43ac6720a73d","resolution":{"observed_at":"2026-08-11T15:56:59.864206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.867818Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.867818Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:e425daef2065f500dc21ec9d717bd1fc4f763d34c4c7c917f9e531d72677ccfa","observation_id":"5621611e-500a-407e-ae53-d9bc6eaf7c1a","resolution":{"observed_at":"2026-08-11T15:56:59.867818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-08-16T14:51:02.499752Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-08-11T15:56:59.870792Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.870792Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:d4336941a9ce917a6b07b4176205c3c1ab483579fdf1a68cc571e250426eef9b","observation_id":"e5ab495c-cb78-4a2b-9de3-372923b1b56c","resolution":{"observed_at":"2026-08-11T15:56:59.870792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T15:56:59.874312Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.874312Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:65a141e9ec47af3002dafba35e58abaaaf7e235ccee7ab558fe497c6a6e1e910","observation_id":"4f4d8f0a-e63a-4cdb-ba46-260d45622ead","resolution":{"observed_at":"2026-08-11T15:56:59.874312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13579","last_updated":"2023-05-23T01:14:53Z","snapshot_observed_at":"2026-08-16T15:30:52.035720Z","submitted_at":"2023-05-23T01:14:53Z","title":"Enhancing Detail Preservation for Customized Text-to-Image Generation: A Regularization-Free Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13579","snapshot_observed_at":"2026-08-11T15:56:59.877924Z","title":"Enhanc- ing detail preservation for customized text-to-image gen- eration: A regularization-free approach","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.877924Z"},"links":{"cited_paper":"/paper/2305.13579","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:8c15a5bdab06864c4050f6ec527a8cd5c75b4f97a949e18539f7045bcce57e44","observation_id":"1e2374a1-e3d0-4798-a079-795cecbda668","resolution":{"observed_at":"2026-08-11T15:56:59.877924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.123664Z","title":"Cus- tomization assistant for text-to-image generation","venue":null,"work_id":"4095336d-61b1-47bf-9004-c926364bb53a","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.881408Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:23944a9e0d299d3f582d5cb6a9afa6175fc6fdb0794dc159ba295e3715bccf5e","observation_id":"3a35599c-b16c-48cb-aa01-978009ec18a0","resolution":{"observed_at":"2026-08-11T15:57:00.127398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.110687Z","title":"pencil drawing drawn by a hand","venue":null,"work_id":"cfb024ad-8e8b-440a-aef1-01c4c29c5fa3","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.884771Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:2ebb6bf2a018d54f2cead59469923cbcc20bf3d159c2278256f41907aa2f8e79","observation_id":"0690ad41-8ad0-4b17-a153-70a55b4b9120","resolution":{"observed_at":"2026-08-11T15:57:00.116346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T12:46:09.954377Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2412.10533."}