{"as_of":"2026-08-20T07:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a2976ddeeb60b01a0e1f19c12cdccdb9d3ae3feda181271b5b9d78ae8a1212c","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:35:16.950587Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:03:41.540128Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:28:38.455878Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2412.07750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07750","snapshot_observed_at":"2026-07-03T16:28:38.455878Z","title":"Multi-shot character consistency for text-to- video generation","venue":null,"work_id":"8e0a76d3-be7f-48b0-95ac-add064552485","year":2024},"citing_paper":{"arxiv_id":"2504.17816","last_updated":"2026-05-05T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-23T06:48:31Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T17:51:41.947939Z"},"links":{"cited_paper":"/paper/2412.07750","citing_paper":"/paper/2504.17816"},"observation_digest":"sha256:6bc1e5da0c7ba8b92bbc6c717c20f16f35162bb1c0e7da63659d124e96a22b38","observation_id":"306cfbe0-cad0-49d9-a05a-86e2bcf00a2c","resolution":{"observed_at":"2026-05-22T17:51:54.386962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2412.07750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07750","snapshot_observed_at":"2026-07-03T16:28:38.455878Z","title":"Multi-shot character consistency for text-to- video generation","venue":null,"work_id":"8e0a76d3-be7f-48b0-95ac-add064552485","year":2024},"citing_paper":{"arxiv_id":"2605.22144","last_updated":"2026-05-21T08:15:46Z","snapshot_observed_at":"2026-08-14T19:47:19.894008Z","submitted_at":"2026-05-21T08:15:46Z","title":"One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T06:51:58.805848Z"},"links":{"cited_paper":"/paper/2412.07750","citing_paper":"/paper/2605.22144"},"observation_digest":"sha256:5b7be58bdb4c17d860b1123c5941e374b530189eac2171969f231fa445fb1d63","observation_id":"4f8168d7-7c5b-41fc-8033-a44ef0e9c826","resolution":{"observed_at":"2026-05-22T06:54:42.283916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2412.07750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07750","snapshot_observed_at":"2026-07-03T16:28:38.455878Z","title":"Multi-shot character consistency for text-to- video generation","venue":null,"work_id":"8e0a76d3-be7f-48b0-95ac-add064552485","year":2024},"citing_paper":{"arxiv_id":"2607.01869","last_updated":"2026-07-02T08:25:38Z","snapshot_observed_at":"2026-07-07T00:07:23.664493Z","submitted_at":"2026-07-02T08:25:38Z","title":"QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-03T16:19:51.348169Z"},"links":{"cited_paper":"/paper/2412.07750","citing_paper":"/paper/2607.01869"},"observation_digest":"sha256:9b933d57ac5ec28765480e0ac41989aab40be2b50e686ad48e14f618d4aedfe3","observation_id":"5e401432-eab5-4669-b17d-42598cf234af","resolution":{"observed_at":"2026-07-03T16:28:38.457253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07750","snapshot_observed_at":"2026-07-14T07:11:45.493916Z","title":"arXiv preprint arXiv:2412.07750 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11081","last_updated":"2026-07-13T04:44:14Z","snapshot_observed_at":"2026-08-16T16:50:21.464152Z","submitted_at":"2026-07-13T04:44:14Z","title":"Controlling Motion Transfer in Diffusion Transformers via Attention Heads","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T07:11:45.493916Z"},"links":{"cited_paper":"/paper/2412.07750","citing_paper":"/paper/2607.11081"},"observation_digest":"sha256:8f4ea272080e18ef89ba8f01d823af196f11641a9c0a3372bb1fa4549814d193","observation_id":"e4eb856b-c412-43ef-ac26-de3dc9a1e027","resolution":{"observed_at":"2026-07-14T07:11:45.493916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07750","snapshot_observed_at":"2026-08-07T12:03:41.540128Z","title":"2412.07750 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06231","last_updated":"2026-08-06T16:20:23Z","snapshot_observed_at":"2026-08-19T08:54:45.148052Z","submitted_at":"2026-08-06T16:20:23Z","title":"EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:41.540128Z"},"links":{"cited_paper":"/paper/2412.07750","citing_paper":"/paper/2608.06231"},"observation_digest":"sha256:9e2525efab106531649846d55195d0d53338faf0e8a6f879989c1151a791f8ba","observation_id":"08af60c8-72de-4e8a-a88c-2ad176be53e3","resolution":{"observed_at":"2026-08-07T12:03:41.540128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.07750/citation-record","integrity":"/paper/2412.07750/integrity","json":"/paper/2412.07750/citation-record.json","paper":"/paper/2412.07750"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.01594","last_updated":"2024-09-08T06:31:22Z","snapshot_observed_at":"2026-08-18T04:49:11.958877Z","submitted_at":"2024-06-03T17:59:53Z","title":"DiffUHaul: A Training-Free Method for Object Dragging in Images","version":2},"cited_work":{"arxiv_id":"2406.01594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.01594","snapshot_observed_at":"2026-08-11T18:35:17.284342Z","title":"DiffUHaul: A Training-Free Method for Object Dragging in Images","venue":"cs.CV","work_id":"c921de9c-6a23-4e18-82fb-5e86809be69e","year":2024},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.862880Z"},"links":{"cited_paper":"/paper/2406.01594","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:7b5cc177ec6727ced36496d31372d38a7d5ca26f882c05d509f4b9ad1a71d34e","observation_id":"c02e6ad5-2f4f-429d-9a8c-ac74ba10588c","resolution":{"observed_at":"2026-08-11T18:35:17.289243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12052","last_updated":"2024-05-05T05:07:34Z","snapshot_observed_at":"2026-08-18T12:35:32.262800Z","submitted_at":"2023-11-18T10:22:44Z","title":"MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12052","snapshot_observed_at":"2026-08-11T18:35:16.869360Z","title":"Magicdance: Realistic human dance video generation with motions & facial expressions transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.869360Z"},"links":{"cited_paper":"/paper/2311.12052","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:c2e98e9340a04ea4b30346eefdd25cf883570d90e45e1f965c0a0f5eed9acf76","observation_id":"4814d1ce-11a7-439c-91e8-f5859e75758d","resolution":{"observed_at":"2026-08-11T18:35:16.869360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05922","last_updated":"2024-02-29T21:06:58Z","snapshot_observed_at":"2026-08-18T09:43:45.589906Z","submitted_at":"2023-10-09T17:59:53Z","title":"FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05922","snapshot_observed_at":"2026-08-11T18:35:16.872976Z","title":"press/v235/cohen24a.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.872976Z"},"links":{"cited_paper":"/paper/2310.05922","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:867919858fa7173dd3d6800cf34d012071dccafd83460f5c1dd4fdb3901ab8d7","observation_id":"08c8329b-99e4-4e56-be1c-034a86ca2132","resolution":{"observed_at":"2026-08-11T18:35:16.872976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17661","last_updated":"2024-05-27T21:23:20Z","snapshot_observed_at":"2026-08-20T01:41:53.071164Z","submitted_at":"2024-05-27T21:23:20Z","title":"RefDrop: Controllable Consistency in Image or Video Generation via Reference Feature Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17661","snapshot_observed_at":"2026-08-11T18:35:16.876124Z","title":"Refdrop: Control- lable consistency in image or video generation via refer- ence feature guidance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.876124Z"},"links":{"cited_paper":"/paper/2405.17661","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:4c7511a3bbdf95648ce021c3e91d234692d29b7cb0a75e55d231a4f4553fc1e6","observation_id":"96cf16f3-e45c-4c85-a73b-cfec85c9d13b","resolution":{"observed_at":"2026-08-11T18:35:16.876124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16811","last_updated":"2023-05-26T10:43:42Z","snapshot_observed_at":"2026-08-16T15:29:22.545206Z","submitted_at":"2023-05-26T10:43:42Z","title":"Improved Visual Story Generation with Adaptive Context Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16811","snapshot_observed_at":"2026-08-11T18:35:16.879529Z","title":"Improved visual story generation with adap- tive context modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.879529Z"},"links":{"cited_paper":"/paper/2305.16811","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:299f8d7e272804c0f4ec883523802a7954b64a88c5a61dc2d302ee0a72276f2c","observation_id":"a1f26d0e-3c04-4f20-b049-f5ef466dd22d","resolution":{"observed_at":"2026-08-11T18:35:16.879529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:17.366745Z","title":null,"venue":null,"work_id":"8d5d539d-2139-4034-bda5-d31f25421acc","year":2023},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.927107Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:eb43116a91350d0fc22c74b80daed7fd4a42607e10e35df6dbde83a4ca88e4d0","observation_id":"fc1c4fbd-5a64-43ed-8623-3217666bbc12","resolution":{"observed_at":"2026-08-11T18:35:17.369295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-15T03:17:05.670808Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-11T18:35:16.885560Z","title":"Geyer, M., Bar-Tal, O., Bagon, S., and Dekel, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.885560Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:7edc5e7b9a6f5fd523e8cd124cc20145d5b322f851505fd64633267924b2542d","observation_id":"f2a2c146-829d-4e65-8ccf-19a81bae2903","resolution":{"observed_at":"2026-08-11T18:35:16.885560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-11T18:35:16.888319Z","title":"Ltx- video: Realtime video latent diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.888319Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:d714166f69b85c34bdad65736e600140759f5acb4fd0dd337a464a4a2fab8985","observation_id":"e0935daa-8ced-48c9-ad0a-765ef3b32ddc","resolution":{"observed_at":"2026-08-11T18:35:16.888319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-08-17T07:05:18.024386Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-11T18:35:16.891108Z","title":"Animate anyone: Consistent and controllable image-to- video synthesis for character animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.891108Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:a81eec9c5aac0660f5edf61e9b69181dba677a8374a9bb029648e2e13f410abd","observation_id":"f2ede71e-80bf-48c2-8972-9f22ce990eef","resolution":{"observed_at":"2026-08-11T18:35:16.891108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03900","last_updated":"2023-02-08T06:24:06Z","snapshot_observed_at":"2026-08-17T12:54:30.107462Z","submitted_at":"2023-02-08T06:24:06Z","title":"Zero-shot Generation of Coherent Storybook from Plain Text Story using Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03900","snapshot_observed_at":"2026-08-11T18:35:16.894083Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.894083Z"},"links":{"cited_paper":"/paper/2302.03900","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:78ab7ce8e08fe9ad8a1fcf87eae619dec80026de0d2c9dce6118e1d656fa554f","observation_id":"8f5d5b41-2e8d-46fd-a4cc-5b6013f51680","resolution":{"observed_at":"2026-08-11T18:35:16.894083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13501","last_updated":"2025-03-18T13:55:22Z","snapshot_observed_at":"2026-08-18T23:48:41.279149Z","submitted_at":"2024-03-20T10:58:58Z","title":"VSTAR: Generative Temporal Nursing for Longer Dynamic Video Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13501","snapshot_observed_at":"2026-08-11T18:35:16.896642Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.896642Z"},"links":{"cited_paper":"/paper/2403.13501","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:a64e5c2c8d91419e17cf032902ac9bf46655485f7b70b0570ec71ac0457852a6","observation_id":"d0ecf98f-bd3e-4889-b625-63c5feacea1b","resolution":{"observed_at":"2026-08-11T18:35:16.896642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:17.307956Z","title":"Subject- Consistency","venue":null,"work_id":"4565a557-c294-4ad2-91c9-eba6afe5734d","year":2024},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.948111Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:2c386434d4065bdfbb991cabd94e51583b2e228de368323ebf8a3218e9890065","observation_id":"e28642e8-d064-4509-9064-2231aceae793","resolution":{"observed_at":"2026-08-11T18:35:17.310571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10003","last_updated":"2022-03-30T15:42:46Z","snapshot_observed_at":"2026-08-17T20:57:02.373441Z","submitted_at":"2021-12-18T21:27:19Z","title":"Image Segmentation Using Text and Image Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10003","snapshot_observed_at":"2026-08-11T18:35:16.901921Z","title":"and Ecker, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.901921Z"},"links":{"cited_paper":"/paper/2112.10003","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:47d1a838629449326d4dacc321d5b47f2a00924b305c2b70a942514be5bf2bed","observation_id":"0a309c25-bdec-4be5-9bbc-ab37e964011a","resolution":{"observed_at":"2026-08-11T18:35:16.901921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:17.329898Z","title":null,"venue":null,"work_id":"df3510d8-9c2b-4ff7-a07a-b9c797c08fc2","year":2024},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.940152Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:a6900c1fb0be05fc7ca192cb7639ca963f3d8b6957bb24d0a0a308fea10907b9","observation_id":"be84505c-2324-4993-9f12-a1f3314dc0ff","resolution":{"observed_at":"2026-08-11T18:35:17.332352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18830","last_updated":"2023-11-30T18:59:33Z","snapshot_observed_at":"2026-08-16T14:38:42.204570Z","submitted_at":"2023-11-30T18:59:33Z","title":"MotionEditor: Editing Video Motion via Content-Aware Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18830","snapshot_observed_at":"2026-08-11T18:35:16.912780Z","title":"Motioneditor: Editing video motion via content-aware diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.912780Z"},"links":{"cited_paper":"/paper/2311.18830","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:5042582c31037d2346f1b1d2390061802c66bdad72951fb19d5f4da1e053eea0","observation_id":"bfa43981-1269-46e2-a503-8ff981636191","resolution":{"observed_at":"2026-08-11T18:35:16.912780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-11T18:35:16.915248Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.915248Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:0c464f1cdb883c0a1054002cb174c97ba3a685884b2dc69480b98fa73e3a9f14","observation_id":"f394ed85-63da-4bd9-bdab-b93fa1df3f0f","resolution":{"observed_at":"2026-08-11T18:35:16.915248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20193","last_updated":"2024-10-16T18:35:31Z","snapshot_observed_at":"2026-08-19T18:57:50.107043Z","submitted_at":"2024-03-29T14:14:22Z","title":"Motion Inversion for Video Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20193","snapshot_observed_at":"2026-08-11T18:35:16.917728Z","title":"Motion inversion for video customization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.917728Z"},"links":{"cited_paper":"/paper/2403.20193","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:b228fefef3c388a5854ff7af01a6e991429d9805131cdd1431181e97e4828190","observation_id":"6206594e-ea30-4a8b-a6a0-535314020417","resolution":{"observed_at":"2026-08-11T18:35:16.917728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-11T18:35:16.920263Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.920263Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:2330b9a2cc91df27ac7d146e8492713b1cd711848826303780c58f2ce0861cb8","observation_id":"f6c83cd4-12c4-407d-9603-62947ab807c3","resolution":{"observed_at":"2026-08-11T18:35:16.920263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:16.922491Z","title":"Magic mirror: Id-preserved video generation in video diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.922491Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:c22274b473952676f695d2907b3922d2194ca96bfed3c5242160260ee19acde2","observation_id":"9ae7e29c-bfaf-4bf8-baec-83e7c3f361dc","resolution":{"observed_at":"2026-08-11T18:35:16.922491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08850","last_updated":"2024-02-19T02:42:27Z","snapshot_observed_at":"2026-08-19T03:59:50.901914Z","submitted_at":"2023-05-15T17:59:03Z","title":"Make-A-Protagonist: Generic Video Editing with An Ensemble of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08850","snapshot_observed_at":"2026-08-11T18:35:16.924630Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.924630Z"},"links":{"cited_paper":"/paper/2305.08850","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:ed82f8a509d41889a96083e93325bea4974a2bf95579e6305a14f6c13723cc91","observation_id":"2186a50c-2a92-46bf-8bec-d8cbbb0b9e78","resolution":{"observed_at":"2026-08-11T18:35:16.924630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:17.352429Z","title":"Injecting only vanilla query features (Qv) preserves dynamic motion but results in inconsistent subjects across shots (row 3)","venue":null,"work_id":"cfcd54d7-07e4-4154-af00-fdcbd4642237","year":2023},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.932056Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:a0a035bb5770320d4ac76139c45bb21b7e088bed51e049d78f7e95a4a6521373","observation_id":"1f1dbf8d-f87b-4d8f-bfff-5f46f7fb62c9","resolution":{"observed_at":"2026-08-11T18:35:17.355411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:17.344904Z","title":null,"venue":null,"work_id":"ef9d78dd-ae63-4625-ae6d-6cee2d57e69f","year":2024},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.935175Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:4be600f05fa51fad3a842da769579cbc1cd3ea39c69b6700470c75c92a9aa558","observation_id":"03f16e5c-a0f0-4e4e-82a3-3fc77e6466e3","resolution":{"observed_at":"2026-08-11T18:35:17.347693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:17.337105Z","title":"We personalize TokenFlow by conditioning the IP-Adapter on the first frame of one video generated by the vanilla model","venue":null,"work_id":"44ccd0d1-6f1e-4df2-abb3-907e71c7ea9e","year":2023},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.937738Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:71416d6110490817b3f61c66dd5ebe299da8d1b9d503f237fb7f4a7fb5b5a1ec","observation_id":"b04f9768-a260-4030-931c-19d997e3f9c6","resolution":{"observed_at":"2026-08-11T18:35:17.339900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:17.322651Z","title":"ConsiS +Uncond","venue":null,"work_id":"e047eef1-0d37-44b2-a0d8-780737ab9f82","year":2024},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.943018Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:1dc8bd6b9db407eac22ef5dc1dc95f764f8aef32bd47297ae446091ef96659e5","observation_id":"e70123ea-2dfc-4907-ba46-83e27acbd953","resolution":{"observed_at":"2026-08-11T18:35:17.325321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:17.315293Z","title":"Otsu’s method","venue":null,"work_id":"4d23bedb-9cd9-4b7c-96b1-43391d71d643","year":1979},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.945627Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:0dc35b7a8a87f458f252e144175902c1ed5878a5707a16af937b75ae83849115","observation_id":"bc0fec0d-f0c6-4dbf-8fc5-5fc29cae2cae","resolution":{"observed_at":"2026-08-11T18:35:17.317924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:17.300474Z","title":null,"venue":null,"work_id":"7a978a3a-9193-4fae-b6c4-c14ac866164f","year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.950587Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:428b7df05b8b4377a4a6b3d5a1319ddc65ddf1c9c1bca097e0d56cff9f7d90f6","observation_id":"d3b90aed-49f4-4ec9-be6d-dfa5330de91a","resolution":{"observed_at":"2026-08-11T18:35:17.303039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:17.359930Z","title":null,"venue":null,"work_id":"84b9cb6f-91c4-4b14-9ea5-c6ac9e93879f","year":2024},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":600,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.929350Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:957564cb3fb37580e76acc03df091afe06727bed7a16a5b89452077a551bdd42","observation_id":"d3d184bd-b68b-41db-b843-b7399613e240","resolution":{"observed_at":"2026-08-11T18:35:17.362295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:16.907517Z","title":"1979.4310076","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":1979,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.907517Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:01e8871dec4c8ee4bd8f22389deccbd63d2662a7fd35640f5384604bf159b1f3","observation_id":"2a1d59fb-d0df-459b-887e-39930bf74aec","resolution":{"observed_at":"2026-08-11T18:35:16.907517Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:16.910168Z","title":"Key-locked rank one editing for text-to-image personalization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.910168Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:2c63fdc2c73a9b01f1f0f40365f75a44ec0cec2d9f2c6afe95dbeb80a60df02d","observation_id":"1288c9d0-be5b-4a15-bc85-ab3e06c8b8f5","resolution":{"observed_at":"2026-08-11T18:35:16.910168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12540","last_updated":"2025-02-06T08:37:43Z","snapshot_observed_at":"2026-08-18T10:17:42.429119Z","submitted_at":"2023-12-19T19:19:19Z","title":"Lightning-Fast Image Inversion and Editing for Text-to-Image Diffusion Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12540","snapshot_observed_at":"2026-08-11T18:35:16.904776Z","title":"Fixed-point inversion for text-to-image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.904776Z"},"links":{"cited_paper":"/paper/2312.12540","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:b3c0c6688c6cbe445888c0cc2d66ef76839dfa52ad24fded8a20bdec182171a9","observation_id":"66cf5e9e-5624-4fee-9d94-90a0220fe9c0","resolution":{"observed_at":"2026-08-11T18:35:16.904776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-11T18:35:16.882527Z","title":"Gal, R., Arar, M., Atzmon, Y ., Bermano, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.882527Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:c8cbecc62e6e19e8c514766c2c2648557da5c208770962d18657437e82c8d984","observation_id":"828a9d1f-8e7a-4428-b9c2-e6a2d2070834","resolution":{"observed_at":"2026-08-11T18:35:16.882527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10093","last_updated":"2024-06-05T14:34:30Z","snapshot_observed_at":"2026-08-16T14:42:35.347831Z","submitted_at":"2023-11-16T18:59:51Z","title":"The Chosen One: Consistent Characters in Text-to-Image Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10093","snapshot_observed_at":"2026-08-11T18:35:16.859285Z","title":"The cho- sen one: Consistent characters in text-to-image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.859285Z"},"links":{"cited_paper":"/paper/2311.10093","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:4e4bcd471d69292f253767e3959b848ac470da3bcaf54de62660036a8cc814f6","observation_id":"985aecac-3182-48ea-ad0e-e90608c7e610","resolution":{"observed_at":"2026-08-11T18:35:16.859285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13185","last_updated":"2024-04-07T12:11:28Z","snapshot_observed_at":"2026-08-16T14:16:52.605575Z","submitted_at":"2024-02-20T17:52:12Z","title":"UniEdit: A Unified Tuning-Free Framework for Video Motion and Appearance Editing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13185","snapshot_observed_at":"2026-08-11T18:35:16.865893Z","title":"Uniedit: A unified tuning-free framework for video motion and appearance editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.865893Z"},"links":{"cited_paper":"/paper/2402.13185","citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:59416f79ba304dc9f24b2a37f30a99cc76417c68a90a7b4370b74e41ac773aef","observation_id":"0dcaa5ad-73df-4ca5-b444-a4888e8e5391","resolution":{"observed_at":"2026-08-11T18:35:16.865893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:35:16.899307Z","title":"Liu, C., Wu, H., Zhong, Y ., Zhang, X., and Xie, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T18:35:16.899307Z"},"links":{"citing_paper":"/paper/2412.07750"},"observation_digest":"sha256:ebe7c631c03c0d57c54e2e0007162fcaa49af4a9569d03157ffd9c27da6c7b1e","observation_id":"4566b277-eb06-4d13-b2f1-d1cad7407ed5","resolution":{"observed_at":"2026-08-11T18:35:16.899307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.07750","last_updated":"2025-05-22T17:41:38Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T12:26:02.949820Z","submitted_at":"2024-12-10T18:49:39Z","title":"Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 5 inbound Pith citation observations for arXiv:2412.07750."}