{"as_of":"2026-08-24T04:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31b40eb2c6c6f106396cb78d1d9f23126ba66bfe9b3fbff2c0fa310d435d17b8","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T17:40:00.224358Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.04702/citation-record","integrity":"/paper/2605.04702/integrity","json":"/paper/2605.04702/citation-record.json","paper":"/paper/2605.04702"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:226fdad50f467df7d09ed0c6c7efe9c887d3bad5bf5810ad9191e6f7bc300801","observation_id":"fbbcac54-57a7-407c-8dd4-8b430059df6c","resolution":{"observed_at":"2026-05-11T17:21:09.757564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.817115Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":"466a3f28-f5e8-456f-9a6a-a6b0fdb10a43","year":2019},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:071e4eb050692fd1d9b90676cf9eda66d741219f6dde06a34bdaa09d35c0ebc6","observation_id":"7f8e9674-6220-4c54-90a8-7b2270b1f39a","resolution":{"observed_at":"2026-05-26T07:06:53.178132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MAGREF: Masked guidance for any-reference video generation with subject disentanglement","venue":null,"work_id":"f998b8ba-aed8-4a59-807d-753b8b892645","year":2026},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:7b09b46950de3b026a395154de87cd21770709dcb84e609ef41664a02222335c","observation_id":"12029f05-a048-4628-bd03-749f2bbf486b","resolution":{"observed_at":"2026-05-26T07:06:53.186716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-modal alignment using representation codebook","venue":null,"work_id":"637ab2d0-3f1a-40fa-ad81-ec724ac9a890","year":2022},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:0ab4c82078c6e2e0e9ea7fe85beb01907f3704d1d3f99b328d8b8ef6b38bba04","observation_id":"765045bf-6e38-4193-aba7-e9eb7353fa92","resolution":{"observed_at":"2026-05-26T07:06:53.182769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-16T12:44:19.692222Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:abcdcad1c55d27047fb1bfe0916c6798086fea2eaa06e6848f8d9aeb46f03f1a","observation_id":"9aa3b2cc-8c15-4372-9f55-8689061fc327","resolution":{"observed_at":"2026-05-11T17:21:09.728834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-20T07:59:46.579765Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":"2506.09113","doi":"10.48550/arxiv.2506.09113","metadata_source":"pith","pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","venue":"cs.CV","work_id":"b2e36b5d-99e4-45b4-9358-64f6d3501983","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:08624db49cb9cffe7c73a55d4afd0eab9fb8df7f460e80898e376176a988f670","observation_id":"89687e5c-e8b8-42a1-8b3c-2d45f07fbade","resolution":{"observed_at":"2026-05-11T17:21:09.707923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":"6f95d6d1-6874-4e47-a6bf-64124ee6f2ab","year":2024},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:3ef7c260f2266606803283eb64c29aa1d1c282439d23b7fbb1e76502f184bec0","observation_id":"53dc44fc-2817-47c4-916e-0b8d34d8d2cf","resolution":{"observed_at":"2026-05-26T07:06:53.155857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-08-21T22:24:55.309028Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":"2404.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-07-04T21:10:09.688336Z","title":"Id- animator: Zero-shot identity-preserving human video gener- ation","venue":null,"work_id":"e92e42cf-1216-4226-a583-07ff26a3de66","year":2024},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:e5f61eba4ef43fe6c220be72790c46942fac52631c0445e1a1bdbf03307b835c","observation_id":"23dd55bd-314d-43b2-923d-38a59b2215ec","resolution":{"observed_at":"2026-05-11T17:21:09.676043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"6d rotation representation for uncon- strained head pose estimation","venue":null,"work_id":"859a74a3-3f9f-482d-8f48-fbb4d01a2ce1","year":2022},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:54a3ba861413d31ac793d4a909dbe645b5ecf8de996821d12d3858e3afb87a5c","observation_id":"78fb6144-415d-43df-a3da-cfc963b8d37f","resolution":{"observed_at":"2026-05-26T07:06:53.144253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":"2ba675ee-312c-4a36-9834-714070f30cd6","year":2021},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:37ae22dd2a3919ff19a6e2588b47014a52197b1a60468afbd6fce309ce0770f2","observation_id":"a760f99b-8358-4587-8a4b-326603b8f39d","resolution":{"observed_at":"2026-05-26T07:06:53.167192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:47:03.857862Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30","venue":null,"work_id":"32c02792-a0f3-4b5e-8609-8e836c289269","year":2017},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:e2df3e80edea42d9da279e2f3ac4ff10626d58046d8e7eb0238c4b3f783f732f","observation_id":"185970f0-0c96-4a4f-b18a-b8c343a60b69","resolution":{"observed_at":"2026-05-26T07:06:53.152107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:37:16.225324Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851","venue":null,"work_id":"82ba805b-3e59-43c6-b37f-3aa1940eea68","year":2020},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:536beeaf1d7d1f428973b2a4d0fcf790631cbfc220ffe9f6ef288342d194ad14","observation_id":"1174907c-e48a-453d-b847-7ebbf1416952","resolution":{"observed_at":"2026-05-26T07:06:53.128168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"b18966d5-e223-4cc2-bda2-d0fc9781132d","year":2022},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:4df018edc9c0d9e05661c57496019c339ad39c88b1431e8157727138e9b13f2a","observation_id":"949b0a25-5458-46b0-81bc-e7348ddb142a","resolution":{"observed_at":"2026-05-26T07:06:53.170525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-18T10:31:16.201312Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:9bea8729bad5cdc9bc5ab5c2dabc1360be22b73a0e2572c24313246db6a42ba9","observation_id":"f3ac5160-9ad1-4dfb-b028-b606168c8028","resolution":{"observed_at":"2026-05-11T17:21:09.751609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curricularface: adaptive curriculum learning loss for deep face recognition","venue":null,"work_id":"c293c981-5374-4e51-8e47-af3b98c78ebb","year":2020},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:04c106637b7605bdf44d3de551620d4cd84faaa3e78dbfd1839427ea8f5ffb25","observation_id":"dee4ee4f-e39e-4ab2-954a-8a953b8cc97f","resolution":{"observed_at":"2026-05-26T07:06:53.163170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Insightface.https://github.com/deepinsight/insightface","venue":null,"work_id":"3dcb0dc0-8527-4b9e-a336-b05cbfbf007b","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:c9d444b0eefc116abaeb74c037306a66e20e55af321a0c15891d75b41c93696a","observation_id":"eb0ddb3c-429f-4d93-8591-dfea890d962d","resolution":{"observed_at":"2026-05-26T07:06:53.173918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":"2503.07598","doi":"10.48550/arxiv.2503.07598","metadata_source":"pith","pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"VACE: All-in-One Video Creation and Editing","venue":"cs.CV","work_id":"c68efbde-3431-4655-a337-87e2871ad6a3","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:4881a9bf7c5f6de85e5052b9e0a92e4a1f63b21d1376c05ece11abc2a2c6ceee","observation_id":"81bbf863-0aa4-4dcd-acf8-90681eed9b22","resolution":{"observed_at":"2026-05-16T00:53:54.408026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kling.https://klingai.com/","venue":null,"work_id":"b4e49b8b-1a00-4386-94de-341e83a3c4fd","year":2026},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:fae420656dd72c8c7374101a273711986aa2edc72691f15f09815800bb4359a0","observation_id":"00adccf1-65e8-48f9-8c2c-3d304857a1f7","resolution":{"observed_at":"2026-05-26T07:06:53.159374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:e08f542c5de92be7f9a9b5d864a81addb299cc3e18b7c598bb61bdaeae13b4ff","observation_id":"8d1ee74c-6026-4059-8a81-a85a433d5112","resolution":{"observed_at":"2026-05-11T17:21:09.737135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:34:31.638937Z","title":"Flow matching for generative modeling","venue":null,"work_id":"389643c2-1b27-48ab-b13f-9a3d35873834","year":2023},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:4c512e3baf6567083997fde4cbf6596a1dc5e5221b08048b2b5e4e3882d2e485","observation_id":"6c7f579e-0bbc-4ec1-8a61-9a6fa2086a3e","resolution":{"observed_at":"2026-05-26T07:06:53.123617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-16T12:58:02.352853Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:a0888644ffafeb1127294e59271440338182e9f507f40d9dbfe60fb16de40cd9","observation_id":"9c0c0c03-b5a1-479c-bb2b-3fd35485b6c0","resolution":{"observed_at":"2026-05-11T17:21:09.635204Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"6323655c-be92-4672-92e5-18c08ef7cebf","year":2023},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:73eff922b0f5855820aea2f5fc5b2b3c408eb3da8cf2089c4527041946a493da","observation_id":"c9bd44f1-6758-4995-8d30-07ba4dbc572c","resolution":{"observed_at":"2026-05-26T07:06:53.132760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visualizing data using t-sne.Journal of machine learning research, 9(Nov):2579–2605","venue":null,"work_id":"b6fa0f3a-1eef-43fe-af8d-9bcb7d545529","year":2008},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:28c9b4e09b85a3800dba2c55e20472628977730cddc8ea9100f1877357e29584","observation_id":"9db3c201-110a-4800-b6ef-2562b936f3ca","resolution":{"observed_at":"2026-05-26T07:06:53.136470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:2a9de0181fe715a143ca890e80bda4efb178d11ad9affe08f2a98bf5ab6f0b2a","observation_id":"135d11dd-a2ca-40cd-9171-558284697ba2","resolution":{"observed_at":"2026-05-11T17:21:09.690058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.186413Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"0c67bec8-6388-449f-9600-64c8ea9bc79f","year":2023},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:d141223f2705f6d2655974dd3dae0a44f179dc7af61ce5cc13b1463c2442b1d3","observation_id":"065ebace-007b-444b-af15-469cdc579a30","resolution":{"observed_at":"2026-05-26T07:06:53.115146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pika.https://pika.art/","venue":null,"work_id":"5c43d9d3-3d28-4db3-8d21-328fcc72ac3e","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:08538a9c220cae9001e12618f0e7950d403d053f43b41240a5fba44df8cc6f97","observation_id":"f45dc90b-e883-4e82-b0e7-10a4ec53a60e","resolution":{"observed_at":"2026-05-26T07:06:53.110867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:f0b152830ffa3867527934e19d6375fdec7c49b4c2cb48e0fc34dda26e0e2884","observation_id":"c7f5d3f9-bded-4ad0-90ae-ba2c57433cb3","resolution":{"observed_at":"2026-05-11T17:21:09.619551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.687562Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"ad3e05b3-af3a-4fa2-ab30-c45f9f403277","year":2021},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:c17256c07443a8c01708388cafaba9373f5b40d4ba2eccf7a57a03fadfb00221","observation_id":"d79c68df-9488-4afe-aaf8-e04ec233c114","resolution":{"observed_at":"2026-05-26T07:06:53.140501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.855747Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":"53bea94a-9a2e-4bd5-8f7c-d6551201a3ad","year":2021},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:a993ddfdb10bdb453986128d0eb547a84e977c8926d6151b43f182b45c3a9cfe","observation_id":"0988ecdd-0060-4cb8-89ea-0f04cc09243c","resolution":{"observed_at":"2026-05-26T07:06:53.095788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:10:44.273951Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":"6b8f31f9-c772-4a80-96d6-8c7aaa28f2b5","year":2016},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:ceb2ec868383f349bcfbdb3a3a9e9808de6015d42e45fded9124779117cd82cd","observation_id":"38ded714-c060-4fb4-a9f9-8e15186aa872","resolution":{"observed_at":"2026-05-26T07:06:53.148227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:37:03.961552Z","title":"Neural discrete representation learning.Advances in neural information processing systems, 30","venue":null,"work_id":"fc5f624c-48dd-4025-98ca-bbad7482fd3d","year":2017},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:ddebff6818726556018ab1dcd4e848f0dd8156f93089e54b3aa9beead4b13463","observation_id":"e8579b8a-6008-47d1-b459-b2d60391b7f3","resolution":{"observed_at":"2026-05-26T07:06:53.119592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vidu.https://www.vidu.com","venue":null,"work_id":"ba00ad5d-af15-469e-b779-5bc56a32ccbc","year":2026},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:2a5be19c66ca44c2a175214aa85fdd77758d3b8ad632779e71dbeb5ede794594","observation_id":"9adaa16d-fa54-4699-a679-006886495c34","resolution":{"observed_at":"2026-05-26T07:06:53.091555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:ddab43b8e76ef40b8d9b5aa3aecb19e709c54c2d4a12d26f58899ec75867d69c","observation_id":"0ff9871a-32ed-497c-941a-65bae6ace92f","resolution":{"observed_at":"2026-05-11T17:21:09.667511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stand-in: A lightweight and plug-and-play identity control for video generation","venue":null,"work_id":"870690ae-30e9-4e9d-bbb3-c99a0f330c38","year":2026},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:3c92e319c8c7f6c8d21710e6850985aa7d0a1a5a9ede961267c24851323056c8","observation_id":"40e450a7-bab1-4f51-a7a3-62b50a7b3581","resolution":{"observed_at":"2026-05-26T07:06:53.103746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":"8b8f343e-c3eb-470a-99e5-31ba7d9fc72b","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:f6b6cfdd683ac8d12efe4be32fee2015fa560c8fba88c686ab0d8de7348f3a5d","observation_id":"cedfcbf5-35a9-4b93-9e4f-384488db6e0f","resolution":{"observed_at":"2026-05-26T07:06:53.088139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Identity-preserving text-to-video generation by frequency decomposition","venue":null,"work_id":"ab627a04-a30f-4d08-8b99-e644cd00fe9e","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:366e81e5b54adf0710b8679846f33b684df2354a29a29f296f2ef71f9fe1b96c","observation_id":"f5708b11-20df-489b-96b3-ba05f5c48c0b","resolution":{"observed_at":"2026-05-26T07:06:53.099734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.03931","doi":"10.48550/arxiv.2501.03931","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Magic mirror: Id-preserved video generation in video diffusion transformers","venue":null,"work_id":"5bd233f7-ea9b-4049-9470-b73f605dbd64","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:bf0cc481dd9e47aa61304112ea35fbe47a94acf18e88da35c0ff00e69e5b1abc","observation_id":"627ff383-d7dd-467b-834c-f723f9f7223f","resolution":{"observed_at":"2026-05-11T17:21:09.611345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13995","last_updated":"2025-02-19T06:50:27Z","snapshot_observed_at":"2026-08-18T00:57:45.311122Z","submitted_at":"2025-02-19T06:50:27Z","title":"FantasyID: Face Knowledge Enhanced ID-Preserving Video Generation","version":1},"cited_work":{"arxiv_id":"2502.13995","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.13995","snapshot_observed_at":"2026-07-03T08:17:45.953172Z","title":"Fantasyid: Face knowledge enhanced id-preserving video generation","venue":null,"work_id":"bbc145ce-4b5c-43fb-9577-0ad2cd487a72","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2502.13995","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:3e9c1fef13f47499414c82f62ce23d524a888b60d1f88687bfe1515792ebc424","observation_id":"9867d69f-0d4c-48c3-916c-b76dbe9897dc","resolution":{"observed_at":"2026-05-11T17:21:09.650401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14151","last_updated":"2025-07-02T11:55:35Z","snapshot_observed_at":"2026-08-17T04:58:51.328744Z","submitted_at":"2025-03-18T11:17:32Z","title":"Concat-ID: Towards Universal Identity-Preserving Video Synthesis","version":3},"cited_work":{"arxiv_id":"2503.14151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14151","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Concat-id: Towards universal identity-preserving video synthesis","venue":null,"work_id":"29be33ec-795b-4a87-bffc-dfc03f14abe8","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2503.14151","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:22d3df247d322bacc28b595db0179987306517a8f3c0f37ca57225b74e42acce","observation_id":"0d578b82-3343-4763-8d87-b3e2c458e3d6","resolution":{"observed_at":"2026-05-11T17:21:09.700191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"open grassy field","venue":null,"work_id":"ec54c983-74d0-44ee-a49d-6cd88b506125","year":2048},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:1d0258efb89b97014b7171a816e6fd860e6beccab2340ec7ce3a0a42ac8295eb","observation_id":"be746d51-9e02-444f-bcdb-d632cd000b4d","resolution":{"observed_at":"2026-05-26T07:06:53.107366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T19:38:16.496218Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":26},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2605.04702."}