{"as_of":"2026-08-10T09:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c1687d958eabc4c0c577cca225be8128af20fa2acf4cdb4b95f78c4e65c36b6","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:31:08.145034Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.14015/citation-record","integrity":"/paper/2506.14015/integrity","json":"/paper/2506.14015/citation-record.json","paper":"/paper/2506.14015"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.903371Z","title":"Clipface: Text-guided editing of textured 3d mor- phable models","venue":null,"work_id":"4b60059b-9e19-42aa-93de-107a8974a18c","year":2023},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.898389Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:ef9e55c21b3b3d8c8e058de1e6ac0ccc85d479cff86b9d7434e88859a937515a","observation_id":"735566f0-9610-4d9f-b7e3-458d0f21bd36","resolution":{"observed_at":"2026-08-07T00:31:08.907134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.892513Z","title":"Bergman, Petr Kellnhofer, Yifan Wang, Eric R","venue":null,"work_id":"d80edf91-b78b-4b82-befd-6fdc94913857","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.903530Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:39561c16c7bc72d335340b93172d887cff1e1f0a3050a90d32daf73f5e2c5297","observation_id":"7d03369b-3ed5-4970-b7a1-47346e794324","resolution":{"observed_at":"2026-08-07T00:31:08.896548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01401","last_updated":"2021-01-14T05:36:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T15:25:26Z","title":"Demystifying MMD GANs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01401","snapshot_observed_at":"2026-08-07T00:31:07.907862Z","title":"Demystifying mmd gans.arXiv preprint arXiv:1801.01401, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.907862Z"},"links":{"cited_paper":"/paper/1801.01401","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:a7078ec545fcc0ca3c607c859a19de254aa03f835a604cfa2b28dcb258214ef8","observation_id":"2bb60aaf-6068-4582-9d0a-fe92ffa4c3a5","resolution":{"observed_at":"2026-08-07T00:31:07.907862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.881003Z","title":"Text and image guided 3d avatar generation and ma- nipulation","venue":null,"work_id":"8c85dee7-6fe4-4a87-87c6-dbd2398d1e13","year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.912939Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:cb3974f4bfd24aa024bbbd5d20c28d592225881b3537dbcb852c1ec51112a77c","observation_id":"f037af5b-db65-4d06-8022-db41774bdd87","resolution":{"observed_at":"2026-08-07T00:31:08.885244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.870141Z","title":"Chan, Connor Z","venue":null,"work_id":"6ed07662-cc62-4c3a-9e67-501c69abb630","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.917859Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:e5afdc23c83cabfe9c11cf7abb67d1112bd95a6a93f14675d30b99aa14a65439","observation_id":"7a8249a7-fc52-4ccb-9b14-8941913789a8","resolution":{"observed_at":"2026-08-07T00:31:08.873696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02083","last_updated":"2023-06-03T11:08:38Z","snapshot_observed_at":"2026-08-08T10:58:08.049307Z","submitted_at":"2023-06-03T11:08:38Z","title":"Efficient Text-Guided 3D-Aware Portrait Generation with Score Distillation Sampling on Distribution","version":1},"cited_work":{"arxiv_id":"2306.02083","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02083","snapshot_observed_at":"2026-08-07T00:31:08.341451Z","title":"Efficient Text-Guided 3D-Aware Portrait Generation with Score Distillation Sampling on Distribution","venue":"cs.CV","work_id":"cbd73afe-e270-48c0-99fb-d8df436554f0","year":2023},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.921887Z"},"links":{"cited_paper":"/paper/2306.02083","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:eecd2bc564db4d77d0d05c4045fcd8d1929c3c4fd27cbb182e946617d43704df","observation_id":"0658603d-2022-4351-8dae-9c5b743717c6","resolution":{"observed_at":"2026-08-07T00:31:08.345738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07971","last_updated":"2024-10-10T14:29:00Z","snapshot_observed_at":"2026-08-09T21:02:21.735447Z","submitted_at":"2024-10-10T14:29:00Z","title":"Generalizable and Animatable Gaussian Head Avatar","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07971","snapshot_observed_at":"2026-08-07T00:31:07.926317Z","title":"Generalizable and animatable gaussian head avatar.arXiv preprint arXiv:2410.07971, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.926317Z"},"links":{"cited_paper":"/paper/2410.07971","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:b9e408c9f3b7bc49be7d49d1ca305a58719dc384442bfcd6a4e0b01a34e7870c","observation_id":"7f4c8178-9253-419a-8611-114b9894bb22","resolution":{"observed_at":"2026-08-07T00:31:07.926317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.857245Z","title":"Gen- erative adversarial networks: An overview.IEEE signal processing magazine, 35(1):53–65, 2018","venue":null,"work_id":"20d79d24-6863-434b-8ab1-63a257e2c9c8","year":2018},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.931478Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:69955bc69acacf17105e1ffd5eba9321e0b14209d956d9342e4dda916c87e122","observation_id":"b433735a-71aa-4617-84cf-1f5cb4b6179e","resolution":{"observed_at":"2026-08-07T00:31:08.862171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.845333Z","title":"Cogview: Mastering text-to-image generation via transformers.Advances in Neural Information Processing Systems, 34:19822–19835, 2021","venue":null,"work_id":"44726c74-5a96-4276-8912-da56277bbf4b","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.935502Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:8b0467cabc2d6e44b1210e65323929b4941e5408a3c16a77e6eb326d6dc41d6c","observation_id":"86fc0d01-1ae1-420b-b519-1d0a7d9e4b19","resolution":{"observed_at":"2026-08-07T00:31:08.849292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.833124Z","title":"Cogview2: Faster and better text-to-image generation via hierarchical transformers.Advances in Neural Information Processing Systems, 35:16890–16902, 2022","venue":null,"work_id":"3bccbb5d-65a8-40bf-9e3a-0c603fa2ba6c","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.939875Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:684ae04039db80dbc35d9e0a23a5417662ddfe57bf6f04e5f8b6a77db25a93fb","observation_id":"53ea7cbf-1b06-482c-b969-82bc5854778a","resolution":{"observed_at":"2026-08-07T00:31:08.837144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.820739Z","title":"Semantic image synthesis via adversarial learning","venue":null,"work_id":"60f99ec7-769d-499d-8b02-464b5d684cb7","year":2017},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.944122Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:8e0062e79f7c3357c4a81315099b71972ef8552c005653c2f710ac85c48d81ec","observation_id":"88001989-687a-45ae-9954-4b9776ae0453","resolution":{"observed_at":"2026-08-07T00:31:08.825624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.807862Z","title":"Imagebart: Bidirectional context with multinomial diffusion for autoregressive image synthesis.Advances in neural information processing systems, 34:3518–3532, 2021","venue":null,"work_id":"4e2dbd38-651a-473a-b114-6080bdbfb391","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.947588Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:e875675793825175f1f40ce764b9252bdd64e1e6b581bf071a3315c49bf2b026","observation_id":"9ce23194-ef2d-434c-af26-a5a448a2fce7","resolution":{"observed_at":"2026-08-07T00:31:08.812341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.796124Z","title":"Black, and Timo Bolkart","venue":null,"work_id":"870bef70-d332-4154-be0c-a18e30d27c53","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.951370Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:96772079e046a5d5585b54f07f1d3dc71bfa82b50645610264d07fc5752d2ee9","observation_id":"2974ba24-a5c5-44a1-a96f-4e184953b605","resolution":{"observed_at":"2026-08-07T00:31:08.799938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.785137Z","title":"Generative adversarial nets.Advances in neural information processing systems, 27, 2014","venue":null,"work_id":"4d2d8ecd-65cd-4494-9b66-cf17266a8841","year":2014},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.954592Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:591558131cd9bf78c0bd42f4c1225bcf225734321c7748aee369e207e4be009b","observation_id":"d2c986d5-db8e-4ecb-8199-9fb53d6fa1dc","resolution":{"observed_at":"2026-08-07T00:31:08.788960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.772647Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"822685fb-e587-4a26-b316-651d2023a639","year":2017},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.958861Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:c9a5e0fc9f82b17845e91586b7504b4c0cdb950fcc49453c998ea68eedf17fe0","observation_id":"ffe053af-9ceb-4890-b3b8-97d97d978c03","resolution":{"observed_at":"2026-08-07T00:31:08.777099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.759584Z","title":"Denoising diffu- sion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":"03e825af-e8f2-4006-b93d-868bc88aa311","year":2020},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.962580Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:d9278141945ab0dc2dc7f0f0c6fa8757e920ff0f245a3ac19fbfad5375533aae","observation_id":"a7c2aaa2-f6c5-42f9-8adc-2dfc1ae1a485","resolution":{"observed_at":"2026-08-07T00:31:08.763621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.748656Z","title":"Removing the quality tax in controllable face gener- ation","venue":null,"work_id":"58049811-c0f3-4355-b8ee-a2b1ee6c0c61","year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.966318Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:beff9dee618f2e56839bcb4711e374faaf71f2bf36a1c1b24dca4381eff0af01","observation_id":"0241f0a9-ca3a-4eeb-8a02-2e28c7d011f0","resolution":{"observed_at":"2026-08-07T00:31:08.752237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02968","last_updated":"2024-11-15T03:28:16Z","snapshot_observed_at":"2026-08-04T20:32:48.167843Z","submitted_at":"2024-06-05T05:52:20Z","title":"GSGAN: Adversarial Learning for Hierarchical Generation of 3D Gaussian Splats","version":2},"cited_work":{"arxiv_id":"2406.02968","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02968","snapshot_observed_at":"2026-08-07T00:31:08.314379Z","title":"GSGAN: Adversarial Learning for Hierarchical Generation of 3D Gaussian Splats","venue":"cs.CV","work_id":"cabe2966-b097-4405-b9c9-bfab7bf4169d","year":2024},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.971098Z"},"links":{"cited_paper":"/paper/2406.02968","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:ea6d15934411045d5bfaede72aa5eabf025d6b4b5ee19a993f34315d3925bb52","observation_id":"74915187-9c66-4ddf-a0cb-fa4e1a59dd6e","resolution":{"observed_at":"2026-08-07T00:31:08.319241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.12922","last_updated":"2021-09-27T10:11:35Z","snapshot_observed_at":"2026-08-09T06:35:10.905737Z","submitted_at":"2021-09-27T10:11:35Z","title":"ClipMatrix: Text-controlled Creation of 3D Textured Meshes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.12922","snapshot_observed_at":"2026-08-07T00:31:07.975824Z","title":"Clipmatrix: Text-controlled creation of 3d textured meshes.arXiv preprint arXiv:2109.12922, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.975824Z"},"links":{"cited_paper":"/paper/2109.12922","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:72bdad0e042a592a556a16871d74a9557bc7b175be82d3fae318b6dbabbd068f","observation_id":"880bfad9-a36c-43dc-90ad-c07c88529523","resolution":{"observed_at":"2026-08-07T00:31:07.975824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.734913Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"afc18226-053f-4fa7-86d6-c45119c2bba8","year":2019},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.980228Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:92c50f0241a99b996bd2215ed611405ec5d8fcaf82239e71a93af9bf417e4295","observation_id":"3f66b315-86c1-4ce8-b2db-ff6ced427dae","resolution":{"observed_at":"2026-08-07T00:31:08.739919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.721612Z","title":"Analyzing and improv- ing the image quality of stylegan","venue":null,"work_id":"31a323e0-8998-4020-be94-12ef3e651294","year":2020},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.983506Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:52e8f80e4c23c39b4fe3f67e5e9404fdb971c8adf4ee99540ba0f73e023c5021","observation_id":"7cbadd74-90ea-40f3-8ee9-680ead2a340f","resolution":{"observed_at":"2026-08-07T00:31:08.726573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09377","last_updated":"2024-09-24T14:48:19Z","snapshot_observed_at":"2026-08-10T03:24:18.610704Z","submitted_at":"2024-06-13T17:54:38Z","title":"GGHead: Fast and Generalizable 3D Gaussian Heads","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09377","snapshot_observed_at":"2026-08-07T00:31:07.987075Z","title":"Gghead: Fast and gener- alizable 3d gaussian heads.arXiv preprint arXiv:2406.09377,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.987075Z"},"links":{"cited_paper":"/paper/2406.09377","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:28aa08e66dd162ce76896f159246c7b34146f7ca0bf7ba5a778a3be56c184e0b","observation_id":"befcd4f9-07ef-44d1-8eff-5413d8aaf0d3","resolution":{"observed_at":"2026-08-07T00:31:07.987075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.706997Z","title":"Gaus- sian3diff: 3d gaussian diffusion for 3d full head synthesis and editing","venue":null,"work_id":"76f5c138-7a4a-42c7-a428-c3d1734e2a2f","year":2024},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.991026Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:315e1bedd4da96da170964baf9e9312a724ae4380b656de06ed803fa02f62a03","observation_id":"44bd85d5-84b6-4b1d-8c60-4ca0ea6135b8","resolution":{"observed_at":"2026-08-07T00:31:08.712770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.691741Z","title":"Autoregressive image generation using resid- ual quantization","venue":null,"work_id":"091bda70-40da-4a04-9b68-8591535ceb14","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.994745Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:736ba2deddf1de0d8682070921a432fdade3f5ab1a32f39e0cbe8831675fbb79","observation_id":"19d0e1e1-2a9a-4b14-a6cd-102b4858f22d","resolution":{"observed_at":"2026-08-07T00:31:08.696917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.678402Z","title":"Controllable text-to-image generation.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":"ea481b45-7e2a-496e-a11a-ee927ca72639","year":2019},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:07.998351Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:4ba6daa4c78f95d620e869d1675f15f6cb0c46095c298f373920ea5e0730446a","observation_id":"efe04c76-1438-4092-9792-aeac5f121e48","resolution":{"observed_at":"2026-08-07T00:31:08.682714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.663816Z","title":null,"venue":null,"work_id":"a775d7bf-08ce-4fb7-9c82-c900d5296985","year":2017},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.002098Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:bebb3dcafdf4aea6ac312e59798f176486e99d683ef48ace7c8a201e553fa902","observation_id":"c91da531-567f-4987-9d93-521c96403568","resolution":{"observed_at":"2026-08-07T00:31:08.669685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.650321Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning.Advances in Neural Information Processing Systems, 35:17612–17625, 2022","venue":null,"work_id":"452f1be0-eb42-4359-926a-7bc745f936d7","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.006665Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:e97625f6d154f3f4ff23587e130cbe6eba0febfa334b6aed5572b46fb37bffb3","observation_id":"16653aef-0c9f-43ae-a81a-624c66a64664","resolution":{"observed_at":"2026-08-07T00:31:08.655069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.011103Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.011103Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:8519ca1a771dd5ea77fb5d6dee06935edae119c17bf9538e6427f36207805c82","observation_id":"9f5d5daa-5666-4899-8ce2-de44176ffab5","resolution":{"observed_at":"2026-08-07T00:31:08.011103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.014647Z","title":"Which training methods for gans do actually converge? In International conference on machine learning, pages 3481–","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.014647Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:885a3511dbd9a611ce82ae82408e11e4331c3f08d2f69bcb8c4c7a7995f9d2c0","observation_id":"ed161552-764b-494d-aee3-1dfca435fe4b","resolution":{"observed_at":"2026-08-07T00:31:08.014647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.621342Z","title":"Text2mesh: Text-driven neural stylization for meshes","venue":null,"work_id":"c3ab5e59-65ae-4c62-9a50-b7e0f9a195c1","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.018446Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:30364e8748c173c7a21f5bb4114eb5b300935447fb5a840ef321df21d8ac1d83","observation_id":"55ba6465-0819-453d-beb0-c4fa7e1ac671","resolution":{"observed_at":"2026-08-07T00:31:08.625751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.609360Z","title":"Text2facegan: Face generation from fine grained textual de- scriptions","venue":null,"work_id":"2e20c7bb-0c15-45a8-a4aa-1f246baa7428","year":2019},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.022978Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:66aaa404d182b7b711e76e39cf564eaf9a7f3091bdb52ffe4348284de956ca5c","observation_id":"cdecfc0c-bb8f-40f3-b823-f10f2e6dd514","resolution":{"observed_at":"2026-08-07T00:31:08.613241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-07T00:31:08.027014Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.027014Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:bb56c159b4759634c45d1c658f8271d9cbf88de2ec239bf54bac2b234d1ee53e","observation_id":"fb625bde-e6e2-4a41-a5ba-cd2506121b33","resolution":{"observed_at":"2026-08-07T00:31:08.027014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T00:31:08.031156Z","title":"Repre- sentation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.031156Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:88cec782ee061685f875a57c3d5029d7027680aeaed928d55d536405c6271502","observation_id":"9696588e-eb09-44ed-8acb-ca15bb5c0a41","resolution":{"observed_at":"2026-08-07T00:31:08.031156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.596930Z","title":"Paysan, R","venue":null,"work_id":"ca56286b-4d45-44e7-8f87-27c47fd972a6","year":2009},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.035456Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:17ea9ccb52571d82fb047697a7da4e9f51ee31db172889f49dc8f50b9f3f815e","observation_id":"d3ce2d11-3fdd-40d2-a298-91c524589def","resolution":{"observed_at":"2026-08-07T00:31:08.601451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.584671Z","title":"Towards open-ended text-to-face generation, combination and manipulation","venue":null,"work_id":"8aa26875-4753-48a4-b979-8d30f76fe24e","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.040150Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:cb3a22d381b138b1da15907ef61f53da428c2c3fe65beeea0b30a945183562f4","observation_id":"a71babae-a84b-464d-be3e-6d794c104e67","resolution":{"observed_at":"2026-08-07T00:31:08.589174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.044522Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.044522Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:3779b6113711c842d94370eb66f5cea89e65869256c2e190cd9cd4ea7a79c330","observation_id":"a3fc27ad-1fec-4a4a-9a2d-25e40644444d","resolution":{"observed_at":"2026-08-07T00:31:08.044522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.565903Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"399534bf-bcd4-4eb9-8d1f-4d26e78eeaa2","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.048293Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:b5f76a0398cb807b757de85880e9d474622177379618fa3eec2c2d26b1356729","observation_id":"213a317a-79b8-4bae-8e43-e9043f6835df","resolution":{"observed_at":"2026-08-07T00:31:08.569754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T00:31:08.052495Z","title":"Hierarchical text-conditional image genera- tion with clip latents.arXiv preprint arXiv:2204.06125, 1(2): 3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.052495Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:5c83831c82030a765bddea834e7f709d06d5dfadb20d1b6b1c16506d3056ebdb","observation_id":"26366c0e-fb3a-495b-b58e-64addc435256","resolution":{"observed_at":"2026-08-07T00:31:08.052495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.553397Z","title":"Generative adver- sarial text to image synthesis","venue":null,"work_id":"9d036fbe-5e03-47f5-a80c-287e5a080aec","year":2016},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.057191Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:4f8154e5fcad381967ebb8b71ad17f9de07b03b1d7f26b23745ec9d5973cf1fa","observation_id":"d42417b0-85cb-4b41-a860-62d8c34b4897","resolution":{"observed_at":"2026-08-07T00:31:08.558408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.540449Z","title":"Higher order contractive auto-encoder","venue":null,"work_id":"cba056e7-067a-4a13-b421-339efaab069b","year":2011},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.061800Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:fca832d1ee4c4541366c6f3a2fdf3884fa3049466d241b27e30113daa3f10433","observation_id":"dd772fa9-2bd6-44fd-a59d-bae03601436c","resolution":{"observed_at":"2026-08-07T00:31:08.545188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.527038Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"7ae86429-1277-4d3e-8fec-5c387a116937","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.065870Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:86c2b847d9b6cc5681e910ff3d0dafc30b155e625358fc035a04d55f6e59a475","observation_id":"c335105b-d031-4d89-a0ec-55b35709bc41","resolution":{"observed_at":"2026-08-07T00:31:08.532044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.515350Z","title":"Pho- torealistic text-to-image diffusion models with deep language understanding.Advances in Neural Information Processing Systems, 35:36479–36494, 2022","venue":null,"work_id":"c0c25d81-e159-4b52-a768-b37085c196b2","year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.069695Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:454b9e00d2ef0dd0db58592e8f8211adadb4efd90387a4c64dbfd8c6be00a85a","observation_id":"d27c33ae-10cc-4752-86d2-2e213eeeb127","resolution":{"observed_at":"2026-08-07T00:31:08.519580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04909","last_updated":"2020-05-11T08:05:00Z","snapshot_observed_at":"2026-07-06T09:19:14.291342Z","submitted_at":"2020-05-11T08:05:00Z","title":"Conditional Image Generation and Manipulation for User-Specified Content","version":1},"cited_work":{"arxiv_id":"2005.04909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.04909","snapshot_observed_at":"2026-08-07T00:31:08.246595Z","title":"Conditional Image Generation and Manipulation for User-Specified Content","venue":"cs.CV","work_id":"dd6476ad-4dff-4c0f-8530-6dbd430b38c5","year":2020},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.073737Z"},"links":{"cited_paper":"/paper/2005.04909","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:95f4367093d47b899f7edd9091e6df23bd7e095026ac0edb5e55520248e450f6","observation_id":"7100a072-63c4-41a3-ba65-2e7a0008653f","resolution":{"observed_at":"2026-08-07T00:31:08.251257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.504045Z","title":"Multi-caption text-to-face synthesis: Dataset and algo- rithm","venue":null,"work_id":"8a281940-50d6-48b0-81db-5a98253f9de6","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.077667Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:2c943103970c30586d66a470454726d274a116bfc2ea7b1eda6e928bacab2cfb","observation_id":"0cbec195-ad96-4239-913f-17d8ca92bb32","resolution":{"observed_at":"2026-08-07T00:31:08.507844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05865","last_updated":"2022-10-15T03:51:50Z","snapshot_observed_at":"2026-07-06T09:46:54.764203Z","submitted_at":"2020-08-13T12:51:17Z","title":"DF-GAN: A Simple and Effective Baseline for Text-to-Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05865","snapshot_observed_at":"2026-08-07T00:31:08.080980Z","title":"Df-gan: Deep fusion generative adver- sarial networks for text-to-image synthesis.arXiv preprint arXiv:2008.05865, 2(6), 2020","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.080980Z"},"links":{"cited_paper":"/paper/2008.05865","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:d307a40f3d1b3147bf1de1518a695e2ba8f7567d771cc3809c22ee499c4aa29f","observation_id":"e8b7e879-7c43-44d6-9366-f1341cbc5b15","resolution":{"observed_at":"2026-08-07T00:31:08.080980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.492746Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"dbd2e90d-00fa-4bcf-ad46-bf1f4d6a814a","year":2017},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.085430Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:eac287a8bd58895e4cc6d0225e8512e66554d74fce6d777dfa30b7866e94b6e4","observation_id":"7059f785-b9ca-4257-893d-c43652b03ed4","resolution":{"observed_at":"2026-08-07T00:31:08.496591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.481283Z","title":"Faces a la carte: Text-to-face generation via attribute disentanglement","venue":null,"work_id":"5158a384-bd91-47a1-b84c-a79643a04cc3","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.089341Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:e0ee53c1105851fb141e9647358a4f9c51876a05166cab29ea1eab7d442aff27","observation_id":"dbd661aa-31c7-4aa9-b57d-72a9b2714125","resolution":{"observed_at":"2026-08-07T00:31:08.485757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.468040Z","title":"High-fidelity 3d face genera- tion from natural language descriptions","venue":null,"work_id":"cc698406-6896-4347-b9dd-55390d982124","year":2023},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.093446Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:7056466899b9f72d17afa74fa3d4e2d6706659c2c47633f16f6a1c5f5f95b2df","observation_id":"c9486153-9104-45a6-a460-1bafc4d19fc0","resolution":{"observed_at":"2026-08-07T00:31:08.473247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.097334Z","title":"Tedigan: Text-guided diverse face image generation and ma- nipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.097334Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:572bb51de9fed948e9fdbf215ee66b81427e5c739185408c1b8586611d5567c1","observation_id":"3950c2f3-7091-40ea-bc7f-7c152449f2a1","resolution":{"observed_at":"2026-08-07T00:31:08.097334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.448911Z","title":"Omniavatar: Geometry-guided controllable 3d head syn- thesis","venue":null,"work_id":"3605f20d-6460-4ef4-811c-53b0dcac7c7b","year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.101556Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:57887bdec417ae74d7ef4e15536c7de17ae9b71263047ce2bd91c95f306c176f","observation_id":"fb10680f-332b-4266-b744-b0518f0a5121","resolution":{"observed_at":"2026-08-07T00:31:08.453055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.436673Z","title":"Attngan: Fine- grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":"cb35d32a-b1a3-416b-9c92-d9184fba446e","year":2018},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.105439Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:160ec5572030d3b8d3afed395e6aa3d58b39b3e9780635a0143443811940ac6a","observation_id":"0c14bdda-ff54-4a71-a0c6-dac0b2c93233","resolution":{"observed_at":"2026-08-07T00:31:08.441227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.423417Z","title":"Towards high-fidelity text-guided 3d face genera- tion and manipulation using only images","venue":null,"work_id":"94cf9255-9589-4a42-b569-600f996b744c","year":2023},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.110294Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:e6e2bc8671b1c37b0fc1454adceb102e9012152dcf15e040388ce9d071c52c18","observation_id":"d43cd068-0b1e-4ce4-ad49-1798121f3570","resolution":{"observed_at":"2026-08-07T00:31:08.427768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T00:31:08.113817Z","title":"Scaling autoregressive mod- els for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.113817Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:89cd639f8ee8c300e9b483ea584560d3e3caa8deca984b653382fdf6dbdd4c0a","observation_id":"e979a7b2-90d9-4ec4-8946-4ae5a8d52129","resolution":{"observed_at":"2026-08-07T00:31:08.113817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.411144Z","title":"Stack- gan: Text to photo-realistic image synthesis with stacked generative adversarial networks","venue":null,"work_id":"7e3e0f6f-4e5a-4e18-8397-74324f129a48","year":2017},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.117732Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:99eac5dd59af6fad7c34764b1196dcf97c4a2f839a723372912420c471f802d0","observation_id":"8893a9f8-19ac-4385-9cb5-284c1d8f5228","resolution":{"observed_at":"2026-08-07T00:31:08.415061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.398830Z","title":"Stack- gan++: Realistic image synthesis with stacked generative adversarial networks.IEEE transactions on pattern analysis and machine intelligence, 41(8):1947–1962, 2018","venue":null,"work_id":"fa3dd35e-a3e3-4f29-baa8-7e979f29e7b9","year":1947},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.121195Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:ee4c9a0ddd055ae89ce792da9784aab6bdf406ef464450d14b6c8d625b59c696","observation_id":"30d6e647-65ee-4e1d-88ea-2f4c1f240ebd","resolution":{"observed_at":"2026-08-07T00:31:08.403186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03117","last_updated":"2023-04-01T07:22:55Z","snapshot_observed_at":"2026-08-04T04:04:54.771930Z","submitted_at":"2023-04-01T07:22:55Z","title":"DreamFace: Progressive Generation of Animatable 3D Faces under Text Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03117","snapshot_observed_at":"2026-08-07T00:31:08.125192Z","title":"Dreamface: Progressive generation of animatable 3d faces under text guidance.arXiv preprint arXiv:2304.03117,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.125192Z"},"links":{"cited_paper":"/paper/2304.03117","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:1a39d1c472f5cb79887ed422a5d3ebd9bd4950765855eb8ad47e1530fb45bb2e","observation_id":"7c4839b6-b5d2-44ce-b479-1494bdf7799b","resolution":{"observed_at":"2026-08-07T00:31:08.125192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14211","last_updated":"2022-02-19T17:12:14Z","snapshot_observed_at":"2026-07-06T11:13:54.995111Z","submitted_at":"2021-05-29T04:42:07Z","title":"M6-UFC: Unifying Multi-Modal Controls for Conditional Image Synthesis via Non-Autoregressive Generative Transformers","version":4},"cited_work":{"arxiv_id":"2105.14211","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.14211","snapshot_observed_at":"2026-08-07T00:31:08.199245Z","title":"M6-UFC: Unifying Multi-Modal Controls for Conditional Image Synthesis via Non-Autoregressive Generative Transformers","venue":"cs.CV","work_id":"da40271d-a4b5-462b-aea1-57c1e5154876","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.128900Z"},"links":{"cited_paper":"/paper/2105.14211","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:c7fe59a7031597711cae666ee10bb7cdb3e6020c2928ddb5f93f5f722a2a8817","observation_id":"426d1768-4ea8-4558-9641-85788ae17f1b","resolution":{"observed_at":"2026-08-07T00:31:08.203740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19657","last_updated":"2024-10-30T03:34:49Z","snapshot_observed_at":"2026-08-05T01:18:39.766048Z","submitted_at":"2024-10-25T16:08:08Z","title":"DiffGS: Functional Gaussian Splatting Diffusion","version":2},"cited_work":{"arxiv_id":"2410.19657","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19657","snapshot_observed_at":"2026-08-07T00:31:08.178107Z","title":"DiffGS: Functional Gaussian Splatting Diffusion","venue":"cs.CV","work_id":"402f1b09-0ef5-4d3c-aaeb-a4c5745d04b6","year":2024},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.132902Z"},"links":{"cited_paper":"/paper/2410.19657","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:36ae4a5d05729c7c4fe18de5df1e4a17895621027a5c9cf154ab3acaeaaf8300","observation_id":"334e4b03-11e9-4b82-ba61-618f27db6aa0","resolution":{"observed_at":"2026-08-07T00:31:08.184971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.386367Z","title":"Generative adversarial network for text-to-face synthesis and manipulation","venue":null,"work_id":"244cb3e6-e467-416d-8070-513c40599b49","year":null},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.136966Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:c7b6c5f0d586b1f37990c475de5097f1e64857a0038c1748769f076742ced98a","observation_id":"2cc47fac-b3db-41f9-b79e-1a1fd9f57f64","resolution":{"observed_at":"2026-08-07T00:31:08.390930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.374424Z","title":"Generative adversar- ial network for text-to-face synthesis and manipulation with pretrained bert model","venue":null,"work_id":"5e087b95-aa8e-4077-af1c-3d60cbd6db90","year":2021},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.141082Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:dcbd29e4aa407d5f4086a29ab4b07fd3dbe7eeb5a3c77b43f24371e0d79bb545","observation_id":"0881f328-e6c4-419e-bf31-7a9eaa0d5516","resolution":{"observed_at":"2026-08-07T00:31:08.379003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.363595Z","title":"blonde”, “blue eyes","venue":null,"work_id":"9a06b008-b132-4823-87cf-e898f17f1771","year":2019},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.145034Z"},"links":{"citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:0a3d7567d2445e623395c39989eaead10492ecaa5473491e59d3e84ff3d992f4","observation_id":"3f82aeca-0e7a-4eb1-86bc-93ebdcf242c7","resolution":{"observed_at":"2026-08-07T00:31:08.367112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:40:24.680553Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":5,"verified_fuzzy":41},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2506.14015."}