{"as_of":"2026-08-12T13:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a493f41b592b86c2d1ac2cc0ce6c047e8d4cde4b6a87454d6e0e94982751305","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:50:29.054249Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:21:06.510937Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:25:42.327411Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02168","snapshot_observed_at":"2026-08-11T14:21:06.510937Z","title":"Generative photography: Scene-consistent camera control for realistic text-to-image synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12091","last_updated":"2025-04-26T13:48:44Z","snapshot_observed_at":"2026-08-11T20:42:12.090999Z","submitted_at":"2024-12-16T18:58:17Z","title":"Wonderland: Navigating 3D Scenes from a Single Image","version":2},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-11T14:21:06.510937Z"},"links":{"cited_paper":"/paper/2412.02168","citing_paper":"/paper/2412.12091"},"observation_digest":"sha256:ae7256618f000861235449ffcc45f6158ffc970ccf9be73c5014d997c53c2643","observation_id":"d6e15a76-b3f8-43ac-a271-3547a02ecf41","resolution":{"observed_at":"2026-08-11T14:21:06.510937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2412.02168","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02168","snapshot_observed_at":"2026-07-01T10:25:42.327411Z","title":"Generative photog- raphy: Scene-consistent camera control for realistic text-to- image synthesis.arXiv preprint arXiv: 2412.02168","venue":null,"work_id":"2023d7b6-ff34-4f77-8fab-b60f83a4f022","year":2024},"citing_paper":{"arxiv_id":"2511.17844","last_updated":"2026-04-08T06:05:56Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-21T23:41:19Z","title":"Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T19:54:35.190865Z"},"links":{"cited_paper":"/paper/2412.02168","citing_paper":"/paper/2511.17844"},"observation_digest":"sha256:54db5112e0ca5b62eb46e364941e07d4145783b3af5f7dccb7f8def115c4a59f","observation_id":"6f9ea93b-cdcf-4724-8018-85e872f5153f","resolution":{"observed_at":"2026-05-17T19:55:10.008039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2412.02168","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02168","snapshot_observed_at":"2026-07-01T10:25:42.327411Z","title":"Generative photog- raphy: Scene-consistent camera control for realistic text-to- image synthesis.arXiv preprint arXiv: 2412.02168","venue":null,"work_id":"2023d7b6-ff34-4f77-8fab-b60f83a4f022","year":2024},"citing_paper":{"arxiv_id":"2606.31959","last_updated":"2026-06-30T17:01:28Z","snapshot_observed_at":"2026-08-01T22:11:53.954479Z","submitted_at":"2026-06-30T17:01:28Z","title":"AnyBokeh: Physics-Guided Any-to-Any Bokeh Editing with Optical Fingerprint Transfer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T05:27:33.456926Z"},"links":{"cited_paper":"/paper/2412.02168","citing_paper":"/paper/2606.31959"},"observation_digest":"sha256:995dcf683eb3e238775e71a1df285cf21fa45542d6bac8ec767d2bcaeffefd4d","observation_id":"97fbd3ef-4d81-4830-ab87-fd5229489552","resolution":{"observed_at":"2026-07-01T10:25:42.328928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.02168/citation-record","integrity":"/paper/2412.02168/integrity","json":"/paper/2412.02168/citation-record.json","paper":"/paper/2412.02168"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:28.545762Z","title":"https://github.com/black- forest- labs/ flux","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.545762Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:134658b74ea5ab2098b1107708eb97a7976d3e3b960d3311b1f235652c6e6aea","observation_id":"048f2da9-36f7-4042-9c40-1b9d0b48ab27","resolution":{"observed_at":"2026-08-11T23:50:28.545762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:28.550937Z","title":"https://docs.opencv.org/4.x/ dc/dc3/tutorial_py_matcher.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.550937Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:497c7b0ea8591ab0e662b79cdbd364ff61060b069552dee0e24b4d585ea4f1c7","observation_id":"b9f88985-297e-4105-be54-b6e1e90b2894","resolution":{"observed_at":"2026-08-11T23:50:28.550937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.357118Z","title":"https://help.runwayml.com/hc/en- us/articles/ 34926468947347- Creating- with- Camera- Control- on-Gen-3-Alpha-Turbo","venue":null,"work_id":"a1a33611-dbb6-4bb2-932a-f402a8278733","year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.555989Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:6032fa4ed57a3af396ede2a758ee6ad21be89895bfef65a960e48a5d22b47dad","observation_id":"4c73a320-c909-4c0f-b923-ffe4debd1f3e","resolution":{"observed_at":"2026-08-11T23:50:30.361802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.342745Z","title":"https://github.com/Stability-AI/ StableDiffusion","venue":null,"work_id":"360b50b2-63e2-4da3-9e1b-764b30d24acd","year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.560670Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:fb2c6c391e4983a1a1bf7da8f1b3c9e74888abf86399aa41f6154057d5f5c6d0","observation_id":"5b47b529-5fb3-4b57-873b-a6fa2ad16035","resolution":{"observed_at":"2026-08-11T23:50:30.347468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.326783Z","title":"https:// openai.com/index/video- generation- models- as- world-simulators/","venue":null,"work_id":"32e5fb37-4d74-4c75-96da-7a9564af7db0","year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.565358Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:a44d5ca873d835f5ab0713e3d49393d9cfd6530e870849339840a6d2a68fb6c7","observation_id":"98e1ff6f-a233-41eb-b2c2-d8f6132ce843","resolution":{"observed_at":"2026-08-11T23:50:30.332082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12781","last_updated":"2025-03-22T15:40:42Z","snapshot_observed_at":"2026-08-06T09:54:26.134418Z","submitted_at":"2024-07-17T17:59:05Z","title":"VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12781","snapshot_observed_at":"2026-08-11T23:50:28.569888Z","title":"Lindell, and Sergey Tulyakov","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.569888Z"},"links":{"cited_paper":"/paper/2407.12781","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:6c6d6a2b5086cb35f824846c6729cf66f4bfd0a942038c6092d904a461eed4e2","observation_id":"9bf87a6b-ceea-47a9-9e97-1161f6776e08","resolution":{"observed_at":"2026-08-11T23:50:28.569888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T23:50:28.574952Z","title":"Stable video diffusion: Scaling la- tent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.574952Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:850337f9e65f71538d03164c724b2eeadb4af3f93e79da9e2241f84f3a7ef92d","observation_id":"3a8530e8-25b9-45cc-b074-db5796b2cc5b","resolution":{"observed_at":"2026-08-11T23:50:28.574952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.310335Z","title":"Any-resolution training for high-resolution image synthesis","venue":null,"work_id":"a97abf5d-d8e0-4125-8f2b-796157a588c8","year":2022},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.580376Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:fde8e3e9a5ed5ead5c07acb1ebe9284cde9681058e3ef1d99c657fefdf347719","observation_id":"0c4861b3-e88d-46bf-87f4-759c8b278c80","resolution":{"observed_at":"2026-08-11T23:50:30.315388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18103","last_updated":"2025-01-08T14:13:23Z","snapshot_observed_at":"2026-08-10T18:30:18.695298Z","submitted_at":"2024-03-26T21:01:41Z","title":"Tutorial on Diffusion Models for Imaging and Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18103","snapshot_observed_at":"2026-08-11T23:50:28.585060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.585060Z"},"links":{"cited_paper":"/paper/2403.18103","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:bd4e466a1de9f6fcb94cb0066802dbb8e1fa33467c427b5d8bcae04eb6f231fd","observation_id":"eb39abca-f22c-45fd-ba85-f579cb0921fd","resolution":{"observed_at":"2026-08-11T23:50:28.585060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.294210Z","title":"Image neural field diffusion models","venue":null,"work_id":"deed5a3c-4af1-491a-9fbb-e562d939081f","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.589922Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:2f3107003f6c30b7b1f49a3b1a574b836ebd599c01c3bd14c7d708c377d70de0","observation_id":"034de7c6-1ccd-4ffc-883c-cf6ebfc1c566","resolution":{"observed_at":"2026-08-11T23:50:30.299930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10802","last_updated":"2024-10-14T17:58:07Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:58:07Z","title":"Boosting Camera Motion Control for Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10802","snapshot_observed_at":"2026-08-11T23:50:28.594702Z","title":"Boosting camera mo- tion control for video diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.594702Z"},"links":{"cited_paper":"/paper/2410.10802","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:977de7901476682d69e81babf42fc3a7e3abac86ee028ac49c1398dcf98c161b","observation_id":"11060a5c-c0bf-4b93-aa01-425fecee7e3b","resolution":{"observed_at":"2026-08-11T23:50:28.594702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.278792Z","title":null,"venue":null,"work_id":"0f9d6fca-e162-439d-84ca-a328755d6ef8","year":2023},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.600246Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:da16be7bdadb61035f93b069635d198e9a5628526fc69240035feebafad2c09b","observation_id":"17376856-3fe1-41b4-b1b1-f1352a42e2e5","resolution":{"observed_at":"2026-08-11T23:50:30.283736Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01516","last_updated":"2024-07-01T17:58:02Z","snapshot_observed_at":"2026-08-08T07:40:02.750050Z","submitted_at":"2024-07-01T17:58:02Z","title":"E.T. the Exceptional Trajectories: Text-to-camera-trajectory generation with character awareness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01516","snapshot_observed_at":"2026-08-11T23:50:28.604794Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.604794Z"},"links":{"cited_paper":"/paper/2407.01516","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:54fa57bdebddbb7f584b30e0797b88055441afaa6a0ccedab087ddc0071f1c26","observation_id":"867bbd28-1b86-40ef-972c-32d31b633922","resolution":{"observed_at":"2026-08-11T23:50:28.604794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.262823Z","title":"Fairchild","venue":null,"work_id":"a7b3b861-a11e-45aa-acb5-a50fbd053de4","year":2013},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.609731Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:9d7360bc62a3a5c80fbb6195ca4028049183a01b19f9b8066a4ea574dff9f930","observation_id":"6119a0c1-4855-4087-a456-cc57d8c071b6","resolution":{"observed_at":"2026-08-11T23:50:30.268164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.246887Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"b097e94b-cf2e-4560-bfd5-d02666ad9e4c","year":2021},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.614372Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:d4bc5945e8a05a688374794a3b6a59cd3e3e6d25c416cb1eb9f6529397d6d05b","observation_id":"85d1dad4-19f9-48cd-a204-8827fe5b0bb6","resolution":{"observed_at":"2026-08-11T23:50:30.252082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.02692","last_updated":"2020-06-05T07:51:53Z","snapshot_observed_at":"2026-07-06T09:25:56.216238Z","submitted_at":"2020-06-04T08:20:30Z","title":"Problems of dataset creation for light source estimation","version":2},"cited_work":{"arxiv_id":"2006.02692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.02692","snapshot_observed_at":"2026-08-11T23:50:29.414736Z","title":"Problems of dataset creation for light source estimation","venue":"cs.CV","work_id":"40927115-e6d1-42da-8355-dfdbc012491d","year":2020},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.618978Z"},"links":{"cited_paper":"/paper/2006.02692","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:f2b46221d390596106ddf4e368826a0801e3d93deb1e05c982bd089aac676b99","observation_id":"736ced24-7000-4dd2-b073-4374f6495253","resolution":{"observed_at":"2026-08-11T23:50:29.420298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.232042Z","title":"Camera settings as tokens: Modeling photography on latent diffusion models","venue":null,"work_id":"b7026e4d-f1de-4085-b09f-b4c4e11aa8b2","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.623955Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:a2bbf96b4cd0b8d26d339587137aa3779ed96e67520a873a5d864e160cd2ea8e","observation_id":"a086a210-ddc6-462e-b56c-b2a2c30be071","resolution":{"observed_at":"2026-08-11T23:50:30.236810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.217280Z","title":"Bermano, Gal Chechik, and Daniel Cohen-Or","venue":null,"work_id":"5883361c-d486-4345-a1fe-a5f1f6498681","year":2022},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.628487Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:59d48413124e29dbe64c83bf6f4b8ec7dd86241dee1693ad14059f4bc8979ef2","observation_id":"d81cd21e-035d-4814-a31f-d4f12f543139","resolution":{"observed_at":"2026-08-11T23:50:30.222177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12092","last_updated":"2023-11-27T08:29:54Z","snapshot_observed_at":"2026-08-10T10:55:47.976327Z","submitted_at":"2023-11-20T18:59:01Z","title":"Concept Sliders: LoRA Adaptors for Precise Control in Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12092","snapshot_observed_at":"2026-08-11T23:50:28.633150Z","title":"Concept Sliders: Lora adap- tors for precise control in diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.633150Z"},"links":{"cited_paper":"/paper/2311.12092","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:1f208e64b857b9a6d2aedde26afd56e8fa3b73b1e888b54d415b904c3243ad57","observation_id":"9d55154b-b32b-424c-bb1f-6cee67ecbd3c","resolution":{"observed_at":"2026-08-11T23:50:28.633150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.201088Z","title":"Generative adversarial nets","venue":null,"work_id":"e982d784-62bc-49e8-a620-7a892e64ee20","year":2014},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.637945Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:49e58a37a5f17412f3d6494693cb33e1ceee6dccd7b8a10a9646e1e69b50158a","observation_id":"9588c85d-06db-4458-9133-ee3614082cf6","resolution":{"observed_at":"2026-08-11T23:50:30.206279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.185702Z","title":"AnimateDiff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":"0d876054-0178-4f50-a591-477532ae1e6e","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.642871Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:926079e8c3e7ae7e0236975b4500c15985944f2d2d75ec86b88f1d50a7c7471e","observation_id":"e2f33f5b-2c50-4b5d-9522-8c4881847a62","resolution":{"observed_at":"2026-08-11T23:50:30.190480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.169894Z","title":"Hasinoff, Dillon Sharlet, Ryan Geiss, Andrew Adams, Jonathan T","venue":null,"work_id":"00004c0d-d56f-460f-8965-87db6bd08478","year":2016},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.647829Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:be64e1357fa9e20ba6d78816d877984088b13561d37ecbed9bfa0b223f2fedce","observation_id":"7619e526-bb53-48b3-8b0f-86d15d1cd5f7","resolution":{"observed_at":"2026-08-11T23:50:30.175023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-12T01:27:32.593496Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-11T23:50:28.652454Z","title":"CameraCtrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.652454Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:04614d8126f471454009104472b3920ed1c8755853d1e13cdc9c654e30ed4289","observation_id":"923a9cad-65d8-4db5-ae50-647b5e1cd08a","resolution":{"observed_at":"2026-08-11T23:50:28.652454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.154377Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"ba3fa874-73c6-4637-a069-fbe37009f47a","year":2020},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.657450Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:4569af09a5417f5a6745fc1a948cfbaea18d0c10508edeb4f66a126ecff0dc97","observation_id":"8575858f-0d97-4983-a613-473eeac18237","resolution":{"observed_at":"2026-08-11T23:50:30.159427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.138822Z","title":"Video diffu- sion models","venue":null,"work_id":"cf7d4a49-39e6-43f6-b33e-5e951ddf3415","year":2022},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.662424Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:7e9bf17db2796ee4f6c4b8dcfc1bf5732e3cfea02d3f169f7478bf354031e073","observation_id":"a4aeec71-697e-4a74-93ae-2ee83166db23","resolution":{"observed_at":"2026-08-11T23:50:30.143846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10126","last_updated":"2025-02-25T00:32:29Z","snapshot_observed_at":"2026-08-07T18:45:05.745904Z","submitted_at":"2024-06-14T15:33:00Z","title":"Training-free Camera Control for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10126","snapshot_observed_at":"2026-08-11T23:50:28.667086Z","title":"Training-free camera control for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.667086Z"},"links":{"cited_paper":"/paper/2406.10126","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:38399b2c896fd6cd6825f1cefb6f0ffeee03424acdac72c4ec7f765306a1ac9a","observation_id":"a136e7c6-13e9-4b0a-ae7b-d6c27c8842ca","resolution":{"observed_at":"2026-08-11T23:50:28.667086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T23:50:28.672714Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.672714Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:0c957518fc92f2ce8d2c5efdbc6f26d73d6c5dfb8284f2a661e0bfb78d2ff086","observation_id":"8d1283ca-3272-4db3-8d4c-4bf43715339e","resolution":{"observed_at":"2026-08-11T23:50:28.672714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.122888Z","title":"Cinematographic camera diffusion model","venue":null,"work_id":"3bcab421-a0fa-4eee-8c9a-70879be4ab17","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.677322Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:63c31f69d1019e592f45683e07c0a47e48f9b2a1fac2ded4c8f6061607643612","observation_id":"2ba82ac2-3ce2-450b-a7ea-773d93cd46fe","resolution":{"observed_at":"2026-08-11T23:50:30.128046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-02T22:45:54.982294Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-08-11T23:50:28.681774Z","title":"How far is video generation from world model: A physical law perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.681774Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:40f68fb2e013791e62f9c580ff3248cf03fddbc546e001939e0621af1961f356","observation_id":"5a8c8869-2b9b-48e7-a945-bddec98493f2","resolution":{"observed_at":"2026-08-11T23:50:28.681774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T23:50:28.686354Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.686354Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:b9e7726540df3bae6ac4f7f85e5f4557e115c08bf2b0326f0296307f14487cd9","observation_id":"be34e894-446f-4bd2-8975-a5e0b4a69383","resolution":{"observed_at":"2026-08-11T23:50:28.686354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.107166Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"e3edd063-3ac9-44aa-a23a-1730e02342fc","year":2019},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.691042Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:fa0667b798baee6b232b736181513b61c5a9aa5b73f0d944c3498c90d5ffe2af","observation_id":"e292b237-e7af-4555-8906-53dff3680d2a","resolution":{"observed_at":"2026-08-11T23:50:30.112380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.090944Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":"a115bafd-dc58-4eb5-a74f-25f16554f1d4","year":2023},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.695374Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:275a87418976bf712fa9cce12eea54141703883467c1b47f8285051aa3f5aa1b","observation_id":"f326dfa5-b7ef-476e-addf-77099124c929","resolution":{"observed_at":"2026-08-11T23:50:30.095954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02691","last_updated":"2019-12-11T17:33:13Z","snapshot_observed_at":"2026-07-06T07:58:30.747165Z","submitted_at":"2019-06-06T16:35:38Z","title":"An Introduction to Variational Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02691","snapshot_observed_at":"2026-08-11T23:50:28.699708Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.699708Z"},"links":{"cited_paper":"/paper/1906.02691","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:a97b629b815db204fb8132095ab81c63b31562c44fa66e0c204923d52039dc9a","observation_id":"ea41ac38-5073-459e-b5a7-b37d41361de4","resolution":{"observed_at":"2026-08-11T23:50:28.699708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-11T23:50:28.704285Z","title":"Ross, Bryan Seybold, and Lu Jiang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.704285Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:46680c35910c34aaaba1ad68f86bc744d5740dbc58802cb18e3958780da7b202","observation_id":"632d3418-c198-411b-852c-56e7bc651303","resolution":{"observed_at":"2026-08-11T23:50:28.704285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17414","last_updated":"2024-05-27T17:58:01Z","snapshot_observed_at":"2026-08-11T20:15:41.230819Z","submitted_at":"2024-05-27T17:58:01Z","title":"Collaborative Video Diffusion: Consistent Multi-video Generation with Camera Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17414","snapshot_observed_at":"2026-08-11T23:50:28.823325Z","title":"Wetzstein","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.823325Z"},"links":{"cited_paper":"/paper/2405.17414","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:e3b39e64f7c6252dcae31838a47f803942974f2411645cae3ece0947cb0bb60c","observation_id":"e4b7bb23-486d-4628-bdfc-01eeb526dfc3","resolution":{"observed_at":"2026-08-11T23:50:28.823325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.075047Z","title":"GLIGEN: Open-set grounded text-to-image genera- tion","venue":null,"work_id":"4b9f8d48-5d0b-4394-9813-d6da4abe92a5","year":2023},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.828943Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:27c9a0e50f8d380613e7d603fbb5040ac3d0e6c23e94b7a44b8a06fbe66a5aa7","observation_id":"b00cdd82-94b1-4d75-85c8-e6ded8bf6628","resolution":{"observed_at":"2026-08-11T23:50:30.079742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.059252Z","title":"Salman Asif, and Zhan Ma","venue":null,"work_id":"6f3c2499-5152-42ec-9037-eeaa9590e92c","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.833455Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:6483b1d1e6aa0d924b9e35de5e1a177245320c0d5fcdbb990ebe3893fecda998","observation_id":"4712e760-fcb0-4c53-a36c-c3e0990ab0b4","resolution":{"observed_at":"2026-08-11T23:50:30.064204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.042942Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"949ecaaf-3a84-40b1-93fc-459b785cb43f","year":2023},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.838038Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:66bbc8d38941b11349e05473c27aff8530889cfa9d18569afd596e8d962f7260","observation_id":"ff9b2dc3-cb34-4267-aa5a-ab7dbdfff22d","resolution":{"observed_at":"2026-08-11T23:50:30.048069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.027561Z","title":null,"venue":null,"work_id":"cc37eb02-d70f-465e-acdb-377433597799","year":2004},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.842500Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:b1a71bc72000938138581e3b24170332ca709200efd37e4c3c410ff1199a21dc","observation_id":"203bce7a-5766-4b46-9dae-31ea0c29a071","resolution":{"observed_at":"2026-08-11T23:50:30.032375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11970","last_updated":"2022-08-25T09:55:25Z","snapshot_observed_at":"2026-08-07T16:53:53.013522Z","submitted_at":"2022-08-25T09:55:25Z","title":"Understanding Diffusion Models: A Unified Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11970","snapshot_observed_at":"2026-08-11T23:50:28.847333Z","title":"Understanding diffusion models: A unified per- spective","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.847333Z"},"links":{"cited_paper":"/paper/2208.11970","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:9d7afa81574436406f53c822793328447e7da3cfc6fa76939e7c54d56fb5f5b4","observation_id":"e9a834e4-3a04-4d13-9719-87c93db298b4","resolution":{"observed_at":"2026-08-11T23:50:28.847333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:30.011206Z","title":null,"venue":null,"work_id":"5ce4ae23-1bbf-4496-8562-e94d98551de6","year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.852074Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:a7b0b0c71ace4cb0a76570c37b827201328761850d470e244bbdc0032816b454","observation_id":"7119135c-7e6a-40e8-91f3-8e942863653a","resolution":{"observed_at":"2026-08-11T23:50:30.016038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13195","last_updated":"2024-05-21T20:54:27Z","snapshot_observed_at":"2026-08-04T06:50:30.409396Z","submitted_at":"2024-05-21T20:54:27Z","title":"CamViG: Camera Aware Image-to-Video Generation with Multimodal Transformers","version":1},"cited_work":{"arxiv_id":"2405.13195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.13195","snapshot_observed_at":"2026-08-11T23:50:29.236303Z","title":"CamViG: Camera Aware Image-to-Video Generation with Multimodal Transformers","venue":"cs.CV","work_id":"8982d20c-0a20-43d6-a25d-9f09c7293d47","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.856584Z"},"links":{"cited_paper":"/paper/2405.13195","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:8df4397de47c316b0a3481366497d5e8ab19c0fdecc45398b6154362f02426b3","observation_id":"17b2c3e8-d19f-4659-b4ab-52676a9496f9","resolution":{"observed_at":"2026-08-11T23:50:29.241499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-07-31T21:11:02.534986Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08453","snapshot_observed_at":"2026-08-11T23:50:28.861311Z","title":"T2i- adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.861311Z"},"links":{"cited_paper":"/paper/2302.08453","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:2233b81706b071d666f17b77256ed03baba43680b3619f25c1ba5b5416acba48","observation_id":"3ba190d1-a0a3-4b78-9759-704bc9851bf8","resolution":{"observed_at":"2026-08-11T23:50:28.861311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.994960Z","title":"GLIDE: Towards photorealistic image gen- eration and editing with text-guided diffusion models","venue":null,"work_id":"5de6d178-a566-4a63-8e9d-e0cb0eeecd88","year":2022},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.866086Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:580a46a9eefb2e356369f4ab6ced2b6da42ea9b06c0f7c45bcf280c38223afc3","observation_id":"725923c9-2452-49b9-b3d0-205cd700ba88","resolution":{"observed_at":"2026-08-11T23:50:30.000500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.979173Z","title":"Neural camera simulators","venue":null,"work_id":"1180bbfc-f3f8-481d-99b0-ed3b2e91670f","year":2021},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.870419Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:c08f6ce13ea14921eb32cbdab25d491c0d8ecb71d51c6bd027a4ea6b95743454","observation_id":"eeaaa0d4-43e5-4462-a62c-46e00ead3a7b","resolution":{"observed_at":"2026-08-11T23:50:29.984635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.963137Z","title":"BokehMe: When neural rendering meets classical rendering","venue":null,"work_id":"7ec5a906-7569-453d-afbf-0e90c9641b82","year":2022},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.874979Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:afbff007ace4d0a2935ccf143a79f8ec14c114d1e4c6a3f2853f3993e5d9be78","observation_id":"62c8028e-ceac-42e8-918d-2b6b73e72244","resolution":{"observed_at":"2026-08-11T23:50:29.968150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.947038Z","title":"MPIB: An mpi-based bokeh rendering framework for realistic partial occlusion effects","venue":null,"work_id":"ffe4dbb0-d19d-4a44-9d8c-a468c9966f1a","year":2022},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.880452Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:780779383e330aecceb8b0a186eaef698a27bf7dd335a8dd8b049bed014af620","observation_id":"7c7972eb-783b-48ee-a71c-4ad119ff9451","resolution":{"observed_at":"2026-08-11T23:50:29.952060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.932116Z","title":null,"venue":null,"work_id":"82295cbb-dfdd-4cc4-bd0d-95206ab1a59e","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.884870Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:f975acfda95d55ef8d71a2c235b9e954021a986bbce21bf1ffbc2d9045f70e69","observation_id":"d43e784b-6ba7-4509-9afb-f200e69deea6","resolution":{"observed_at":"2026-08-11T23:50:29.936759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-11T23:50:28.889088Z","title":"Learning transferable vi- sual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.889088Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:723216ab9adba19faf9e4da2a26fda18b1de68de51c3eb523751b4a5e3477743","observation_id":"45382e95-ddbb-45f5-b236-a29d744828e8","resolution":{"observed_at":"2026-08-11T23:50:28.889088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.916870Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"f4d7eb57-4d4b-47be-8c59-485470d3ce06","year":2021},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.894388Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:e2c39297aad63217caf6f7689398cbbd301a230ded2d621ae923d6e1634f1e5d","observation_id":"8ff350d0-9a7c-4425-8dd1-c5a2fd5dea91","resolution":{"observed_at":"2026-08-11T23:50:29.921558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.901862Z","title":null,"venue":null,"work_id":"e9dc39a5-6ab4-4453-9bbf-5f259e7c4f57","year":2002},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.898867Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:7ef8d77cf1789203484bf4c2a5b148ef43cd2636acd218c72c6a1b01fd47c394","observation_id":"f277f32b-4ee4-425d-828f-f8de752bebff","resolution":{"observed_at":"2026-08-11T23:50:29.906451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.886241Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"38b07b35-14e4-4c5d-b7f9-304e37395c87","year":2022},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.904027Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:d635376daf527fa993221dead6e0ca813b4858a7ee97626f527a1486e653f120","observation_id":"6bd86eab-2347-4060-a23d-84aa82f47a4b","resolution":{"observed_at":"2026-08-11T23:50:29.891609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.870263Z","title":"DreamBooth: Fine tuning text-to-image diffusion models for subject-driven gen- eration","venue":null,"work_id":"93023410-cf2b-4e8e-991f-4ae6914f211b","year":2023},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.908385Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:3162fc52f586814e03ae83bd6fb97a12261443e120f7323f6812656465ab7dec","observation_id":"24351cde-7d27-4fe9-aec9-c089d959dcd6","resolution":{"observed_at":"2026-08-11T23:50:29.875258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.854062Z","title":"Sara Mahdavi, Raphael Gontijo-Lopes, Tim Salimans, Jonathan Ho, David J Fleet, and Mohammad Norouzi","venue":null,"work_id":"a6651d59-9e22-4342-bfe5-34b8d7a1ed3b","year":2022},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.913775Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:9a3ec4b966c218ef9e0c295196f65c05f53c99dd68743635b46e540d2afdcfcd","observation_id":"d023c56a-ce6f-4b6e-88fb-58794a33ae55","resolution":{"observed_at":"2026-08-11T23:50:29.858910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.836233Z","title":"Closed-Form factorization of latent semantics in gans","venue":null,"work_id":"2bccf394-e67f-44ad-866b-2fe5ba73e41c","year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.918503Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:1d5d524898c75db8312af023fb471c9ef75462842913e016c0f75165accf9d5d","observation_id":"9ca4d367-6a02-4818-8d02-0dbb8b22b7cb","resolution":{"observed_at":"2026-08-11T23:50:29.842963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.819942Z","title":"In- terpreting the latent space of gans for semantic face editing","venue":null,"work_id":"9173df0a-2cee-4bfd-aa17-9a0da79c0c2f","year":2020},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.924338Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:5844e53f28dc0f90dcb0d986dbd23b501647d230adc9f1f12e8d26f1b493495e","observation_id":"cb723c64-78ed-4c21-bcf3-f58a01442fe0","resolution":{"observed_at":"2026-08-11T23:50:29.824919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.804457Z","title":"InterFaceGAN: Interpreting the disentangled face represen- tation learned by gans.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2020","venue":null,"work_id":"5b6ea739-0c9f-4e0d-afee-5ab5ae6e6545","year":2020},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.928905Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:9acb38ef056ae45526b16d34da755822654975081af5b8c640504a0331b01a3a","observation_id":"0395b17b-2c16-45a5-85bb-25ebd470b8d0","resolution":{"observed_at":"2026-08-11T23:50:29.809388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.788862Z","title":null,"venue":null,"work_id":"b5a97c34-3d21-457f-aaa3-c9d67b149001","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.934664Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:40abea4e9476b547e0265842b81ed8436b06e01030c4996336cc5af333760e31","observation_id":"bdc13250-6836-4228-aa87-1beddb102301","resolution":{"observed_at":"2026-08-11T23:50:29.793696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-07-06T16:12:38.269310Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16512","snapshot_observed_at":"2026-08-11T23:50:28.939856Z","title":"MVDream: Multi-view diffusion for 3d generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.939856Z"},"links":{"cited_paper":"/paper/2308.16512","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:c843f618363f5fc6f0cbd2f87c91944de410a55122c8d15f683c5be4b0129bd3","observation_id":"6913cd7f-e9dd-48d8-9380-e0999a1ea3cf","resolution":{"observed_at":"2026-08-11T23:50:28.939856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:28.945611Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.945611Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:81efbaba77b26e58228dac0dd921e9078b76c1440f0c7e7650d25c2712c534a8","observation_id":"e4c49a4c-e885-411b-906a-7996e90d6e13","resolution":{"observed_at":"2026-08-11T23:50:28.945611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.763041Z","title":"DimensionX: Create any 3d and 4d scenes from a single image with controllable video diffusion, 2024","venue":null,"work_id":"fcd39818-6905-4564-94f4-e2aa23ef7352","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.950910Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:68074be077c95dcef789ae86a4bf6aab4eb8fcb14f4e09dd9925ec602064bec2","observation_id":"340fdd59-d3d8-4780-b449-8e171f88f66e","resolution":{"observed_at":"2026-08-11T23:50:29.767980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.747709Z","title":"Designing an encoder for StyleGAN image manipulation","venue":null,"work_id":"58d3a10b-47c4-4ecd-b791-f41809265b01","year":2021},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.956153Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:8a6845213f34f38276fc5e18e48e1d8437d49330dd03b6a545940f86e3116bba","observation_id":"34983e97-cdf2-4e59-a3b4-c1a72d625d81","resolution":{"observed_at":"2026-08-11T23:50:29.753090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.733112Z","title":"Mo- tionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"f4bacf7b-9595-46a6-bc8a-58b861063503","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.960966Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:d8f77d28dcf627cc9f5127404bf8295dda860d7d7ab739d4602823580d883268","observation_id":"39d9edd6-3b3d-490e-a787-e1b800ff7cd9","resolution":{"observed_at":"2026-08-11T23:50:29.738002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.718452Z","title":null,"venue":null,"work_id":"bd56588e-72ec-47b5-81db-6a3a11a86432","year":1987},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.966370Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:a9a680cebc8ed50afdff3085daa39b220110cf5291ed9ee2499d423531b3ec3d","observation_id":"d10964d1-a9f8-4c9f-976e-bcbd5a4411fc","resolution":{"observed_at":"2026-08-11T23:50:29.723202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.703136Z","title":"Learning images across scales using adversarial training","venue":null,"work_id":"a3cfd430-72e6-4674-9320-e54d77410716","year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.971048Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:29c39077eee6c48303965f22cf83d26ce0844ee5380b8c94a0f239ed23c5e00f","observation_id":"054bf9cc-b0ae-4611-aada-dfe16c4d0468","resolution":{"observed_at":"2026-08-11T23:50:29.708085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13490","last_updated":"2024-02-21T03:01:17Z","snapshot_observed_at":"2026-08-06T16:08:08.510370Z","submitted_at":"2024-02-21T03:01:17Z","title":"Contrastive Prompts Improve Disentanglement in Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2402.13490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.13490","snapshot_observed_at":"2026-08-11T23:50:29.160418Z","title":"Contrastive Prompts Improve Disentanglement in Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"cc83b202-055e-4d36-b4b9-37af11e98c3c","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.975810Z"},"links":{"cited_paper":"/paper/2402.13490","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:6f918e1d148ba0a6c927c49ed1034d87d09a04528e6845f6c7c4a5d0cd6ca61a","observation_id":"20bc80d4-ea8e-4546-bc21-76d058e51e96","resolution":{"observed_at":"2026-08-11T23:50:29.168224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.687771Z","title":"Uncovering the disentanglement capability in text-to-image diffusion models","venue":null,"work_id":"9a727260-0886-43c5-b27d-aad8bfcc0e0e","year":1900},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.980624Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:fdeadfb929a14536d02b62e38455c160b817013f87e19f47ed81cc528710f127","observation_id":"a32957c0-20a5-4ecc-b15a-f4e9606b666f","resolution":{"observed_at":"2026-08-11T23:50:29.692679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17470","last_updated":"2025-02-27T21:52:39Z","snapshot_observed_at":"2026-08-11T02:40:44.171343Z","submitted_at":"2024-07-24T17:59:43Z","title":"SV4D: Dynamic 3D Content Generation with Multi-Frame and Multi-View Consistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17470","snapshot_observed_at":"2026-08-11T23:50:28.985077Z","title":"SV4D: Dynamic 3d content generation with multi-frame and multi-view consistency.arXiv preprint arXiv:2407.17470, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.985077Z"},"links":{"cited_paper":"/paper/2407.17470","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:b87e26bf5479be7de167d0e846c376ade3f8de843c40ef27cd22801551b145dc","observation_id":"84335133-5ec6-4f9c-8070-12f7a350efd5","resolution":{"observed_at":"2026-08-11T23:50:28.985077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10774","last_updated":"2024-10-14T17:46:32Z","snapshot_observed_at":"2026-08-09T19:17:53.546163Z","submitted_at":"2024-10-14T17:46:32Z","title":"Cavia: Camera-controllable Multi-view Video Diffusion with View-Integrated Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10774","snapshot_observed_at":"2026-08-11T23:50:28.990356Z","title":"Cavia: Camera-controllable multi-view video diffusion with view-integrated attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.990356Z"},"links":{"cited_paper":"/paper/2410.10774","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:8c164eaaed12403dfc223e588f9b22825f526a736b9e42b4eb54d2302425370f","observation_id":"0a897c70-3e3b-432c-af77-6f62b006ec81","resolution":{"observed_at":"2026-08-11T23:50:28.990356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-08-11T23:50:28.995853Z","title":"CamCo: Camera- controllable 3d-consistent image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.995853Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:75408df208f3a36d868cd3e553bea868735a1c156b80e80f54674782a53ba4c9","observation_id":"ccc04bae-6d1a-487a-aaf8-e5c3afae8428","resolution":{"observed_at":"2026-08-11T23:50:28.995853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.672053Z","title":"Depth Anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"2086e123-32f9-4323-92bc-3d7776e7c7df","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:29.001324Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:6b545c8c0b2b3ffb78033b7d9d4fc65dd17bc61ff33acc5d0fc13a53aee4bf6a","observation_id":"724e2f7a-88c8-400d-a2a4-5ad403a78b72","resolution":{"observed_at":"2026-08-11T23:50:29.677382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-11T23:50:29.005899Z","title":"Depth Anything v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:29.005899Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:850a7ba9d1cc329f624cf55c0fab604ee6110866153dd4bdd0c469629a2e80cc","observation_id":"e9254725-9986-4753-ae80-e4ea11318693","resolution":{"observed_at":"2026-08-11T23:50:29.005899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.656309Z","title":"Direct-a-Video: Customized video generation with user- directed camera movement and object motion","venue":null,"work_id":"b42c008f-07f7-477a-a92e-2e2846dd621d","year":2024},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:29.010622Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:6db4e3e32e8b309da06979e239e82186ee0abf726bfcac61200d7cb56fc746a4","observation_id":"22053b17-ef4a-4ca7-9ea3-b4b9b4d181e9","resolution":{"observed_at":"2026-08-11T23:50:29.661462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.641234Z","title":"Adding conditional control to text-to-image diffusion models, 2023","venue":null,"work_id":"c6a17f3e-d5b1-4ca6-8ef4-e3da65f0ca9d","year":2023},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:29.015241Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:547a63fce0f475d2df594ca29a0e79e09defbe7632d9954c612bc1ea876e0fbf","observation_id":"d5c74c11-63b8-4856-9d47-91a7d75a2495","resolution":{"observed_at":"2026-08-11T23:50:29.646458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.625838Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"0d472597-b8df-40b9-b77e-0c7f116f5636","year":2018},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:29.020411Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:b9741a6bf11bf5fc760b2587f9669506c822eba6576d5f100780e6cd38603d52","observation_id":"de7aecce-0a15-4c3f-b634-73aed18e16a0","resolution":{"observed_at":"2026-08-11T23:50:29.630931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.611129Z","title":"Zoom to learn, learn to zoom","venue":null,"work_id":"48cc8aa5-17f9-41c7-97d5-ac2d6fdb27c5","year":2019},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:29.025052Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:f0691a5cef0cd941fc18607b9643bdff4db5acf7b5c17eea2cc21ab875379b01","observation_id":"1c8ab4f4-1a9c-4fb8-b009-84ebab7a3f2f","resolution":{"observed_at":"2026-08-11T23:50:29.615917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.595366Z","title":"Synthetic defocus and look-ahead autofocus for casual videography","venue":null,"work_id":"ee3e3782-b6c3-425d-b995-2c3a15e1bfd2","year":2019},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:29.029489Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:4eeb71b1a7306644a3d884df19b177534708803a4953f28dafdaa1855a478ac4","observation_id":"739ee02b-8cc1-416d-a6ab-57ea5be40ce9","resolution":{"observed_at":"2026-08-11T23:50:29.600460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.576805Z","title":null,"venue":null,"work_id":"b8e0d8f8-f2a2-484c-b96f-a7a8c5f41031","year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:29.034110Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:f9f86e1bf1b5d2b27e9ea092a8e3fc147e9b0447aa4e630ccce9d06701dcd97e","observation_id":"1c3192ba-8b15-440d-9895-029d193aa04b","resolution":{"observed_at":"2026-08-11T23:50:29.581687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.560945Z","title":"Camera settings are sampled during training and simulated on-the-fly using physical principles, producing differential multi-frame data without pre-storing large video files","venue":null,"work_id":"b85c07cc-fe94-46c5-81c1-76f1b67e24ea","year":1933},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:29.038943Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:e8b196c8aa8a5954e76b282fba0f97c0e090b03290bc98a3b35081010fe4c343","observation_id":"1c0f0e94-af57-4153-9bf4-56402cac3f83","resolution":{"observed_at":"2026-08-11T23:50:29.565988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.544775Z","title":"We extract the camera settings for𝐹𝑟 frames using the CLIP text encoder, compute the differences, and then reshape the result into an embedding of size𝐹𝑟×𝐶×𝐻×𝑊","venue":null,"work_id":"ed368c4c-1065-4364-869b-e6515adf7f6c","year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:29.044595Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:95fa529378eaa22841371c3d44287426c0ca9b36b5ec3b8edb567a3ea8d1aaa9","observation_id":"e1a33af1-1b68-4195-8015-a595e14aceb7","resolution":{"observed_at":"2026-08-11T23:50:29.550151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.527119Z","title":null,"venue":null,"work_id":"5c48000e-3374-4904-b449-6548abefc99d","year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:29.049499Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:41066059de44445b74dd4c3ba183327360ca4226521f3ef9b3395d73017967cb","observation_id":"cfe3b4c1-c959-4209-ab16-3b6569d468c3","resolution":{"observed_at":"2026-08-11T23:50:29.532183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:29.510379Z","title":null,"venue":null,"work_id":"8621557f-9661-40ef-9a58-8fb39047206f","year":null},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:29.054249Z"},"links":{"citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:0983d1129bcb3c54f4d208c46aa784a220c9b03c013e4f8e28bef770c1480256","observation_id":"4037ac18-012e-4261-a7c5-eac45c040da6","resolution":{"observed_at":"2026-08-11T23:50:29.515120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T11:35:50.334493Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":3,"verified_fuzzy":44},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 3 inbound Pith citation observations for arXiv:2412.02168."}