{"as_of":"2026-08-12T19:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b75fd97aec1543d1f876fa75d424e3fcdb119f2f89f2a995c2ad4228ab1397c","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:41:29.077181Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:28:08.979140Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:28:16.885560Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2501.12910","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12910","snapshot_observed_at":"2026-08-07T13:28:16.885560Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","venue":"cs.CV","work_id":"4dabaaaa-30f4-4971-ba0a-0ddf479decd5","year":2025},"citing_paper":{"arxiv_id":"2505.21876","last_updated":"2026-05-28T08:11:37Z","snapshot_observed_at":"2026-08-07T13:18:12.902974Z","submitted_at":"2025-05-28T01:45:26Z","title":"EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:08.979140Z"},"links":{"cited_paper":"/paper/2501.12910","citing_paper":"/paper/2505.21876"},"observation_digest":"sha256:7f5761c7ff53dfcf824f577d5a8879c7553de31292ee12e8dbc6aa63f16488b2","observation_id":"ed665f5c-5629-47f7-b689-c053aef19e75","resolution":{"observed_at":"2026-08-07T13:28:17.000375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12910/citation-record","integrity":"/paper/2501.12910/integrity","json":"/paper/2501.12910/citation-record.json","paper":"/paper/2501.12910"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.792685Z","title":"360cities dataset","venue":null,"work_id":"ba8d5402-6f92-45f5-8a85-fab049a0f994","year":null},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.589292Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:43ef858a2b3d5a0c9b659fe96b45c27e9e9852971c5a06bf85b606145d90cd63","observation_id":"96a5ad38-0a75-4709-9e06-a60eac1779f1","resolution":{"observed_at":"2026-08-10T16:41:30.800080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.767931Z","title":null,"venue":null,"work_id":"35b28a89-b06c-4414-9d70-08886d616d34","year":null},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.596758Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:6f73475158f2e08fe563c5f97281a29ec6a71f6f20e8910c945bf549031cd1b8","observation_id":"5235a997-0f8c-4d0a-9773-ea0e40b7038e","resolution":{"observed_at":"2026-08-10T16:41:30.775886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-10T16:41:28.604530Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.604530Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:7d9d4e5697a71ac4d0ac6a383401c6cd93d92ae1b5b81ff122a13351e32c7658","observation_id":"bb71e5e0-b985-4f99-97dc-95255654326e","resolution":{"observed_at":"2026-08-10T16:41:28.604530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:28.610631Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.610631Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:950034e95499ed4fa61501e6f0ec396f7dbc17afb517657a0f20359960be40ed","observation_id":"c7da89be-346b-4372-bed7-42b23fc87874","resolution":{"observed_at":"2026-08-10T16:41:28.610631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.729931Z","title":"A unifying geometric representation for cen- tral projection systems","venue":null,"work_id":"40231f34-9067-441c-b10e-ccf72253dbab","year":2006},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.616329Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:21a748a3dea33e8265a78518770c285dabfe7fc1d0d7316d5e8a1a72dc015e9c","observation_id":"9a0b4937-d7bd-410f-a229-e450a096a40e","resolution":{"observed_at":"2026-08-10T16:41:30.736137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.698032Z","title":"Loosec- ontrol: Lifting controlnet for generalized depth conditioning","venue":null,"work_id":"c1f8cf6e-c93b-489f-876d-8fcfeaf35fe8","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.624255Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:d8700e969781a97caad74e0b3bfebb3ddbe704ed7198d37eb0e9333bf1ac70b9","observation_id":"4f9c93bf-2db8-42a9-9a0a-c36dd525ae75","resolution":{"observed_at":"2026-08-10T16:41:30.707383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T16:41:28.636232Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.636232Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:d16feb0d21ad1d9423ac69b0c9c2233e622da5bff238e3f90af6781b22ff2960","observation_id":"d90c3b6b-734c-4dba-8fba-0159aa4d52b1","resolution":{"observed_at":"2026-08-10T16:41:28.636232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.667968Z","title":"Deepcalib: a deep learning approach for automatic intrinsic calibration of wide field-of-view cam- eras","venue":null,"work_id":"665769e7-f2ac-4d5c-bc2e-8f6b35bd22ce","year":2018},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.647408Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:357fca3c4be705e2df85249330d60726061042adcff816debd4b6b8b951029b2","observation_id":"1a3b2f52-35ff-42e3-8683-1315f86869d4","resolution":{"observed_at":"2026-08-10T16:41:30.680957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.635485Z","title":"Photographic image syn- thesis with cascaded refinement networks","venue":null,"work_id":"ccbd538a-4d37-4d06-ae05-1033dea88a24","year":2017},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.655202Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:d5d65a676181738ead5b18e211e12448a57441ba65ea9b62ea164195026d0003","observation_id":"9916102c-c8d1-4925-a988-9cdf4fb6953c","resolution":{"observed_at":"2026-08-10T16:41:30.644481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.599095Z","title":"Sketch2photo: Internet image montage","venue":null,"work_id":"99c75d63-434f-4f6c-bfae-dc522cbfa1b3","year":2009},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.672536Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:ba407d384b5c62fc625b27c8cbce48bd2190a81e2f3664a8330c38f518d77982","observation_id":"62635136-6bdd-41ad-b3e8-63e99a83237c","resolution":{"observed_at":"2026-08-10T16:41:30.608922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.564765Z","title":"Learning continuous 3D words for text-to- image generation","venue":null,"work_id":"ee581392-be80-4855-8e4d-7958c9702574","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.679672Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:6280c1554a74079f74bd3f242234c498273bf09fb9101961a2b55700b26c4de9","observation_id":"22bddeab-76d1-4d75-a7c4-7c4fd8d20ae8","resolution":{"observed_at":"2026-08-10T16:41:30.580051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.525076Z","title":"Zero-shot spatial layout conditioning for text-to-image diffusion models","venue":null,"work_id":"c8ac0159-1f8d-4eee-85b3-5616a105e1bc","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.687691Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:163993137b830cce7a3212190c9dc0cba9ea574734e77333a401c158f923d631","observation_id":"e781210d-cef0-416e-b8bb-6dd104e13486","resolution":{"observed_at":"2026-08-10T16:41:30.536375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.501404Z","title":"Efros and William T","venue":null,"work_id":"ee472271-bf91-407b-bd6d-a8ddc9f49053","year":2001},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.696126Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:fc6118f433a7074a4179ccd84e7638804bcf679dc46d492ea4da7c7dc46528b6","observation_id":"5dc3779c-9017-41e1-8300-82f2f377b1b8","resolution":{"observed_at":"2026-08-10T16:41:30.508562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.478717Z","title":"Efros and Thomas K","venue":null,"work_id":"ed11ee85-2814-43ca-936e-c857f49c54a0","year":1999},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.705022Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:5981c533b7d937528decd26bc457e82e17db4369266b0cbc23c60f76fade8161","observation_id":"8f42dfc4-32a5-4107-a0fe-2dc321b0a904","resolution":{"observed_at":"2026-08-10T16:41:30.484140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.450633Z","title":"Photosketch: A sketch based image query and compositing system","venue":null,"work_id":"ba06f377-7541-4fa2-8879-d22e4702d1c8","year":2009},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.714008Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:3ba1ecbebd6e6fe8772c6fd4b4b05ca50c62fafbaa863e21870c39d5a6603c96","observation_id":"2daa9538-34f5-4d52-ae45-2db230da5fd0","resolution":{"observed_at":"2026-08-10T16:41:30.456635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.418666Z","title":"Diffusion self-guidance for control- lable image generation","venue":null,"work_id":"7055a6c0-2dc7-415f-aa7c-c9185e5efdca","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.719882Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:fd2cc4a2fc458dd0a689ed97662536d28b5c492793af27868e47535c4b50f86b","observation_id":"641ebf6f-06f4-44b6-9d12-c8c2e7ea6224","resolution":{"observed_at":"2026-08-10T16:41:30.426499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:28.732251Z","title":"Accelerate: Training and inference at scale made simple, efficient and adaptable","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.732251Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:ba014da85e7ab365bcdea30bad1894d138c9d3b61c7f7129a718b6f2d95375d4","observation_id":"86b3454f-1814-4096-a736-e6d4797e2ca5","resolution":{"observed_at":"2026-08-10T16:41:28.732251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.361838Z","title":"HDRIs dataset","venue":null,"work_id":"023c5d74-49b9-4e35-95d9-5cf992f61cc5","year":null},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.741904Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:60c666e74caa2ae13c98d310e2cfcfc88694366d32b5deccc551ad7faa2273eb","observation_id":"e4eb0624-9102-45ac-ab00-778502649670","resolution":{"observed_at":"2026-08-10T16:41:30.372811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.325319Z","title":"Scene completion using millions of photographs","venue":null,"work_id":"30e3fc7b-7f14-4136-8e31-e688c3c8efe0","year":2007},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.747346Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:a918dc0cbd2e547d3334d97e2d718d8ad97bd80e5a4373a36e1772018ab84fbf","observation_id":"d5d20306-e686-45cd-9746-e8e9b496f9f5","resolution":{"observed_at":"2026-08-10T16:41:30.338601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-12T01:27:32.593496Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-10T16:41:28.752581Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.752581Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:f038d1122ce3b78e1dbe272423d46436de686a676cdf2b9c99a4988216235c25","observation_id":"e42aa40f-531b-4deb-82ff-3dbc3ced8eea","resolution":{"observed_at":"2026-08-10T16:41:28.752581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.298928Z","title":"Image analogies","venue":null,"work_id":"a8b74538-cf9e-491d-b5f8-b774cce94936","year":2001},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.758917Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:78a5e825600340b1e4578889d6f423c7ce349913eac6892ca8055721dcac1e71","observation_id":"2b453be9-ad9b-4c7c-bf0b-39917cf676f9","resolution":{"observed_at":"2026-08-10T16:41:30.306918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T16:41:28.766742Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.766742Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:1a78530215ed28a7712d0d69c7d5fe5b89d74ff427e9ca627b00232885696d8c","observation_id":"a56ee277-5a17-438f-97f0-9b9b8a7e1783","resolution":{"observed_at":"2026-08-10T16:41:28.766742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:28.775725Z","title":"Image-to-image translation with conditional adver- sarial networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.775725Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:090531430a0276c3a17096cc9a456323529d642ab123cdcc7aa1d5e36a66e2df","observation_id":"e633258d-2468-4674-b6eb-0ec7a971c41f","resolution":{"observed_at":"2026-08-10T16:41:28.775725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.238049Z","title":"Perspective fields for single image camera calibration","venue":null,"work_id":"71354fa7-8ab0-416a-a6d5-12e758d7d652","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.782469Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:d2c4fb3aac323207ff6f8666768e63c179b74baa664b983c57a99c815d5f9036","observation_id":"3d02ccdf-0ac7-4097-9dcd-fad827214e19","resolution":{"observed_at":"2026-08-10T16:41:30.253017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.200181Z","title":"Semantic photo synthesis","venue":null,"work_id":"c1c1cdad-01eb-4bdf-9611-df9405ac4b3a","year":2006},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.792549Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:f35fc92bc3d6b4f497ca86311a2a7fed425bbe11dc540767a872ca9a5d89987c","observation_id":"7ee08c95-de46-4523-bdaa-d58f08602bce","resolution":{"observed_at":"2026-08-10T16:41:30.208878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.159543Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"6e253bb2-0c78-4804-8885-73146f1fed34","year":2014},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.799606Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:7dac17e385fdeaf4a92d3ac95c2b9c084205237e4a51e609f2d8466d24aeb520","observation_id":"850f9c5b-49cd-4f4a-b225-1a2b52a03186","resolution":{"observed_at":"2026-08-10T16:41:30.169814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12333","last_updated":"2024-12-02T21:15:29Z","snapshot_observed_at":"2026-07-06T18:02:19.428801Z","submitted_at":"2024-04-18T16:59:51Z","title":"Customizing Text-to-Image Diffusion with Object Viewpoint Control","version":2},"cited_work":{"arxiv_id":"2404.12333","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.12333","snapshot_observed_at":"2026-08-10T16:41:29.319631Z","title":"Customizing Text-to-Image Diffusion with Object Viewpoint Control","venue":"cs.CV","work_id":"72eaa2e1-8dd7-4494-b597-e3713cc064ed","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.818653Z"},"links":{"cited_paper":"/paper/2404.12333","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:af5090797ea3f2ec6c0760b56b0a7b45dab9cc47662090a63c1b14c1a1c16d29","observation_id":"24187fb1-75a7-4022-b27d-8e8eaef214a4","resolution":{"observed_at":"2026-08-10T16:41:29.332307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.117369Z","title":"Distortion-adaptive salient object detection in 360º omnidi- rectional images","venue":null,"work_id":"6c94d47d-29d6-4288-9cf3-2b118602fcf8","year":2019},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.825541Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:037248e734ac990cfd2303cbf4b957df69bc9c5a2e9664ab121756c265f77fc4","observation_id":"d9fde885-6c23-4f9a-ac7b-f64114a89864","resolution":{"observed_at":"2026-08-10T16:41:30.127962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.090098Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"f49bd7be-876d-4d06-b245-36ff858de557","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.833451Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:1614f665c7932509d8f611b6c75165684dd31894ffd26cf10dc375fe6d9f24a0","observation_id":"3af3ca86-6e73-4c8e-bc72-1dab80130a5c","resolution":{"observed_at":"2026-08-10T16:41:30.095488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09967","last_updated":"2024-05-24T16:29:38Z","snapshot_observed_at":"2026-08-11T15:07:58.827504Z","submitted_at":"2024-04-15T17:45:36Z","title":"Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09967","snapshot_observed_at":"2026-08-10T16:41:28.839449Z","title":"Ctrl- adapter: An efficient and versatile framework for adapt- ing diverse controls to any diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.839449Z"},"links":{"cited_paper":"/paper/2404.09967","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:de6c66a8a540a9abfb0d4d1fccd2322d8adf34de42a2f5ce2e9d09a43eeabd5c","observation_id":"9489f2ae-b299-42d7-9b39-71019c9c3fe6","resolution":{"observed_at":"2026-08-10T16:41:28.839449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.055285Z","title":"SDEdit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":"9bc799ec-5248-4349-86b2-02f3d32f945f","year":2022},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.847453Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:70d0bdaafc5aad3397d202c9594221fe880379146c754f2f9224f3e40df7e35d","observation_id":"83b3f230-d45f-4183-886e-9afe76b53812","resolution":{"observed_at":"2026-08-10T16:41:30.065790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:30.021963Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"9b341a52-ee90-4538-aba5-7b385d28d98f","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.855417Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:23e9c50e7891c9372b29449a85656067ec7986d325c14f17a74d5b78cc06bb6a","observation_id":"8bd17937-d468-4841-9c5f-2fa68712b442","resolution":{"observed_at":"2026-08-10T16:41:30.033953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.994202Z","title":"Semantic segmentation of outdoor panoramic images","venue":null,"work_id":"b66218cb-bbf6-4eea-8718-fae2b01ba66f","year":2022},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.863502Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:fbfe8cbd04ad662ab50dee5786fb90603963ab12ba46855c6af3ff0b4ce80916","observation_id":"f20b0bbe-2a51-49c9-bff8-716b754696f8","resolution":{"observed_at":"2026-08-10T16:41:30.001128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.967068Z","title":null,"venue":null,"work_id":"76ee069a-3fdc-474e-9b1f-538026b67882","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.870792Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:0c23e4a57b4217d339d8d2d697270df00b8e9b8da695d9537129b05fe479dcc2","observation_id":"670b9bd7-c649-4974-aa6b-15d0b351eb0d","resolution":{"observed_at":"2026-08-10T16:41:29.975274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.938790Z","title":"Semantic image synthesis with spatially-adaptive nor- malization","venue":null,"work_id":"f8a40275-a6ce-4101-8d9a-ae137dcfe74b","year":2019},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.876118Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:e3a5e370dba4098691b4be5803846c76c21e493102de80388feff8ade7b64be6","observation_id":"c84e53cf-f014-4206-9a8c-2f6d18d10fbb","resolution":{"observed_at":"2026-08-10T16:41:29.946367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-10T16:41:28.881523Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.881523Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:bd61773b32a278aa29491e4ea2fad85f535da8ac06887b9ea40592279a0cd182","observation_id":"730bdf1a-a66d-466a-9bd5-a1c7d4a45673","resolution":{"observed_at":"2026-08-10T16:41:28.881523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.907712Z","title":"Kandinsky: an improved text-to-image syn- thesis with image prior and latent diffusion, 2023","venue":null,"work_id":"83c4c280-3d42-4374-8166-a3f3e6d82e3b","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.890772Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:0ad72bf77ed07b66ef751dc02ba7aeb07bfcf44d9a0987c3404dba33efa45e03","observation_id":"2079b755-6344-4601-b35f-d6f7bc9b71d5","resolution":{"observed_at":"2026-08-10T16:41:29.917924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.878163Z","title":"Blattmann, Dominik Lorenz, Patrick Esser, and Bj ¨orn Ommer","venue":null,"work_id":"24925879-6cd7-4dcd-b3ed-5ca7a8c12c37","year":2021},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.900577Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:1edab3b2fce1615734932c3ea1f9d9cea306eff18ef7a573d22676b61423055d","observation_id":"2d981b71-5973-4770-a2b3-9e8cab297af0","resolution":{"observed_at":"2026-08-10T16:41:29.887135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.853445Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"44b4abac-aa91-4ca0-8c45-75a31af47dca","year":2022},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.908014Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:a395d0312aded350e737a742ea8025d526f5125b9d17be728cad34836c998cb4","observation_id":"c3da1fda-f5ba-442d-b7ab-03ccd2b21d6b","resolution":{"observed_at":"2026-08-10T16:41:29.860990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.822133Z","title":"Saliency in VR: How do people explore virtual envi- ronments? IEEE TVCG, 2018","venue":null,"work_id":"f7073f67-ed09-4848-8d7e-3dd56876f2fb","year":2018},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.916759Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:773d443dfb720bc06b6adb2cbb335716ad3f647f106ce2da3fdbe5f22ce2c3d8","observation_id":"a22c34d7-fb3e-4ba9-b5b5-8b9fa3815909","resolution":{"observed_at":"2026-08-10T16:41:29.834654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.790358Z","title":"GeoCalib: Single-image Cali- bration with Geometric Optimization","venue":null,"work_id":"4e5fecb9-019a-4a72-b9c1-a72c2e576bd2","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.923033Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:8501032ac39bf5f1fbebda40f6d6f5f55d403143a4b6a49006867f37cdbc61f0","observation_id":"2c1b5f5f-ff3c-4850-bdf3-26f09ea4a87b","resolution":{"observed_at":"2026-08-10T16:41:29.797494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06601","last_updated":"2018-12-03T15:12:44Z","snapshot_observed_at":"2026-07-06T06:56:30.962909Z","submitted_at":"2018-08-20T17:58:42Z","title":"Video-to-Video Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06601","snapshot_observed_at":"2026-08-10T16:41:28.941004Z","title":"Video-to- video synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.941004Z"},"links":{"cited_paper":"/paper/1808.06601","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:f9bdef197662a6c01f3c2313bca6d0bd5476ce91621af56363b818eeea0c9e93","observation_id":"8d725307-7727-4a0b-8afa-13854baa053b","resolution":{"observed_at":"2026-08-10T16:41:28.941004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.763143Z","title":"High-resolution image syn- thesis and semantic manipulation with conditional gans","venue":null,"work_id":"5f8f7fa1-f63c-4363-ae70-8dbde683bb03","year":2018},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.955006Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:15a862ca1f6131cf745da8da20bbe506bcdd2b635c1e06f02a0bfcd9b61ce773","observation_id":"f11006ec-8e66-4bd3-9eb0-394ed915f73c","resolution":{"observed_at":"2026-08-10T16:41:29.772442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.738359Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"cb454d73-899a-44d1-85d3-4295e4d71e31","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.970101Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:c3481636a00fea70ce5ba11560edc65fab050177f7c3fcacb0640e7e1b9e4bd6","observation_id":"3ff40146-0aec-4c25-901f-769ccfcd4867","resolution":{"observed_at":"2026-08-10T16:41:29.746969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.708966Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"083934ed-0664-4f7e-beea-ff5ed89493b1","year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.981962Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:90afd2c93d42376c93ce9cbac7f627c1d31650805710224c867cdd89636ee760","observation_id":"f76d0914-f572-4f38-8e7f-32fff3251d22","resolution":{"observed_at":"2026-08-10T16:41:29.717200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-08-10T16:41:28.993268Z","title":"Camco: Camera- controllable 3d-consistent image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.993268Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:48225ace7c722ecd18c9bc195472f6272bd5ab0ccc6475b4b93efaf78e931aee","observation_id":"bd36556e-c861-40a3-9eb3-0348f7e6e2ee","resolution":{"observed_at":"2026-08-10T16:41:28.993268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-08-10T16:41:29.002316Z","title":"Dragnuwa: Fine-grained control in video generation by integrating text, image, and trajectory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.002316Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:ef3bb0595a00780d031057996f6da66400aabd6524aaa2db218ec29bad8121c6","observation_id":"45cae790-5f18-43bd-b78e-2332e51e2f55","resolution":{"observed_at":"2026-08-10T16:41:29.002316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.676499Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":"84b82b8b-3c6e-42fd-a031-aa751ecbee34","year":2022},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.015081Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:9a28eb83c5744b0a1ea8b7965da4b30789c44a8140bcb361bf8bd76d40e71c3d","observation_id":"e321441f-78f6-4a9d-ad34-1528ea478971","resolution":{"observed_at":"2026-08-10T16:41:29.689511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.650102Z","title":"Scenecomposer: Any-level semantic image synthesis","venue":null,"work_id":"f82f49fd-be6a-4c23-91da-502b76041da8","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.032415Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:af3712dbf53e404a70e1627035a150952dfcc100c195e6c1f3f7bc5695fc8ca7","observation_id":"bb7e60fb-e27d-4a82-a2c5-845736b6a6b9","resolution":{"observed_at":"2026-08-10T16:41:29.655961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.620302Z","title":"Stack- gan: Text to photo-realistic image synthesis with stacked generative adversarial networks","venue":null,"work_id":"7dcba73c-3ea5-46f6-820f-7c744e13468b","year":2017},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.044819Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:c1a997ba796f8b01dbe8dd85263dd2d2eea445f72080b6dff6e8502f34647257","observation_id":"8cc72d48-90c4-426e-8b86-b338cfe0f92b","resolution":{"observed_at":"2026-08-10T16:41:29.632027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.578891Z","title":"Stack- gan++: Realistic image synthesis with stacked generative ad- versarial networks","venue":null,"work_id":"48f51f57-68d2-41ca-900d-207814063414","year":2018},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.059058Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:9ee04556b28a225cdad18cb57a7826098d44255c6f272cbaaa062ee643ddffb9","observation_id":"aa3da337-d003-4018-8001-49013f1a1072","resolution":{"observed_at":"2026-08-10T16:41:29.586690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.553893Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"71351ec8-0c9f-477d-b0cc-5ff03646a230","year":2023},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.068634Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:4c67c6619bb5f883c60d81f7ac43e8790bb0fe2cfcdacbf60acf6063c5552e52","observation_id":"cb782a94-1861-449e-be43-a69a13be3a16","resolution":{"observed_at":"2026-08-10T16:41:29.561425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:41:29.514378Z","title":"A fixation-based 360 benchmark dataset for salient object detection","venue":null,"work_id":"a23954d7-124d-469d-b668-430b89ab3afe","year":2020},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:29.077181Z"},"links":{"citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:4275a3bfb4709fc70fb4594497114b658bba9ff8359288469e5f8781ee978a98","observation_id":"46d8d5d0-548d-49ff-bb9d-de381df75d65","resolution":{"observed_at":"2026-08-10T16:41:29.532165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T17:42:05.791132Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":38},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2501.12910."}