{"as_of":"2026-08-11T11:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3f9719d459fbcc0726669dda8cfdaad9a14a8e5e48ccc4878c54c426f3a861b","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:14:44.317232Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.09194/citation-record","integrity":"/paper/2501.09194/integrity","json":"/paper/2501.09194/citation-record.json","paper":"/paper/2501.09194"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:45.040814Z","title":"https://www.midjourney.com , 2023","venue":null,"work_id":"0310584b-5782-43d2-ba84-332d5ef15754","year":2023},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.017908Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:06c0869a2a38654c1e8bea96ea2cdef1b9870f9e28ce963f5bc042024e71ba38","observation_id":"29a84af5-0c5f-46a4-94f9-409c65cc6ee8","resolution":{"observed_at":"2026-08-10T20:14:45.044254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.022584Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.022584Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:ddebe08fa8ce4bf5a6623e1ab40a9f50e00ef124845000b79a256a7594d9ed57","observation_id":"f4eb55c2-98b7-4508-85c8-c42fea863db7","resolution":{"observed_at":"2026-08-10T20:14:44.022584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.026669Z","title":"Universal guidance for diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.026669Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:6dcc33dd92f806403eeb5ef5900cdf2fa42f621ee63bdbd5b515723116fc3035","observation_id":"28f214a3-2a16-4319-8c84-bcb138ab8eb7","resolution":{"observed_at":"2026-08-10T20:14:44.026669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:45.018491Z","title":"A computational approach to edge detection","venue":null,"work_id":"163aafbe-9dff-44be-9f79-6b4e48a33866","year":1986},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.031107Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:02c9ff69c363e508c81c5bcee23421d609e742d23ee06eb73f57da174b7f88bf","observation_id":"443a6f1c-6825-4b6f-a0b4-6599bac2e21e","resolution":{"observed_at":"2026-08-10T20:14:45.022183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:45.007769Z","title":"Realtime multi-person 2d pose estimation using part affinity fields","venue":null,"work_id":"cea3d18c-d803-4737-9f1f-4d68a1c9c44a","year":2017},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.034808Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:3d99469bd533cc1c4025f244f8f830b0582463885fc69c2ae51eb734c3ee49c3","observation_id":"5578465b-8a95-4b1d-a27f-1509824447af","resolution":{"observed_at":"2026-08-10T20:14:45.012006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.038662Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.038662Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:9f1baeb296901a932e156892037e684ac3da264e54a51f18379d9566cc331314","observation_id":"d929162c-28da-489b-ad2d-d51da4a64af6","resolution":{"observed_at":"2026-08-10T20:14:44.038662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.990969Z","title":"https://huggingface.co/CompVis/ stable-diffusion-v-1-4-original , 2023","venue":null,"work_id":"d2ef80fa-670c-4c33-9d5f-5ddf3291543a","year":2023},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.043347Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:0e1ec28ee3976ca37d509e8f906905b3c2cf08381d4cc9ce8c3d2256acf52235","observation_id":"b86bb911-d334-4bd8-953a-f5096551cda9","resolution":{"observed_at":"2026-08-10T20:14:44.994447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.047117Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.047117Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:6b871253421ec7f98ff4cc5c65ace41f02605d45456cf5db8f69d425ce9e20c2","observation_id":"54bbc49d-8495-43c5-9434-17f0d59fec3a","resolution":{"observed_at":"2026-08-10T20:14:44.047117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.975418Z","title":"Activation functions in deep learning: A com- prehensive survey and benchmark","venue":null,"work_id":"ba1782f7-80ac-4a71-b161-84690cc5404c","year":2022},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.051122Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:296d0c948dd8f889b14a79e906c982a921973cc68885d12a98b63ec7dcc0dcc0","observation_id":"b0456c63-e3e8-43c1-be59-e03cf25a0cd3","resolution":{"observed_at":"2026-08-10T20:14:44.979007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.054769Z","title":"Sigmoid- weighted linear units for neural network function approxima- tion in reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.054769Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:a3fe362f0eaa20de1cdc4a5bf42f2eefdb2cda2ccbc8af8b08deb534f75eb3a7","observation_id":"1e222010-9e09-4178-8329-0f666dbfd904","resolution":{"observed_at":"2026-08-10T20:14:44.054769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.959436Z","title":"Frido: Fea- ture pyramid diffusion for complex scene image synthesis","venue":null,"work_id":"e126b0e1-4a37-4a04-9615-11483ec3afd4","year":2023},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.058868Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:91777d35f920b19530bc9f9d194398226913e5226ba347235a7b30c807273c1e","observation_id":"10fe55fd-0363-430f-9629-1ff0ab393ca8","resolution":{"observed_at":"2026-08-10T20:14:44.962828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.949931Z","title":"Attrlost- gan: Attribute controlled image synthesis from reconfig- urable layout and style","venue":null,"work_id":"2aca4c49-c474-4343-9ada-1f7ee9a6cc9d","year":2021},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.062977Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:3593d26b940601a4d5ad2e27cd3084384690c58289caad4a06c843a7226eda6e","observation_id":"52784cc0-8ef7-48f5-b74a-6ec58866f7a6","resolution":{"observed_at":"2026-08-10T20:14:44.953470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.940047Z","title":"https : / / https : / / huggingface","venue":null,"work_id":"01db8cd6-3694-441b-a383-c1ad78e05990","year":null},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.067775Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:620953171bcade57b92ede70e9f9532edb8b96ece0d524f4c7c2a107b3f68d0a","observation_id":"c947496b-89cf-4ea2-af19-3243cee9a135","resolution":{"observed_at":"2026-08-10T20:14:44.943719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.076301Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.076301Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:6176614f9fbbac13d762cb4e3976b6ceb547c87acc7f0271abf30b9065452b69","observation_id":"e52f30f4-ec41-4af5-90f1-86ebc41a8a92","resolution":{"observed_at":"2026-08-10T20:14:44.076301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.913528Z","title":"Towards light-weight and real-time line segment detection","venue":null,"work_id":"7d3b4f84-21c1-48a6-bc87-5f532a6986cc","year":null},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.079985Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:b5daf9850e59e0dcd9cc2142debd35f9e12ea845c652ef92116e4d94b264bd96","observation_id":"7d8485db-9bb9-479f-b4e7-b333e22f9c79","resolution":{"observed_at":"2026-08-10T20:14:44.917553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.09106","last_updated":"2016-12-01T10:08:15Z","snapshot_observed_at":"2026-08-08T11:39:44.107967Z","submitted_at":"2016-09-27T05:57:00Z","title":"HyperNetworks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.09106","snapshot_observed_at":"2026-08-10T20:14:44.083950Z","title":"Hypernetworks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.083950Z"},"links":{"cited_paper":"/paper/1609.09106","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:b134e446042b247dfacd51d98d360e67bd9d6ace6998d70e61752a7ee8c87877","observation_id":"52d11ca9-9ab7-46b9-a571-2dcc5a825d24","resolution":{"observed_at":"2026-08-10T20:14:44.083950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.903831Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"b42c38cc-de2d-4512-84f0-e7f5f36d1d99","year":2017},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.088002Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:bf05b9b10ba8289bead63514f2d6a6b4f137b6af264167bebf968b9f0c653811","observation_id":"b5e0fec5-4dc9-456c-b09d-d808ffbde822","resolution":{"observed_at":"2026-08-10T20:14:44.907793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.092500Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.092500Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:9be6f9897544a47fa73491bf2dbc95a8f300dc03b6887c0722405a9225a99d43","observation_id":"a1040f7b-1737-49f7-a682-544f85890246","resolution":{"observed_at":"2026-08-10T20:14:44.092500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.889247Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":"2d3feadb-5daf-4179-9fbd-c4e0cf405280","year":2019},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.096210Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:ffd9c5721c678df98f623f94c0840f625bb7253bdcffb82fd94306a262533832","observation_id":"34f41441-7d98-4814-b021-85e8326bdd08","resolution":{"observed_at":"2026-08-10T20:14:44.892685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T20:14:44.099887Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.099887Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:61ce3a493fbb3b191774ce5e08bbe40bbcc6070897d75b5ce47ce395c21c33a7","observation_id":"bd8782a2-7ba9-450b-848f-346b89d0d37e","resolution":{"observed_at":"2026-08-10T20:14:44.099887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.06458","last_updated":"2021-05-13T17:56:07Z","snapshot_observed_at":"2026-08-04T13:37:59.813324Z","submitted_at":"2021-05-13T17:56:07Z","title":"High-Resolution Complex Scene Synthesis with Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.06458","snapshot_observed_at":"2026-08-10T20:14:44.103422Z","title":"High- resolution complex scene synthesis with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.103422Z"},"links":{"cited_paper":"/paper/2105.06458","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:4524501135b20e19704aad26ef1e2feafd40826e1e173ecb37367693b469afa4","observation_id":"bccb4656-da28-492a-abbb-6d7a1a2eb86f","resolution":{"observed_at":"2026-08-10T20:14:44.103422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.879124Z","title":"Cubic convolution interpolation for digital im- age processing","venue":null,"work_id":"161db00d-6089-4549-aca6-5f4e6540bca3","year":1981},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.107011Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:c60999554442f04a651f0e7bb2e35239ec67c6256f0f98f0fb44d502bbc5700a","observation_id":"59f6b616-28c4-4478-bffc-f3abadf1a8e5","resolution":{"observed_at":"2026-08-10T20:14:44.882568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-10T20:14:44.110462Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.110462Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:ab40eccabf833ed460c9afbcb4acb2b7cc541709282cc24e9dc0ea5159f915ae","observation_id":"61f1dabe-3bc7-4e46-ac7a-79fed757d127","resolution":{"observed_at":"2026-08-10T20:14:44.110462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.869405Z","title":"Gradient accumulation in pytorch","venue":null,"work_id":"3a8ff9fc-08cb-43a9-ba9d-283e414d808a","year":2021},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.114561Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:8319665990733fbd38c40c483883f0a88069c379bee549d23f2a11ae7c99cfb9","observation_id":"8bd9a413-0f43-409f-b6a9-b62f79d77149","resolution":{"observed_at":"2026-08-10T20:14:44.872849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.118003Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.118003Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:953cb042ffba339ab87ab6392b97ce47e04b5710e5b64048b320ea81e8c9fdd1","observation_id":"832b3790-7fb7-4737-8ec1-def61b64221b","resolution":{"observed_at":"2026-08-10T20:14:44.118003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.853362Z","title":"Grounded language-image pre-training","venue":null,"work_id":"df58983f-374f-4447-97bf-ae236e36a399","year":2022},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.122326Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:6e69e5541e484ed8814c8defca94eddddf7707d4fa865784a545fd61b73c354b","observation_id":"a66e66be-1489-4ce3-9a7b-f32065b5e67b","resolution":{"observed_at":"2026-08-10T20:14:44.856807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.843602Z","title":"Bachgan: High-resolution im- age synthesis from salient object layout","venue":null,"work_id":"533e7033-fa43-4257-a747-ffebd8de8982","year":2020},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.125796Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:fd69eba0746ead396dbb14a9e46f14d436cc25645042b3e6a1f90b2993c642ac","observation_id":"ca4a26d7-9f41-4a4a-b857-d7057bae1efc","resolution":{"observed_at":"2026-08-10T20:14:44.847333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.833804Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"07adc7bd-12b2-4033-8f61-3a560c342bdf","year":2023},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.129118Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:5ee62872bd4a297492a9ec3b4b352e1c5d780041e4ea2961d2f3d4e44da7a12a","observation_id":"782141d8-127b-4963-b4d9-e6911a3739b9","resolution":{"observed_at":"2026-08-10T20:14:44.837605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.823070Z","title":"Image synthesis from layout with locality- aware mask adaption","venue":null,"work_id":"89de411e-3914-4775-8b60-cc6908e7ad5c","year":2021},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.132405Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:b470ccd1c225e8ed845d6c59561bf885b0dfe43efbfbcf20d6a9910cf15c7334","observation_id":"8d14bacb-ea96-48b0-b320-b15dfdd611cc","resolution":{"observed_at":"2026-08-10T20:14:44.827207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.811947Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"5ed69383-2a3c-473e-a0ce-74ba838b8626","year":2014},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.135856Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:d8c34ef31f21f99799a960550468e6b60e9e5c0597a80fca03bcc3424d5057c9","observation_id":"6aad3892-ff3c-4fe2-b46b-a82b3451d6a6","resolution":{"observed_at":"2026-08-10T20:14:44.815840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09778","last_updated":"2022-10-31T09:05:25Z","snapshot_observed_at":"2026-08-10T13:42:46.496202Z","submitted_at":"2022-02-20T10:37:52Z","title":"Pseudo Numerical Methods for Diffusion Models on Manifolds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09778","snapshot_observed_at":"2026-08-10T20:14:44.139212Z","title":"Pseudo numerical methods for diffusion models on manifolds.arXiv preprint arXiv:2202.09778, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.139212Z"},"links":{"cited_paper":"/paper/2202.09778","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:a272ff284d7d8300918f86eadc27b455c9025cc5db30aa65a11e075a1cdc699a","observation_id":"b855b9a3-1360-48af-8353-204f9805f57a","resolution":{"observed_at":"2026-08-10T20:14:44.139212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.799280Z","title":"Design guidelines for prompt engineering text-to-image generative models","venue":null,"work_id":"afc35dbb-1055-4d95-aab4-656c842dc870","year":2022},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.142733Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:9a20e48df0930f36242e3288ca873e06358172e49be85d59aa8f299dcc04bea2","observation_id":"9e6a6c08-ab71-4d6c-a55d-7a8cfac41bcb","resolution":{"observed_at":"2026-08-10T20:14:44.803198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-10T20:14:44.146096Z","title":"Mixed precision training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.146096Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:1b39ed8163ff959a4a7ceb4cfcd3e55254c91ed53170bd4add004cd35dd2c820","observation_id":"92325b22-a572-409f-81d0-39b984affc04","resolution":{"observed_at":"2026-08-10T20:14:44.146096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.150245Z","title":"Representing scenes as neu- ral radiance fields for view synthesis., 2021, 65","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.150245Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:88ed50f7354c49b5c33ef006a5bc0b8cf058e7e3de5f3ffb3e83c13ff1313a6e","observation_id":"f2ca5f62-9742-47e6-99d9-62cd392f0cf7","resolution":{"observed_at":"2026-08-10T20:14:44.150245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.154679Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.154679Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:dd78d519944978b19b0d5a89dfa4924e6c12ce02cfe425732f325b010515b4d3","observation_id":"5799c8bd-c5fb-4ea9-9b40-7b82878fb03c","resolution":{"observed_at":"2026-08-10T20:14:44.154679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-10T20:14:44.158319Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.158319Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:706b3be79efd5f0ab0010ac3d4f3b63f26c1dc29ba053718707a114ea97d4ca4","observation_id":"81e78ed6-7861-4356-af5c-15f09d0122f2","resolution":{"observed_at":"2026-08-10T20:14:44.158319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.162894Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.162894Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:8560e8712881b2d89eafae8cb7bf9995abe7da050d4d02beb8dfc260a0bd8d02","observation_id":"3d59a5fd-a6b4-42b1-819f-4c8bbae8dc5e","resolution":{"observed_at":"2026-08-10T20:14:44.162894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.777426Z","title":"Dall-e-3","venue":null,"work_id":"846ff77f-220c-4516-b2d6-588c15fdddc6","year":2023},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.167463Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:e327db39edf3e9310f549bf35efbc39f2b23d5c572dba46e0451f87d5787a764","observation_id":"d16b58ab-9bad-4993-9dcc-7ae3dcdc690a","resolution":{"observed_at":"2026-08-10T20:14:44.780818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.766712Z","title":"Im2text: Describing images using 1 million captioned pho- tographs","venue":null,"work_id":"977821ec-c7b7-4ca9-a3ca-ee96688bdbb6","year":2011},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.171071Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:2d1d7ab57178fdda0b6d42491bac1a9ee9c30ed387652dc6d2060bcbb001cce5","observation_id":"1df731f2-01fd-4bb6-bfda-3ceea6cc35ea","resolution":{"observed_at":"2026-08-10T20:14:44.770591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.755834Z","title":"A survey on performance metrics for object-detection algo- rithms","venue":null,"work_id":"4b8130ae-ae14-447b-9844-88b9be63e3d4","year":2020},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.174836Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:3bfb7788dbb96d198431028acbab3c96bb13f07ba214705dc0e15b26ba72d63a","observation_id":"527bfbc9-6eda-403c-809e-db014af395d0","resolution":{"observed_at":"2026-08-10T20:14:44.759949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.745095Z","title":"Best prompts for text-to-image models and how to find them","venue":null,"work_id":"4ad4e166-d0b8-4f81-b3c2-bf09873811fe","year":2023},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.179382Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:dc1d7e371f95acc86df505ae3fe67ebae4742243f65833c18765ac5aee512782","observation_id":"ca7712dc-0cb6-4dfc-94d9-97064d0f819c","resolution":{"observed_at":"2026-08-10T20:14:44.748829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.183152Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.183152Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:521b7050d0568465380e0008f2875fe81e9bfd07d5717b081e0fdeb990b288e3","observation_id":"bbfcc5da-ba4a-4f20-8d20-a2c267c0f6eb","resolution":{"observed_at":"2026-08-10T20:14:44.183152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.727395Z","title":"Multilayer percep- tron and neural networks","venue":null,"work_id":"a2e666ab-1e24-470d-bf3c-4470866b0710","year":2009},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.188029Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:3557dfd6fff33fdded8af1db5d4bab29ea020a3d7cad26ada5a6a393cb7da26f","observation_id":"5bc6d2e0-b113-489e-aa4d-a40564fcd8d1","resolution":{"observed_at":"2026-08-10T20:14:44.731314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.16061","last_updated":"2020-10-11T02:15:11Z","snapshot_observed_at":"2026-08-04T20:09:58.097029Z","submitted_at":"2020-10-11T02:15:11Z","title":"Evaluation: from precision, recall and F-measure to ROC, informedness, markedness and correlation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.16061","snapshot_observed_at":"2026-08-10T20:14:44.192317Z","title":"Evaluation: from precision, recall and f-measure to roc, informedness, markedness and correlation","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.192317Z"},"links":{"cited_paper":"/paper/2010.16061","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:560cb60ffc8c8c02c90d483ef9a445ecb9774ca19748319cfb0ecd5ac48251ea","observation_id":"43c7d025-c8e5-4aef-a1e3-beb571ae370f","resolution":{"observed_at":"2026-08-10T20:14:44.192317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11147","last_updated":"2023-11-02T17:59:06Z","snapshot_observed_at":"2026-08-06T14:12:33.767391Z","submitted_at":"2023-05-18T17:41:34Z","title":"UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11147","snapshot_observed_at":"2026-08-10T20:14:44.196199Z","title":"Unicontrol: A unified diffusion model for controllable visual generation in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.196199Z"},"links":{"cited_paper":"/paper/2305.11147","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:e9ac4bec7a097a54bcc9b50393277b7deeac8bdac681702febfab8df784af1a5","observation_id":"25076064-3619-4d49-8f13-8053bddac433","resolution":{"observed_at":"2026-08-10T20:14:44.196199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.716756Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"9168c90d-92b2-47f5-b29f-eb0e2242cdf3","year":2021},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.200476Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:0a34f4461ac5f05a9a4bb553238180d2842cbc7f2eca06a7b14a91f38a6d0e45","observation_id":"a3ee8a60-a17d-4cf3-95e5-52994c9a30d7","resolution":{"observed_at":"2026-08-10T20:14:44.720510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.204405Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.204405Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:c7ca119f19f528968a6bdd94c6f8df308e61f07088a37eb600201e647b73265d","observation_id":"f617eaca-3b83-4da5-be11-862090a5aa3d","resolution":{"observed_at":"2026-08-10T20:14:44.204405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.700322Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":"dee23bf7-8d21-4cdd-b28a-820aa1a123c2","year":2020},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.208724Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:7e0afb63d0d6454932d81ea7e82e9026d916717982c3009c225b94dc5d62b61b","observation_id":"c23132df-34c0-414a-bcde-4c640223f6d4","resolution":{"observed_at":"2026-08-10T20:14:44.704219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.689367Z","title":"You only look once: Unified, real-time object de- tection","venue":null,"work_id":"0a6a64f9-a606-488d-9c2d-1a605db86673","year":2016},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.212492Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:c15557ed8e0d42aadc15bcb0ff556d775cabcd0eae02d4ea3f040a77ccc94f60","observation_id":"cbc8b371-ab05-47e5-90cb-f2a36ad15e82","resolution":{"observed_at":"2026-08-10T20:14:44.693413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.678327Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"81807553-cd1d-4f4d-84ec-0570da3eef5a","year":2023},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.215742Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:782e88a6c5ab1bfccbb60e783fde197d700696b422bac815edcc9e95050a48b4","observation_id":"e1db28e8-7684-424a-ad70-adad6642d6a5","resolution":{"observed_at":"2026-08-10T20:14:44.682712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.219154Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.219154Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:e2fe796c14d5e6501c662d6727805e9157fc9971c7594855fc98274b10eecce7","observation_id":"886c423e-c27b-4a6b-94f2-d7a8bcc1723a","resolution":{"observed_at":"2026-08-10T20:14:44.219154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.658168Z","title":"Limitations of face image generation","venue":null,"work_id":"eb8d7703-c83d-49b8-a400-3685f95fca81","year":2024},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.222423Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:b115890f84f0fe381602d3461955c6f731696a72d213dcf5c16e699798c80e65","observation_id":"9991d7dc-3d0b-43f5-9df2-658d06f12ea9","resolution":{"observed_at":"2026-08-10T20:14:44.661930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.646585Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven 18 generation","venue":null,"work_id":"a664fbcb-ea84-4d91-930d-b1a852f6237b","year":2023},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.225705Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:e07efed362ad5fe7718eb2e723aa69dda2f84c37e419b6f4c713bc14ac59b9dd","observation_id":"bf9698eb-ccc9-4924-9e03-7d37b9ffb3c8","resolution":{"observed_at":"2026-08-10T20:14:44.650749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.229446Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.229446Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:ba4e7e5d2bc92c3717d3fe79910d51217071ded20159c2334b7ba846b1cacd95","observation_id":"b9d6ebb8-1bf2-4bb0-9811-80105e8fd4a5","resolution":{"observed_at":"2026-08-10T20:14:44.229446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.629294Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"df86c16f-3b0b-4c29-9d10-17f6f5f7b49f","year":2022},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.235398Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:e2cf37dc0b6f333a9de36a00b7a23ffbc029ab0c27b04d708d1603f947cb538b","observation_id":"b11eea83-3fe5-4441-a6f7-589bdd03e9e9","resolution":{"observed_at":"2026-08-10T20:14:44.632961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.238608Z","title":"pytorch-fid: FID Score for PyTorch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.238608Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:090c97561cf30b37e255755c383ce00d0c2a6348260b37deae04f071b8975def","observation_id":"3bec2208-10f0-4080-91e2-124f05f55e88","resolution":{"observed_at":"2026-08-10T20:14:44.238608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.613486Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"0c16206b-7050-43f2-b10d-5d9d4efb46f0","year":2019},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.241681Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:7b8d6f047725b351c9afff958e8e55d3b2eec0ebc16c44394688d13a38749479","observation_id":"32888533-b8a8-4bb5-8079-e25df68ff5cc","resolution":{"observed_at":"2026-08-10T20:14:44.617263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.603592Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"470a7c08-da6d-484e-9493-6283335516fa","year":2018},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.245878Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:895d75018a16cc837a956cea292bd260af7d8cf61b0cb13be82b98918329536c","observation_id":"de19db63-626c-4862-82b7-d408e4c8c8f9","resolution":{"observed_at":"2026-08-10T20:14:44.607253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.593467Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"4f22f98f-812f-4cb0-b7b7-6093c17ae77c","year":2015},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.249485Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:3f39a5d46c7e143220707e9c6ef88240cc28cc8d3d10ed3c5bd3ac36d6fc6f81","observation_id":"d1d1f4db-63d8-44a8-a4bc-f6626418c8a5","resolution":{"observed_at":"2026-08-10T20:14:44.597076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.253849Z","title":"Generative modeling by esti- mating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.253849Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:75e92669c2f4d53f853e49ebbe6bc862107df03b55bbaf312eb47f2c7ce7bec4","observation_id":"0c17c7f5-752e-413f-b1c4-ccc871b6c652","resolution":{"observed_at":"2026-08-10T20:14:44.253849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-10T20:14:44.257528Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.257528Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:6619bed63df09cb01e9bc6eb70b78b4ddd75ae7d9d2f61dec2a767d05ff0ab59","observation_id":"b34d761d-7a03-47a0-893f-c0173d29bfc5","resolution":{"observed_at":"2026-08-10T20:14:44.257528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.576620Z","title":"Image synthesis from reconfig- urable layout and style","venue":null,"work_id":"87bd1e3c-28a8-4a38-a186-5790cf4bf9a4","year":2019},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.261925Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:83496045c7741b281bde814ad65023cb731dcf08d7e7d0aa6a4f292e944b3aeb","observation_id":"0106fb5e-2414-4cd5-b98b-57e9b8c8e826","resolution":{"observed_at":"2026-08-10T20:14:44.580328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.565954Z","title":"Learning layout and style recon- figurable gans for controllable image synthesis","venue":null,"work_id":"7d97cdd3-6c91-41cf-8747-2c0eb318ff29","year":2021},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.265289Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:e22f5a3ee5a3847fd84fe9b4e836880cf0a76f364fc0424fbbd7286103d470de","observation_id":"df9ae7bd-3a94-40b9-b4ac-b73c25ac4893","resolution":{"observed_at":"2026-08-10T20:14:44.569859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.555808Z","title":"Object-centric image genera- tion from layouts","venue":null,"work_id":"410ece70-9f0a-44a1-a915-5fc9d843a4c7","year":2021},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.268583Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:157a5749a49a1ea814f8503174b9de1cf3f1476f04ff4d085eb112d2706310d3","observation_id":"111589ab-a591-4257-a6c3-3ed7ca876990","resolution":{"observed_at":"2026-08-10T20:14:44.559207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.00463","last_updated":"2019-08-29T04:17:49Z","snapshot_observed_at":"2026-08-11T01:17:48.312983Z","submitted_at":"2019-08-01T15:39:54Z","title":"DIODE: A Dense Indoor and Outdoor DEpth Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.00463","snapshot_observed_at":"2026-08-10T20:14:44.271928Z","title":"Diode: A dense indoor and outdoor depth dataset","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.271928Z"},"links":{"cited_paper":"/paper/1908.00463","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:efd2ae271ffb31b9ba60f1fa65b517e8207cd2fbaf31ef71db6efa28d66a2ee5","observation_id":"bc3cb536-5a41-4fa0-bea8-127208a7715f","resolution":{"observed_at":"2026-08-10T20:14:44.271928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.276321Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.276321Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:fc5094ca10a9d28609e8e5dedbd81ff8cdf03459cc56ebe681e9157fa851133f","observation_id":"ce22718a-6b35-41a2-bcaf-1cf0a49c7f17","resolution":{"observed_at":"2026-08-10T20:14:44.276321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00695","last_updated":"2022-04-11T14:58:15Z","snapshot_observed_at":"2026-08-10T23:42:51.183571Z","submitted_at":"2019-06-03T10:45:08Z","title":"Continual learning with hypernetworks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00695","snapshot_observed_at":"2026-08-10T20:14:44.280111Z","title":"Continual learning with hy- pernetworks","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.280111Z"},"links":{"cited_paper":"/paper/1906.00695","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:3e6d798bba3581d65dcdc37ec14420841a8b8d2d8aa6f3ba88cf68b05c5459d2","observation_id":"667db6ff-5591-4409-870e-729c1d4c2a53","resolution":{"observed_at":"2026-08-10T20:14:44.280111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12952","last_updated":"2022-05-25T17:58:26Z","snapshot_observed_at":"2026-08-08T08:58:05.637492Z","submitted_at":"2022-05-25T17:58:26Z","title":"Pretraining is All You Need for Image-to-Image Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12952","snapshot_observed_at":"2026-08-10T20:14:44.283725Z","title":"Pretraining is all you need for image-to-image translation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.283725Z"},"links":{"cited_paper":"/paper/2205.12952","citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:ab545f23f28201c8539a1c75fdb49d737c58d9b295cce2bedda17f07e49abf78","observation_id":"b792b2ab-73dd-430f-886e-8df50f4e3416","resolution":{"observed_at":"2026-08-10T20:14:44.283725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.287085Z","title":"Instancediffusion: Instance- level control for image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.287085Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:df33fe36509fbbdecb027d61892476d1251f437a3dec0dd410e53cdc2b3ba7d8","observation_id":"f9f7e92f-1658-4a49-968b-7d2f728f3274","resolution":{"observed_at":"2026-08-10T20:14:44.287085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.291064Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.291064Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:37a8db2f8577194e4d8a902b28b6a469a831ee51e168435c44e689ae31932c96","observation_id":"c855e139-93d9-4c00-bce4-508d27e16bd5","resolution":{"observed_at":"2026-08-10T20:14:44.291064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.528958Z","title":"Holistically-nested edge de- tection","venue":null,"work_id":"6d8a1eeb-6e5c-45c9-954d-c440787df4c0","year":2015},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.294151Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:4053da030858a4bdaae9f29e2674b9f6296d817c6fee9b1b2ddec2d594c9c9f2","observation_id":"e50025bc-ffd4-4915-80ef-8baaed24fa68","resolution":{"observed_at":"2026-08-10T20:14:44.532346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.517674Z","title":"Modeling image composition for complex scene generation","venue":null,"work_id":"a175d037-6a04-4448-bc5d-4159e8725c0a","year":2022},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.298203Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:1bd9eba5cff402fbd2b1a052f5c8b6fa55172aea92b8e9085e948ec494cdf211","observation_id":"9cb65e0e-4c7f-4c31-b64b-062866f42352","resolution":{"observed_at":"2026-08-10T20:14:44.522300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.301686Z","title":"Reco: Region-controlled text-to-image genera- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.301686Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:ba2b47363cf1bd8bd7dd4f9662650ac470540ee974dde680527cd6b62e4f29d1","observation_id":"e2fe1491-c148-457b-81a1-eb63363e2779","resolution":{"observed_at":"2026-08-10T20:14:44.301686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.500677Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"648fd4c5-bad4-41da-bb05-068564d5bb19","year":2023},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.305323Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:4f1f04dd69af540c29827f3e83fed2a88bbfd0f1ed5f78187cffbc05fa54fbd6","observation_id":"2b8052b4-417d-4b9b-934a-95a88cfd1e32","resolution":{"observed_at":"2026-08-10T20:14:44.505355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.489378Z","title":"Image generation from layout","venue":null,"work_id":"a63664ed-5089-425b-8377-e9b398fa4515","year":2019},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.309330Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:58f781561ef7de59b1b2ec351f82f0fd181c27d7e2630d763908df0daebbe80a","observation_id":"123f70c7-4508-4798-b52a-79a2dff5f11a","resolution":{"observed_at":"2026-08-10T20:14:44.492829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.474908Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models","venue":null,"work_id":"6c5bf999-6011-4977-86e9-69d87c09fbc4","year":2024},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.313806Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:b045c71e1c9da7ae70ab03d26c379ad5f31e9aee20ad0404c0888cafb4007e31","observation_id":"09dee146-a184-4d4a-88e7-5a6e48ddafe6","resolution":{"observed_at":"2026-08-10T20:14:44.481695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.317232Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.317232Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:58330df388116c5521eead4b60a52500fb20e34e4f38fb8d6835addab7d4df1e","observation_id":"544f663d-2bfa-4ff9-8157-a6857e9a4b06","resolution":{"observed_at":"2026-08-10T20:14:44.317232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:44.929755Z","title":null,"venue":null,"work_id":"c4402118-e336-4454-84aa-14f5590b209c","year":2024},"citing_paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:44.072410Z"},"links":{"citing_paper":"/paper/2501.09194"},"observation_digest":"sha256:de1bce3ef61eaa6ffc5427a58d653bb3c2d93d51846db12f68e030bff8b6530f","observation_id":"8409a590-d40e-4765-bdcf-021e50fbb2f4","resolution":{"observed_at":"2026-08-10T20:14:44.933195Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.09194","last_updated":"2025-02-10T18:54:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T03:14:44.026928Z","submitted_at":"2025-01-15T22:55:26Z","title":"Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":42},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2501.09194."}