{"as_of":"2026-08-14T06:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91454854e3e9b123866934796b2c79cd957f04256bbc70d0c002f058c2956631","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:51:15.596331Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:51:15.430935Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T14:51:15.757667Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2412.11594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11594","snapshot_observed_at":"2026-08-11T14:51:15.757667Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","venue":"cs.CV","work_id":"f91c2d64-8893-4be7-a488-a15d9a912954","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.430935Z"},"links":{"cited_paper":"/paper/2412.11594","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:2e5cee83e8153905b8439772c176d89078c5d5b03c655d7651c80f73e1efba61","observation_id":"30534c57-2710-40a2-833c-fcb1919e1463","resolution":{"observed_at":"2026-08-11T14:51:15.761702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.11594/citation-record","integrity":"/paper/2412.11594/integrity","json":"/paper/2412.11594/citation-record.json","paper":"/paper/2412.11594"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.185582Z","title":"W.; Hakim, B.; Morwood, M","venue":null,"work_id":"41b8270c-fabb-49c0-9a1b-f63d27565f4e","year":2014},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.408588Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:ef2ebc23cce6cf297d93ce5b3627879bc4920005f4d4d9ffe1e9860ec055e525","observation_id":"6501c49a-e8d2-44c9-a570-82de5977c362","resolution":{"observed_at":"2026-08-11T14:51:16.190011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-11T14:51:15.412959Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.412959Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:13a42beba07cc053ad2d0c1a23b736371ecd2f76f8d7c11f27f20691ad595bc8","observation_id":"af7e4f86-924d-4c33-ab3c-7f7d34766110","resolution":{"observed_at":"2026-08-11T14:51:15.412959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.175088Z","title":null,"venue":null,"work_id":"a8480947-ed60-4644-b0a4-41d20182cf90","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.416613Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:90fb4ce16ea47514203056f6d1dcfe1d28545368ec2b8cf9872e7907ed6faf7f","observation_id":"396dc7ab-56db-4331-a699-781d2449c190","resolution":{"observed_at":"2026-08-11T14:51:16.178615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-13T13:10:50.058243Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-11T14:51:15.419679Z","title":"T.; Rubinstein, M.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.419679Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:1683563179904c4cfc9885914545563476b32365a3e5e7464252fc2bc975bf93","observation_id":"e9a7f0b1-1c11-4b09-abcf-3b8193cec460","resolution":{"observed_at":"2026-08-11T14:51:15.419679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.164526Z","title":null,"venue":null,"work_id":"e4438475-6cb4-4c76-8e26-3f0a1e1df7d3","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.423472Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:6d1425b9b81b31281c718f236b7e71dc36a79beef2b610a7810aa51cd63bc5ee","observation_id":"515b6406-57d4-4936-80f3-191486f6aa71","resolution":{"observed_at":"2026-08-11T14:51:16.168178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.153588Z","title":null,"venue":null,"work_id":"f45412e0-6333-4252-87a7-fa0a375c50de","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.427025Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:d82d1e302e18a4fa16c77d6b1824a5ec641660d485ffde76cd582b395c0b4dc3","observation_id":"fbdff1aa-ca22-4956-9d6b-c4a227d3dc06","resolution":{"observed_at":"2026-08-11T14:51:16.157285Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2412.11594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11594","snapshot_observed_at":"2026-08-11T14:51:15.757667Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","venue":"cs.CV","work_id":"f91c2d64-8893-4be7-a488-a15d9a912954","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.430935Z"},"links":{"cited_paper":"/paper/2412.11594","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:2e5cee83e8153905b8439772c176d89078c5d5b03c655d7651c80f73e1efba61","observation_id":"30534c57-2710-40a2-833c-fcb1919e1463","resolution":{"observed_at":"2026-08-11T14:51:15.761702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.142282Z","title":null,"venue":null,"work_id":"18b105e3-026d-49fe-9dfd-1c8f0377fd09","year":2012},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.434454Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:edcab31dc4d167d70f0b75e2ba73be91e5e81e1a0f4bddc7cc76e158d4baa797","observation_id":"284774e5-4acb-4407-87be-c75c806dc11f","resolution":{"observed_at":"2026-08-11T14:51:16.146204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-13T13:24:31.977894Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-11T14:51:15.438184Z","title":"E.; and Wang, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.438184Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:963298faa918ce61cd32dc34f90313115371e7ffdd3bdcb9147037049d427206","observation_id":"c41a8b0c-3a71-45f9-b24f-a06cb4353d31","resolution":{"observed_at":"2026-08-11T14:51:15.438184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.130646Z","title":null,"venue":null,"work_id":"1a81e595-2f66-41b9-a041-250ee75550cc","year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.442361Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:f2fc31b06c167463e9350749f7eb72793a693ef2f378c987cbf4f6acb4b54afe","observation_id":"aa1c793e-6fa1-41da-9e5d-43744b3bb72c","resolution":{"observed_at":"2026-08-11T14:51:16.134428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-11T14:51:15.445886Z","title":"H.; Chechik, G.; and Cohen-Or, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.445886Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:ab55b5b1d3d4e0067897e77a2504e9996dbe647903ea2231271e34b96c012066","observation_id":"836f7ce0-c202-4bef-b046-8502661d586c","resolution":{"observed_at":"2026-08-11T14:51:15.445886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10640","last_updated":"2024-02-25T23:23:00Z","snapshot_observed_at":"2026-08-13T05:48:12.806673Z","submitted_at":"2023-10-16T17:57:37Z","title":"LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10640","snapshot_observed_at":"2026-08-11T14:51:15.449573Z","title":"F.; Naseer, M.; Khan, S.; and Wonka, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.449573Z"},"links":{"cited_paper":"/paper/2310.10640","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:25708e154d85389ec68e49e1697ecf34170eeed051f48e7ab6e73d310e4ad7bb","observation_id":"d96854fd-8f9c-43d7-9f1b-d4ff701966ba","resolution":{"observed_at":"2026-08-11T14:51:15.449573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.118845Z","title":null,"venue":null,"work_id":"2c10b892-b967-495b-aab8-99f27cc69261","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.453280Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:76c2783bdd71895be87f1463e50cae2868b86e47961ab86df27e16101c989c33","observation_id":"6d427f27-9e70-41b6-83c8-d1f71e383d35","resolution":{"observed_at":"2026-08-11T14:51:16.122353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.108080Z","title":"H.; and Gombrich, E","venue":null,"work_id":"14d1024f-6707-42a1-997a-47f64753d64d","year":1995},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.456425Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:9c6b86010e97f8175d393723fecdde54828cbd6ace71a1c31e9771378ca8fde9","observation_id":"217d6475-a6bf-4a20-ac40-689ccd694bf6","resolution":{"observed_at":"2026-08-11T14:51:16.111630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15773","last_updated":"2024-03-25T17:41:23Z","snapshot_observed_at":"2026-08-13T05:17:07.533272Z","submitted_at":"2023-11-27T12:48:33Z","title":"Check, Locate, Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2311.15773","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15773","snapshot_observed_at":"2026-08-11T14:51:15.710293Z","title":"Check, Locate, Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation","venue":"cs.CV","work_id":"1e3e562a-fe9e-480e-9026-e32389076f2e","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.459790Z"},"links":{"cited_paper":"/paper/2311.15773","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:18a1c7a362d591a1c58d6905cbaba69a26ae6e112e95c847c2e7e86f288884bc","observation_id":"8f458957-432f-4b41-b4d2-c7d09e67e2da","resolution":{"observed_at":"2026-08-11T14:51:15.715429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.096906Z","title":null,"venue":null,"work_id":"24e48c2e-0e6b-46f8-b355-69ad492695c0","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.463382Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:f35b0991bcccc5e9a5fc808896696159a3a85ba38491fabf56157637ef693ff3","observation_id":"5d8e46ac-b2be-412a-a182-fbd292c0e6b6","resolution":{"observed_at":"2026-08-11T14:51:16.100687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.087160Z","title":null,"venue":null,"work_id":"68d98fc0-f25f-4b95-8704-f64162e2e1ea","year":2017},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.466801Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:582f3dbad0301acbf53bf1f70f104187c3330bf490d2ca51eb31edf5bd907bf3","observation_id":"936a19d8-b1be-4c2f-92c7-ca2b932149dd","resolution":{"observed_at":"2026-08-11T14:51:16.090348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.077292Z","title":"L.; Standish, C","venue":null,"work_id":"ccd0194f-d83e-4ffe-8a35-3f2ea78f1f28","year":2018},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.470277Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:dca6706a76b11ca3b92b7f5a3ee5ed64658331bc33f14420cc467d123e833f69","observation_id":"c0c1916a-6973-4825-b65c-08311308a6f4","resolution":{"observed_at":"2026-08-11T14:51:16.080483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.473618Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.473618Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:e3dbd1c0206ba487e7f97ff51b62ccd29a9d79f31a1f69e33fc43a6f7a1c3ef7","observation_id":"3dc2271e-cc5e-4a82-acc9-a9b3e6090a22","resolution":{"observed_at":"2026-08-11T14:51:15.473618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.060014Z","title":null,"venue":null,"work_id":"02d01f28-14e3-4919-9e6c-918e9747437e","year":2017},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.477054Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:e7d66d73a51c6af7b752294695142a571c6667a392ca98a3f6aa0f8026cc797e","observation_id":"e05a6004-9ae4-4a51-ad97-ebaf4b4410ff","resolution":{"observed_at":"2026-08-11T14:51:16.063640Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.048856Z","title":null,"venue":null,"work_id":"75eaf5a0-b284-4570-99ed-e31883902a86","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.480471Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:ddf7d3ac39f081fcbaf469e20f80364e6a4f03e07988365a0c4378062f43b7c2","observation_id":"baeee8bf-8a56-46ab-8172-c54a82ef96f3","resolution":{"observed_at":"2026-08-11T14:51:16.052614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.037356Z","title":null,"venue":null,"work_id":"10b844ad-8186-465f-a3c1-b1544cb2903e","year":1990},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.484047Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:3e2a02ca05b86d623b0d8fc8da947393a274eed54cb26e62b499dcaa8d702111","observation_id":"bf942c76-7e44-40eb-a82d-173cb5e01d38","resolution":{"observed_at":"2026-08-11T14:51:16.041182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.024948Z","title":null,"venue":null,"work_id":"d3228af9-d538-4bb7-b344-509abd8ca965","year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.487455Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:9b620bc2029f5731e066ca18bf61e98a017ac642f95c2aaf177dce93afcb2d97","observation_id":"83179605-8352-42b8-a5d8-96fe4c68e378","resolution":{"observed_at":"2026-08-11T14:51:16.028880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:16.010397Z","title":"C.; Lo, W.-Y.; et al","venue":null,"work_id":"951a4d2c-aec4-4869-aa8f-008e99a63273","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.490931Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:fd34ba31a13490c2b2fe158b53cfcfee956058e84a2622484267d1edd47b5aeb","observation_id":"1364bf83-059e-43bc-a338-58d3edb8eb19","resolution":{"observed_at":"2026-08-11T14:51:16.016928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-11T14:51:15.494215Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.494215Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:258ec3f822653fb5c1e647760ce071785247aae20b77d592f6cb467bc1f4f22f","observation_id":"03851f7f-1225-4769-be3c-622ad30f4e7b","resolution":{"observed_at":"2026-08-11T14:51:15.494215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.497761Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.497761Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:15c138d8ca10d91f44961a7fac43fd78934459f8838ec6c5b200ba7922402935","observation_id":"4802dfcf-a476-4f8d-9fd5-7b8e0546a748","resolution":{"observed_at":"2026-08-11T14:51:15.497761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10864","last_updated":"2024-07-14T16:20:19Z","snapshot_observed_at":"2026-08-13T10:51:51.092702Z","submitted_at":"2023-07-20T13:33:28Z","title":"Divide & Bind Your Attention for Improved Generative Semantic Nursing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10864","snapshot_observed_at":"2026-08-11T14:51:15.500721Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.500721Z"},"links":{"cited_paper":"/paper/2307.10864","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:ed8b0168303702289ca57c333a5c0a882ae540dc34762f13c51e3984585dd2cc","observation_id":"a9b04699-272e-49d7-9c45-3cede000b4db","resolution":{"observed_at":"2026-08-11T14:51:15.500721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.993050Z","title":null,"venue":null,"work_id":"75db64cf-4a70-4026-8ae8-3cd7eaee6f88","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.503790Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:397231cd67121674ff2474903a81a0d8f3bdefc1509068e6ffac8da32461693d","observation_id":"d1b38f52-99ca-4d0c-a7d5-94fdbc5ff421","resolution":{"observed_at":"2026-08-11T14:51:15.996733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.506737Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.506737Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:5d09fd102b23a05ffe9e2af9ffb9d51a9af046a01e45ee365452a199e4993dbb","observation_id":"00af3b40-bd33-43ec-9f8f-cce5878973bb","resolution":{"observed_at":"2026-08-11T14:51:15.506737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-11T14:51:15.509727Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.509727Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:547716402847ef03768e575388e431a3fdf2fb0c5fe9c04145df5985c8222250","observation_id":"3b20889e-79f7-4332-a2d6-c18ce369ece5","resolution":{"observed_at":"2026-08-11T14:51:15.509727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.975673Z","title":null,"venue":null,"work_id":"70e83e8e-8a32-4e78-a6b7-8d653cbc426d","year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.513056Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:7ba31496ba3ed63b2c036e350235985784d3e3bba8752b38b30c1e5725d20b77","observation_id":"35fe23fe-8bfc-4043-961d-5e19385ffa06","resolution":{"observed_at":"2026-08-11T14:51:15.979371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.516184Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.516184Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:75ebc4adbf2b72b7bbe37ec4cb2c971fbcc9ef57700b9e30e0c35fdc2199acad","observation_id":"46b083b9-e0da-489f-ad05-e1f016c1aeb4","resolution":{"observed_at":"2026-08-11T14:51:15.516184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11410","last_updated":"2024-05-19T01:40:39Z","snapshot_observed_at":"2026-08-13T10:50:38.428912Z","submitted_at":"2023-07-21T08:09:47Z","title":"Subject-Diffusion:Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11410","snapshot_observed_at":"2026-08-11T14:51:15.519454Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.519454Z"},"links":{"cited_paper":"/paper/2307.11410","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:d025439edce125456d6bb563a41d9871e499e3899974f6339f66e101e0730531","observation_id":"c8aa5d54-9945-4a17-bfdf-34937f4ff3e5","resolution":{"observed_at":"2026-08-11T14:51:15.519454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.13807","last_updated":"2022-05-02T19:35:26Z","snapshot_observed_at":"2026-08-13T22:30:42.512894Z","submitted_at":"2022-04-25T18:54:39Z","title":"A very preliminary analysis of DALL-E 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.13807","snapshot_observed_at":"2026-08-11T14:51:15.522995Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.522995Z"},"links":{"cited_paper":"/paper/2204.13807","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:d55f2733044e92c1d46f7685d1e09db9d63c288f2ba3a987565ef0cdca382be8","observation_id":"a9cb248e-d201-489c-b0fa-0a47c53f5caa","resolution":{"observed_at":"2026-08-11T14:51:15.522995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.956947Z","title":null,"venue":null,"work_id":"9b2ef79e-b223-4ef4-99f7-80bf29dd7108","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.526751Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:0353ce215e76a692cefe3c84564fd2c21d0cf7ed9132be7bd54f87b3cd8570c2","observation_id":"828ffa88-b5fd-4107-adba-03b8a1e2c2c9","resolution":{"observed_at":"2026-08-11T14:51:15.960594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T14:51:15.530136Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.530136Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:019d37fef6f79ee67595f5938444961168ea204fa342f2a0fc9ebfa4a50c3dc2","observation_id":"7b2aa5dd-5eb2-4961-abb6-b859f40fed6e","resolution":{"observed_at":"2026-08-11T14:51:15.530136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.946023Z","title":null,"venue":null,"work_id":"776a4ac2-83fb-4db0-9f0c-e3465f0fa305","year":1975},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.533557Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:19b13655626268c474f2b69a7bd0cceba76ffb51bbf8fe591e6be246a3825c7f","observation_id":"dee63f72-95d9-4b18-80ad-e38b08b54d68","resolution":{"observed_at":"2026-08-11T14:51:15.949779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.934988Z","title":null,"venue":null,"work_id":"4358f0dd-8b59-4d11-b03f-b2b6308c551d","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.537005Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:9b827208ad1ca9ac6c7653eb62a22ff433ba5634974d7d12b3721f43d6e676c5","observation_id":"f973ac3d-be34-485a-8d42-76d45d9b16f2","resolution":{"observed_at":"2026-08-11T14:51:15.938841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.923257Z","title":null,"venue":null,"work_id":"e8cbeb25-410d-4f63-81fe-b9eec69ee7e9","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.540495Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:c7e6cfd1e6b0a7226e43820d043b5192ce6971a2197441710c26c1512303b524","observation_id":"4584c432-e774-4c11-ae47-0ce2b2f90b9d","resolution":{"observed_at":"2026-08-11T14:51:15.927534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.911922Z","title":"C.; Xiong, C.; Savarese, S.; et al","venue":null,"work_id":"4da1655e-5f3f-43ec-83cc-14b5ce97628b","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.543912Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:7c3291b1edb06b58b6939ec4d55e54e48b6d022afb59999e869110bd8ebc7549","observation_id":"d208749b-864e-46ac-ae2a-7888dd8d757c","resolution":{"observed_at":"2026-08-11T14:51:15.915637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.547610Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.547610Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:d2224ad974006a638f8a9c91cb559927e9ab236e0a821b0ee3264b76dfc4539a","observation_id":"3cd2e581-d604-4eb8-ac5e-44df9591eda3","resolution":{"observed_at":"2026-08-11T14:51:15.547610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.551256Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.551256Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:74ff62cee32446b04114b24fa58f81b8ee8beff25eaca822c2820baef40fa797","observation_id":"ad49562b-4847-4065-85a0-516092d6190a","resolution":{"observed_at":"2026-08-11T14:51:15.551256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.886949Z","title":null,"venue":null,"work_id":"31e3c12a-4777-4b50-a5e1-8ed0574bedf8","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.555106Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:baee47a9a2539780d155ec19928af674384f7208d02bb188187ad094f362141c","observation_id":"d73691ad-713f-4692-8266-135043bd887f","resolution":{"observed_at":"2026-08-11T14:51:15.890772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.558513Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.558513Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:c997546838d202d80d6970b0ad410eff224a9b4ab44eb5e7367f84aeefe46c8f","observation_id":"3ee3948e-4c24-496b-8ebd-721efa1d2433","resolution":{"observed_at":"2026-08-11T14:51:15.558513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.868972Z","title":"L.; Ghasemipour, K.; Gontijo Lopes, R.; Karagol Ayan, B.; Salimans, T.; et al","venue":null,"work_id":"a5a5bd01-a8ca-4940-aa18-57bdbad0d30f","year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.561914Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:0fe407792282ed8e1997bcd75e4acff605d2047eb4ae2e0d85c26c800e5b1586","observation_id":"81d2677a-c2f0-4c9b-b454-e1facb036b15","resolution":{"observed_at":"2026-08-11T14:51:15.873085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.857639Z","title":null,"venue":null,"work_id":"784f1059-90ed-40eb-88a4-a113a6b30a80","year":2016},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.565367Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:24d5395746b554321a0234488029d7553df8b3707e9f4ebd8102e60d987b01d4","observation_id":"3a893d18-e972-4840-adbb-56a37e1c83ed","resolution":{"observed_at":"2026-08-11T14:51:15.861681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.846591Z","title":"S.; Girdhar, R.; and Misra, I","venue":null,"work_id":"4329eb9a-45b6-4d75-9733-66541f8679ab","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.568629Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:c5a95f246256b7d3bc279a940dbd980e4906c6504842bcc22b2f180416356e32","observation_id":"18d7bbd1-9c03-4206-929b-01cd35f6bca2","resolution":{"observed_at":"2026-08-11T14:51:15.850150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03626","last_updated":"2024-06-23T23:50:59Z","snapshot_observed_at":"2026-08-13T05:08:36.070418Z","submitted_at":"2023-12-06T17:13:15Z","title":"TokenCompose: Text-to-Image Diffusion with Token-level Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03626","snapshot_observed_at":"2026-08-11T14:51:15.571912Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.571912Z"},"links":{"cited_paper":"/paper/2312.03626","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:22deba811c68391195e2314f0383acd5f409e3e648888f516717c3a7a208e855","observation_id":"ce9dcb89-5ff2-4b11-a31e-8bf65f0de5a0","resolution":{"observed_at":"2026-08-11T14:51:15.571912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14896","last_updated":"2023-07-06T11:53:19Z","snapshot_observed_at":"2026-08-13T13:55:48.903163Z","submitted_at":"2022-10-26T17:54:20Z","title":"DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14896","snapshot_observed_at":"2026-08-11T14:51:15.575356Z","title":"J.; Montoya, E.; Munechika, D.; Yang, H.; Hoover, B.; and Chau, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.575356Z"},"links":{"cited_paper":"/paper/2210.14896","citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:b23735e775fcb4b7bbe45309ae72ff3a884074afc999e655ab608139296ced73","observation_id":"735e1a98-4700-4eb6-be95-53ac064bf1d8","resolution":{"observed_at":"2026-08-11T14:51:15.575356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.835422Z","title":null,"venue":null,"work_id":"92a2e0ce-cacb-4106-855b-ea563c130624","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.579045Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:dfcf32f2e2cd04cd78e2a1a9a90786f3114d426c787f167c22f208008d6b9a62","observation_id":"4ae22e46-f35e-485c-a3ca-740a7e743da4","resolution":{"observed_at":"2026-08-11T14:51:15.839271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.824333Z","title":null,"venue":null,"work_id":"6523211e-cc24-450a-b5ae-1005ca31b9b4","year":2024},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.582291Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:cc50a9eaf591d81de89e896a158a52dd7d74989287384cc77354ef64fd813554","observation_id":"f7cd7d8e-8f67-49fd-b415-7ba19d65f64d","resolution":{"observed_at":"2026-08-11T14:51:15.827907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.813637Z","title":null,"venue":null,"work_id":"8f8eff07-23c5-4641-8a13-5c16a7a0d588","year":2021},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.585775Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:54302f6b123eecc91f7c22366152b63799cccccd8cbc21627410312118b5cc3d","observation_id":"98e79a70-7899-41de-a084-d26d8a456090","resolution":{"observed_at":"2026-08-11T14:51:15.817356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.802632Z","title":null,"venue":null,"work_id":"dc26b34a-8ae5-40dc-a035-589438747021","year":2023},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.589307Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:f94261876687268ecaebd72b49bac78e8ba7793968e1243b290660bec9ac6fc2","observation_id":"59381152-cc03-4550-9470-364efd62e213","resolution":{"observed_at":"2026-08-11T14:51:15.806629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.592595Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.592595Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:3fd8ce8c110b24446a8b4bbed913b1beddce4494f3aafdc2732b256084b5be6e","observation_id":"63470f95-b156-4131-a34b-3843557e95a7","resolution":{"observed_at":"2026-08-11T14:51:15.592595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:51:15.596331Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T14:51:15.596331Z"},"links":{"citing_paper":"/paper/2412.11594"},"observation_digest":"sha256:2ad47deccca45cb1e758230bf9c52d824ac2f60be49d4db43fa6bec0e2e6efd7","observation_id":"4982370e-a596-425a-9e08-f15996809b40","resolution":{"observed_at":"2026-08-11T14:51:15.596331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11594","last_updated":"2024-12-28T04:59:45Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T04:35:21.495018Z","submitted_at":"2024-12-16T09:32:23Z","title":"VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2412.11594."}