{"as_of":"2026-08-15T07:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:238028d9d52141ec4bdcb3e1db535e480cf9af334ba43f0ad30a495a07ee2210","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:06:30.948017Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:36:14.172389Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06089","snapshot_observed_at":"2026-07-31T23:36:14.172389Z","title":"GraPE: A generate-plan-edit framework for compositional t2i synthe- sis.arXiv preprint arXiv:2412.06089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23920","last_updated":"2026-07-27T01:22:54Z","snapshot_observed_at":"2026-08-06T08:50:32.845922Z","submitted_at":"2026-07-27T01:22:54Z","title":"What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T23:36:14.172389Z"},"links":{"cited_paper":"/paper/2412.06089","citing_paper":"/paper/2607.23920"},"observation_digest":"sha256:555d27b576806b1b91fa7c3d82f52a0369f51ac45e08152a8245de4d32cf37d3","observation_id":"8b1564da-05a0-44d8-977f-878d149fb4eb","resolution":{"observed_at":"2026-07-31T23:36:14.172389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.06089/citation-record","integrity":"/paper/2412.06089/integrity","json":"/paper/2412.06089/citation-record.json","paper":"/paper/2412.06089"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:32.291567Z","title":"A-star: Test-time attention segregation and retention for text-to-image synthesis, 2023","venue":null,"work_id":"ded22180-3bcd-41bf-842b-9e7d691a3226","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.468633Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:31448be0fa6dc62655c06d744673e65bb4938eed13ba4a3ac23c1e1854f2fed1","observation_id":"bed3369b-650d-46a8-9234-aba256d75c34","resolution":{"observed_at":"2026-08-11T20:06:32.300215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:32.274239Z","title":"DeepFloyd IF: a novel state- of-the-art open-source text-to-image model with a high de- gree of photorealism and language understanding","venue":null,"work_id":"8d684165-2f32-4a90-867a-651ad6eee2a0","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.474513Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:1cefab53fec946a7433cb51ccb124d87be01a1b3388065fed57b1e82218fdc67","observation_id":"cda2b007-21ac-4b99-a754-572533473bc3","resolution":{"observed_at":"2026-08-11T20:06:32.280303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:32.255628Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond, 2023","venue":null,"work_id":"10492ef5-e57a-41e8-8fb6-14aefc3acb86","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.478610Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:8aab37ef23b3957061b9eff4e70c7fa551bc11543c750b2b21a496da47d39fee","observation_id":"b5bf230a-2a03-4e8c-9e0e-e773a6ce7919","resolution":{"observed_at":"2026-08-11T20:06:32.260506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:32.240559Z","title":"Hrs-bench: Holistic, reliable and scalable benchmark for text-to-image models","venue":null,"work_id":"0b9e31e8-bd06-4710-9e8f-2006eb9f5687","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.482668Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:c7cbb397f4d46eae41a506a1edae35bfd66c571e236ef577b4ae1def13c834c7","observation_id":"b339c7e2-e714-4f03-b204-3d5721fa91dc","resolution":{"observed_at":"2026-08-11T20:06:32.247234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:32.222798Z","title":"Improving image generation with better captions","venue":null,"work_id":"02bfc59e-8df0-43e2-8bdf-4c55abd1528a","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.486817Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:dbca756f63a131b170030e0faacec862e040fcd648edb76cce9795d75d5e54c5","observation_id":"90ae79cd-d2f3-4270-a9d8-c06a159c829f","resolution":{"observed_at":"2026-08-11T20:06:32.228961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:30.490886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.490886Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:e3d4bc9924c9334b4d8bfe14b022e4afac687e9dcbefa30a9c8a943e483d6708","observation_id":"5bfdf924-71a9-4ae8-98db-80bbb96de9fc","resolution":{"observed_at":"2026-08-11T20:06:30.490886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:32.185955Z","title":"Language models are few-shot learners","venue":null,"work_id":"9291a835-305f-432d-8ca4-ac76c15a824a","year":2020},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.495080Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:a7ed9e0e39835121180bdd160a56b59906ddf339a307cf5b4d85585fe92c2670","observation_id":"b638a2ad-8530-4496-a363-cdbf5012cf38","resolution":{"observed_at":"2026-08-11T20:06:32.191263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:32.167331Z","title":"Getting it right: Improving spatial consis- tency in text-to-image models, 2024","venue":null,"work_id":"9f4d1f8a-99e2-4346-a6d1-244a51bbbad0","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.499365Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:a4a1a9228a53ba65ca2bcf085f7525d5b34e2b0cab8e59c63910d9d034dc35f7","observation_id":"6086d326-f003-471e-aed3-4af2cd80ed40","resolution":{"observed_at":"2026-08-11T20:06:32.173419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:30.503186Z","title":"Attend-and-excite: Attention-based se- mantic guidance for text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.503186Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:b31cf79bc3a2d4e654e16657ff57eb540c2f6aaa06d9950cce1e493b55b4a794","observation_id":"51d8c81c-b24a-436e-9c4f-765bf6bfd519","resolution":{"observed_at":"2026-08-11T20:06:30.503186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:30.507931Z","title":"Pixart-α: Fast training of dif- fusion transformer for photorealistic text-to-image synthesis,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.507931Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:89e83da2ae192d1a478ac30137c27dba69180ce7fdd24dd2e389823508f4e98b","observation_id":"4d57976e-fbca-430c-b40b-63dd5df28fba","resolution":{"observed_at":"2026-08-11T20:06:30.507931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:32.102618Z","title":"Pixart- σ: Weak-to-strong training of diffu- sion transformer for 4k text-to-image generation, 2024","venue":null,"work_id":"fdfa4c8a-0f6e-4649-b19e-dcaa0c4a6629","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.512080Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:ef99a624a2e79b4dea3c436d2862309105d1aab2bb36e6cb03ade36905774ff4","observation_id":"a1fea6b8-d836-4cda-a49e-e11900f76038","resolution":{"observed_at":"2026-08-11T20:06:32.107972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:32.085608Z","title":"Region-aware text-to-image generation via hard binding and soft refinement, 2024","venue":null,"work_id":"aef9bc5c-6e9a-4d7d-94ad-4fb6ccd2c03a","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.516318Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:8e00b5021a3b02bc39d9db32ed3020e402d61d530bcff9be82cdfb9b1bdf8b87","observation_id":"02dfee4e-20f4-4853-b358-7155ee696c68","resolution":{"observed_at":"2026-08-11T20:06:32.091205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:32.070163Z","title":"Visual pro- gramming for text-to-image generation and evaluation","venue":null,"work_id":"cfcde71d-a786-47f9-b6a5-603deee41e87","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.520647Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:95d28123a24551547a9d6262db4616a9a0e8f6241b0e48714ed2ed800ef6efea","observation_id":"b166b6e3-0830-4c8f-aafd-92385457be22","resolution":{"observed_at":"2026-08-11T20:06:32.075200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:32.043635Z","title":"Davidsonian scene graph: Improving reliability in fine-grained evaluation for text-to-image gener- ation, 2024","venue":null,"work_id":"c6a3aea7-5b14-4994-94b4-f081d62c7233","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.525427Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:fcb81b66343638e8dc3f045fb856a1e274b68f44bf8d7676cb223d89b0b27afe","observation_id":"bf5da09b-78bc-43aa-a25c-157b42e6200c","resolution":{"observed_at":"2026-08-11T20:06:32.051720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.05233","snapshot_observed_at":"2026-08-11T20:06:30.529153Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.529153Z"},"links":{"cited_paper":"/paper/2105.05233","citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:69f40631aa55a077a397805a1cd093f6d928673b99ce8776ec58956aca7859cf","observation_id":"d0a41978-a67a-4a1f-af01-e85a61a2bcc7","resolution":{"observed_at":"2026-08-11T20:06:30.529153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:32.022164Z","title":null,"venue":null,"work_id":"58c8a2ea-6e49-4641-97dc-ae1cdf2a7f2f","year":2019},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.532986Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:0f8a511b1fb61c66c7247dd0debb1c132c5f0e81225d5c8f55b28b7107220019","observation_id":"0be05d1e-5683-4ba9-bb2e-da528f3f5469","resolution":{"observed_at":"2026-08-11T20:06:32.030718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.996504Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis, 2023","venue":null,"work_id":"4c3f97dd-5969-4eae-ba98-e3eadda609db","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.537004Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:46cc3bad983dce3d3e585fe31ef31e9fb2aff415f8915f002fdba1dedad7cf51","observation_id":"cb20479a-72b5-4db0-97df-cddcee70e91f","resolution":{"observed_at":"2026-08-11T20:06:32.005764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.979460Z","title":"Training- free structured diffusion guidance for compositional text-to- image synthesis","venue":null,"work_id":"0692350c-faaf-402e-87dd-cab1e1a2299d","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.541074Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:fded0016683dc4a0834957a4ac65ae3d1316b9c88a2a62732bcaee509d2d6a64","observation_id":"74be5588-d15b-41c5-a165-51761f7a546b","resolution":{"observed_at":"2026-08-11T20:06:31.984896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.959901Z","title":"Ranni: Taming text-to-image diffusion for accurate instruction following, 2024","venue":null,"work_id":"44289549-7606-4f86-96c7-e0f642bd85cc","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.545124Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:951444a7ec25bb2bcd12b25b5f130a7182f3fd914a657a05a9649f777404a196","observation_id":"c77b16bb-bf01-4f26-83d5-c72ecf469408","resolution":{"observed_at":"2026-08-11T20:06:31.967627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.935797Z","title":"Lumina-t2x: Trans- forming text into any modality, resolution, and duration via flow-based large diffusion transformers, 2024","venue":null,"work_id":"c6f6e68a-5225-4bf5-ab5f-7bf0bd583d0a","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.548977Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:900f0444149573f8bd08d859eab9b0dff1e20902538bcc3382aba45ca1dac2ad","observation_id":"94161442-6227-474c-95c0-6d6fadb97322","resolution":{"observed_at":"2026-08-11T20:06:31.946643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.915776Z","title":"Seed-data-edit technical report: A hybrid dataset for instruc- tional image editing, 2024","venue":null,"work_id":"3958be75-357f-4791-b8f4-c6e52fcfb5ee","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.552901Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:0b44a267b16ad1c0e2bcbacb78ef65790f5f29291a34393aa0654472401cb5ee","observation_id":"9bc66789-4e7d-4efc-a703-c1712d0cd2d2","resolution":{"observed_at":"2026-08-11T20:06:31.921767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.895273Z","title":"Benchmarking spatial relationships in text-to-image generation, 2023","venue":null,"work_id":"02465d92-be9b-4289-aa9a-109ae4fa3914","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.557254Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:e9ad264aca368d7c59928a3452772586d0fd7fd43ec73e437dc87de8b5c685cd","observation_id":"9f4b8586-bfbc-4a7f-8956-d0e82f3fa6d9","resolution":{"observed_at":"2026-08-11T20:06:31.900395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-11T20:06:30.561625Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.561625Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:9f99971b49d012c02846490e3dab1e99cb7e594144f115cd20abd213684b4ab1","observation_id":"e18515ee-4e55-4fa5-904f-7a8d3b48e650","resolution":{"observed_at":"2026-08-11T20:06:30.561625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:30.566028Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.566028Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:5be345d2fd81daefab8570aa22cdc1cefb48ffab571d1fc83a6b24e4c7de40e5","observation_id":"dded3e00-4697-4846-b141-59dbf9eb4832","resolution":{"observed_at":"2026-08-11T20:06:30.566028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.867802Z","title":"Ella: Equip diffusion models with llm for en- hanced semantic alignment, 2024","venue":null,"work_id":"bc28a0bc-d9bb-459b-8881-82fa32906746","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.570079Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:16c891b3f7023f0e80d6fcd470598e7d73b19255e85408aeb1703d747ed6c111","observation_id":"8f606f45-365b-4313-8f32-450e2e0454bc","resolution":{"observed_at":"2026-08-11T20:06:31.872525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.851095Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering, 2023","venue":null,"work_id":"a32063a6-e0ff-410f-873a-9ac3b3ba59b0","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.574670Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:f2e21b11fc7933a92961bbb42b86179bba8461335fb71021cb0901332dd894db","observation_id":"3e2bb6fd-8749-46a5-a0d6-fea4fcc57ef2","resolution":{"observed_at":"2026-08-11T20:06:31.858551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.835140Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation, 2023","venue":null,"work_id":"d8f66e69-0352-4ffa-89f9-bd24e2ee4e84","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.579110Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:99a3e908dee1ac85e2d9a02942736def813f4492bf4827fde01b2731d216d5e9","observation_id":"98f72a65-7a4e-46a1-aaea-54c54a17e0c0","resolution":{"observed_at":"2026-08-11T20:06:31.840121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.821572Z","title":"Comat: Aligning text-to-image diffusion model with image- to-text concept matching, 2024","venue":null,"work_id":"fdeb9220-586c-4540-a96f-9fd6feee2a1f","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.583055Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:00b67bdeca8a70acc914025bdb3afa08d5fa8b2f50e210a271c4260831d3712e","observation_id":"c9b3de4b-e734-4834-b6ee-28b02d02a96d","resolution":{"observed_at":"2026-08-11T20:06:31.826308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.800616Z","title":"Text encoders bottleneck compositionality in contrastive vision- language models, 2023","venue":null,"work_id":"a946d9b4-b047-4013-889a-22fe0ad4d06e","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.588324Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:8486e464aa5bfc0290a1ef8e79f25b6dada178b2ea6a5d5d38a23cf46a9ac109","observation_id":"3af56afe-6a0a-4abb-affb-fa86450f6d9f","resolution":{"observed_at":"2026-08-11T20:06:31.805599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.779921Z","title":"Learning action and reasoning-centric image editing from videos and simulations, 2024","venue":null,"work_id":"0ce934af-5415-4992-9736-e0148362bb36","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.592811Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:2d574d26ab94fe089f04bbed37f11d53d8b8b4d5f5ae18cee823419fc150aeb4","observation_id":"cda29111-aeb8-4beb-9f30-f6b84ccfac76","resolution":{"observed_at":"2026-08-11T20:06:31.785230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.763778Z","title":null,"venue":null,"work_id":"3c9dd8dd-e73e-4a49-8a7b-55e9d9ae31fd","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.596547Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:d07029f3e20874672a6970b69bb10b08bbb58256e8f5e47b5b77e55e3aa99616","observation_id":"cdcbd46e-ab37-4f70-b60f-99903e531ada","resolution":{"observed_at":"2026-08-11T20:06:31.770392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.743712Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image genera- tion, 2024","venue":null,"work_id":"01ec4ac1-70e4-493c-8a23-e5c91a382eda","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.601590Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:2ef938956215fd63a0dd3b9bc3db1d95407cac573d39060f7ecfe8219375e7bc","observation_id":"49ed22d1-d73c-47f8-b29f-1bf897de3a44","resolution":{"observed_at":"2026-08-11T20:06:31.752002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.728234Z","title":"Llm- grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models,","venue":null,"work_id":"6c768c61-0635-4702-847c-6c93e8fd580a","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.605802Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:e41b2adc2a6c25271427fbb3050f7c1fc1fdaf936b09b11f3143b671781d9605","observation_id":"f20a9e5d-e240-4f25-91c2-e38994916b3e","resolution":{"observed_at":"2026-08-11T20:06:31.732899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.707505Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models,","venue":null,"work_id":"605d3526-a481-4c58-a4fc-097cf4f0c33c","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.611991Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:67de5f46193aaf9c99b2298dfbdd648ab23ade07e9961f6e101dfb839dca7c39","observation_id":"21670d09-c97f-4be5-99da-d205ac76e14c","resolution":{"observed_at":"2026-08-11T20:06:31.716202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:30.616321Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.616321Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:77c93efb3483b5f75a46cc00ca78ec3da216c550eadb73b61cf85913865eefca","observation_id":"99421c2f-a9dd-401a-96b6-525f25f84133","resolution":{"observed_at":"2026-08-11T20:06:30.616321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.676504Z","title":"LLMScore: Unveiling the power of large language models in text-to-image synthesis evaluation","venue":null,"work_id":"f99c3ccb-7743-450d-ace1-0a46aba415f3","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.620551Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:a33b53e6ed2584072fa6257f16db2f6ec5cb7398e74f2840990e91d474c2ab0c","observation_id":"e39eaedf-1627-4daf-8ca9-3af8a57bc7c0","resolution":{"observed_at":"2026-08-11T20:06:31.681682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09672","last_updated":"2021-02-18T23:44:17Z","snapshot_observed_at":"2026-08-06T00:36:41.660457Z","submitted_at":"2021-02-18T23:44:17Z","title":"Improved Denoising Diffusion Probabilistic Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09672","snapshot_observed_at":"2026-08-11T20:06:30.625314Z","title":"Improved denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.625314Z"},"links":{"cited_paper":"/paper/2102.09672","citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:b1ccf9380e0aba4d810413404d288e99ca0e5d5149e78f6eab7c5c3b129cb995","observation_id":"66938b13-bc4d-41eb-ab2d-84792ada1d62","resolution":{"observed_at":"2026-08-11T20:06:30.625314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.657754Z","title":"Compositional text-to-image gen- eration with dense blob representations","venue":null,"work_id":"7246aec9-83ad-4e6d-9945-0af2fa7e6072","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.629643Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:ce58509f6f9aec47b55f1f61853d7c9ba4d53c5a2140f241b6a1ba53b43065fd","observation_id":"12cbd62a-810f-44f6-b663-979f9c563dd5","resolution":{"observed_at":"2026-08-11T20:06:31.665627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.642081Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":"da2503a5-a3f0-4a75-b39f-8a5cd040031d","year":2016},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.634763Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:6d0752f6c0beabcdfe8dc7141fd29366cb04e1b244bad68aa594cfe5c1aa50dc","observation_id":"5d1d8955-eba2-4ed4-94c6-8ced69af0631","resolution":{"observed_at":"2026-08-11T20:06:31.647693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.627338Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":"a804e681-9996-4cdf-b9de-fbc5fc44586a","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.638914Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:8cee1d2d9ae86e53cbd5e9b8af68ef3d837bb74155fdbacaff76a80b13ffb302","observation_id":"9755f409-36c3-4099-a91c-507ffdfaeb5c","resolution":{"observed_at":"2026-08-11T20:06:31.632633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.612987Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":"016b70d5-18a4-4730-add7-e20430f729c0","year":2021},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.642834Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:f9ffd412e306aeadd1e3627046f4fae8e2f57cbc25c451f74f4fad5b4156792d","observation_id":"1644ac52-90ff-4843-8c0d-c545cc70919a","resolution":{"observed_at":"2026-08-11T20:06:31.617470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.597242Z","title":null,"venue":null,"work_id":"03fa0ae1-20b5-4ba6-b426-2819397c0a99","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.647011Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:f5722522b09a5d5a34c1806bc52bfc3b2a8bf67c0ab6a3de640b0b6403aa9452","observation_id":"14670d5c-3894-4a0f-8b4c-e11f6b7ecf87","resolution":{"observed_at":"2026-08-11T20:06:31.602380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:30.650842Z","title":"Hierarchical text-conditional image gener- ation with clip latents, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.650842Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:4e5b726d987da5e6ec259c3ac18b3ec62df4f4b2104118e2807e46596afcd9d7","observation_id":"e14f0581-2da5-4d64-a571-7c97840f6f00","resolution":{"observed_at":"2026-08-11T20:06:30.650842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.569058Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"dc43c0ef-13d6-435c-b8df-892dafb52454","year":2022},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.654476Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:2e2d2ea0e546562182b266ad36af1c605705362e52bd3337e3fecd99b9bb32ce","observation_id":"35c68b8a-11a2-4ed9-b342-00e1509b0003","resolution":{"observed_at":"2026-08-11T20:06:31.574643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-08-12T12:48:35.419134Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-11T20:06:30.658247Z","title":"Denton, Seyed Kamyar Seyed Ghasemipour, Burcu Karagol Ayan, Seyedeh Sara Mah- davi, Raphael Gontijo Lopes, Tim Salimans, Jonathan Ho, David J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.658247Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:7919d02f4d55eda36a01254b822a67e8cbb91e9cf7d9b5aed24be0fa9951cfd6","observation_id":"27132a6a-43e1-49c0-ae3d-d47e8641a6fe","resolution":{"observed_at":"2026-08-11T20:06:30.658247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.555396Z","title":"Image ma- nipulation via multi-hop instructions - a new dataset and weakly-supervised neuro-symbolic approach","venue":null,"work_id":"d487bc2a-c1e5-4552-b83b-40b10249a93a","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.662418Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:adbed64525f0eec91d277d311296faf67ff9a9fa7d8f69c0b48a7fa8470c276b","observation_id":"257296de-fc2f-43f3-b8f4-e026024ef113","resolution":{"observed_at":"2026-08-11T20:06:31.559849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:30.666169Z","title":"Weiss, Niru Mah- eswaranathan, and Surya Ganguli","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.666169Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:58a31bf2367d24bd6c67937dd5874689ce5a68c6cae5636861d5dafba11b9c64","observation_id":"1b4b7c84-ad86-4540-8d0f-859bed7223a7","resolution":{"observed_at":"2026-08-11T20:06:30.666169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.532892Z","title":"Stable diffusion 3.5","venue":null,"work_id":"680b3352-eca0-4ff6-be53-c71a9c27226b","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.670841Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:35600c0d5f2cfae1b444dff40a2c6f0296716802ab982ed9b5bf40bf04b6627c","observation_id":"40b282ce-f535-493e-9bdb-ddc69fb0d79f","resolution":{"observed_at":"2026-08-11T20:06:31.537546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.513755Z","title":null,"venue":null,"work_id":"2d64bc93-4d97-4d1e-bfbf-919cc91d955a","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.674766Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:e600775468bc168bb676129253135998fd8fb591859d9741ccd02c394e330ef8","observation_id":"c9a82887-f876-49c8-9e8b-fb47ee37e061","resolution":{"observed_at":"2026-08-11T20:06:31.518877Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.487864Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":"d49316b4-ff01-4519-91fc-5f92490e4c1e","year":2022},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.679095Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:4f994810d2706040748d2e4856bb874240484daddcf5696061466f164c105006","observation_id":"fcaa1468-af26-43c5-acdb-c88f8fd7becc","resolution":{"observed_at":"2026-08-11T20:06:31.501698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:30.682908Z","title":"Llama 2: Open foundation and fine- tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.682908Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:ffca2ed178e6162f792cde6b8b2f103a35b2a10605cbbb929a74dc01829a876c","observation_id":"348e1eb1-bfc3-471b-91d4-c89d745ff740","resolution":{"observed_at":"2026-08-11T20:06:30.682908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05600","last_updated":"2024-10-28T14:08:13Z","snapshot_observed_at":"2026-08-14T15:56:43.018840Z","submitted_at":"2024-07-08T04:30:53Z","title":"GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05600","snapshot_observed_at":"2026-08-11T20:06:30.687083Z","title":"Genartist: Multimodal llm as an agent for unified image gen- eration and editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.687083Z"},"links":{"cited_paper":"/paper/2407.05600","citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:0af38b5c9cc9bab71b3d2ad2e5723294bf0852da610e53570c01861556ed800b","observation_id":"6f305d66-94d9-4a5e-ae82-369b7cdc71ce","resolution":{"observed_at":"2026-08-11T20:06:30.687083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.464441Z","title":"Tokencompose: Text-to-image diffusion with token-level supervision, 2024","venue":null,"work_id":"eb4a481a-6168-4264-a242-cd627c6845b1","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.691865Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:fde9570df2655eec4f7d11cf92e7588c8ef0cff0138da3737fffdf6ab04eaffe","observation_id":"5720fe84-870b-4b23-97e9-417e29eb24ba","resolution":{"observed_at":"2026-08-11T20:06:31.469464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.451437Z","title":"Omniedit: Building image editing generalist models through specialist supervision, 2024","venue":null,"work_id":"e5c67556-9132-4dc5-84ac-5d3e327b5121","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.695978Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:b9f048af6d3f4eed827ebfd3670cccaedf3862c0d53a39c6b9c7a1321915eab9","observation_id":"f9e0b8e0-e33c-4f8e-adfb-4eee1ad3d8bd","resolution":{"observed_at":"2026-08-11T20:06:31.455906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:30.700401Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.700401Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:1cc7c29e99425754fac5ce911c6e1f1280001c4cb769a69f9c0d07c100dafb99","observation_id":"edadb203-31e2-4a9d-a523-d7a5af957c6f","resolution":{"observed_at":"2026-08-11T20:06:30.700401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.420537Z","title":"Revisiting text-to-image evaluation with gecko: On metrics, prompts, and human ratings, 2024","venue":null,"work_id":"c9498ad1-e22a-4dd6-91f7-fd0ae48dbdb0","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.706729Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:d90d702e9ccb92f945d2f9ee987ad2525841229b80d3abb9dcc9c76b12d31abe","observation_id":"2d668723-8511-4b85-b5e0-72b230b8b9ee","resolution":{"observed_at":"2026-08-11T20:06:31.425586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16090","last_updated":"2023-11-27T18:56:37Z","snapshot_observed_at":"2026-08-13T05:16:06.200307Z","submitted_at":"2023-11-27T18:56:37Z","title":"Self-correcting LLM-controlled Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16090","snapshot_observed_at":"2026-08-11T20:06:30.711227Z","title":"Self-correcting llm-controlled diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.711227Z"},"links":{"cited_paper":"/paper/2311.16090","citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:d884feeab8178589a845b0ec7a4e9b1f89e38791b17c1d7e34873900df1e1c5f","observation_id":"98d6a5a6-3c38-4338-96d4-f9bd776d20fb","resolution":{"observed_at":"2026-08-11T20:06:30.711227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.406036Z","title":"Paragraph-to-image generation with information-enriched diffusion model, 2023","venue":null,"work_id":"5666a9a7-eac6-406a-add3-2297f7b969cb","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.716887Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:2bbb7132245e74f5e939d016c5d3122ddb983bcbc2bc14e98e589fa128a2ca1c","observation_id":"ba1aad6d-46f2-469e-a992-ce9ad1fad528","resolution":{"observed_at":"2026-08-11T20:06:31.410456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.391257Z","title":"Conceptmix: A compositional image generation benchmark with controllable difficulty, 2024","venue":null,"work_id":"11debdf8-6d70-45a8-b683-309be07ab1a0","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.722497Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:90e952f42588cfc2112301fd20bd82968be3a8741eb2b432767c206b6bd47933","observation_id":"294115a5-0286-43a0-a44a-1c049e630ea1","resolution":{"observed_at":"2026-08-11T20:06:31.396133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.374819Z","title":"Sana: Efficient high-resolution im- age synthesis with linear diffusion transformer, 2024","venue":null,"work_id":"222a1815-6fc7-425f-90f6-38ce65b41126","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.726774Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:c8e2f5a0079b407c8cf765555a9ec7701f1b1dd9a9923469fca7e55bc2a6ed29","observation_id":"bd55eee2-c0c4-414e-adab-39192feae6f6","resolution":{"observed_at":"2026-08-11T20:06:31.381895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.357002Z","title":"Mastering text-to-image diffu- sion: Recaptioning, planning, and generating with multi- modal llms","venue":null,"work_id":"439f7c61-f828-424d-bbc3-4b5bb24fc477","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.731541Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:88b35e1600c5c4b2fe0d8658efa77d9cec59b1263e9b513f9e4c2fb1b8d6f3c9","observation_id":"dd65f77d-2bd4-4ab0-922e-d50f5bc8ba7a","resolution":{"observed_at":"2026-08-11T20:06:31.362287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.343709Z","title":"What you see is what you read? improving text- image alignment evaluation, 2023","venue":null,"work_id":"944f95d0-3188-417c-a1df-cf9ccfb9e1c6","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.735747Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:ef6813fb26d9b67b18bbeb59b2d1feb116ba5a697a579edf03afbe22b20bcc45","observation_id":"aa07a71b-bfec-4774-83fe-9e5d1b87c90a","resolution":{"observed_at":"2026-08-11T20:06:31.348073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.327853Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it?, 2023","venue":null,"work_id":"204d7816-d47d-4d13-a35e-9f659f5a5de0","year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.741002Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:107e9141c37c92a144a7995669286fec42e91f2bf2090d12dc4045cfc1b4aa5c","observation_id":"b094fcda-f175-479b-9d18-88ffdfda1fe8","resolution":{"observed_at":"2026-08-11T20:06:31.332473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.313373Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing, 2024","venue":null,"work_id":"87b18be9-a46c-46e5-a888-3ebefa3c07c5","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.745353Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:eeff0aa7c0fb358dd0a5c38bbe0bffe57d60dda9af252d82c037ab145947619c","observation_id":"cad9604b-9dbe-4bcc-9a57-87f815593b72","resolution":{"observed_at":"2026-08-11T20:06:31.317935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09618","last_updated":"2024-03-26T22:59:52Z","snapshot_observed_at":"2026-08-13T12:23:05.919425Z","submitted_at":"2023-03-16T19:47:41Z","title":"HIVE: Harnessing Human Feedback for Instructional Visual Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09618","snapshot_observed_at":"2026-08-11T20:06:30.750233Z","title":"Hive: Har- nessing human feedback for instructional visual editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.750233Z"},"links":{"cited_paper":"/paper/2303.09618","citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:defa03ad33b26ecf2e0c5f855e88cefc6b719f1aea8212d0f05ffe1952a15999","observation_id":"e92afcc7-c31a-4635-be7d-e864c85bddde","resolution":{"observed_at":"2026-08-11T20:06:30.750233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.300343Z","title":"Text as neural operator: Image manipulation by text instruction","venue":null,"work_id":"4b38056d-b87e-4336-9905-c1fc3bb2e779","year":1902},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.876344Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:6398a8471878a07287f1b52611866dc862a40d614132f86b4b4f706b18d7e3d6","observation_id":"d78ac876-020a-47ac-83c3-544d832bdc9a","resolution":{"observed_at":"2026-08-11T20:06:31.305073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.285579Z","title":"Tie: Revolutionizing text-based image edit- ing for complex-prompt following and high-fidelity editing,","venue":null,"work_id":"79daacb5-7c55-4267-80db-8c5bbcfe443a","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.881730Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:2789a03e79f8f82f21339374e9d8346d1d341f7590df2765e5d5444e555c436d","observation_id":"dee9b134-643b-4a62-8803-5b3cd5ff9f1f","resolution":{"observed_at":"2026-08-11T20:06:31.290596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.273366Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit, 2024","venue":null,"work_id":"8606ce84-6534-4a1e-ab56-583889041118","year":2024},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.886846Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:4be6d22479e53f2c13fbe92f9e53d5baa332da0f230ebad13b59b837848e984f","observation_id":"7dbac9ee-fedb-40f1-bca2-7a576a932679","resolution":{"observed_at":"2026-08-11T20:06:31.277490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.260486Z","title":null,"venue":null,"work_id":"38d1ffd2-8bd6-4c39-afc5-eb3be82a15ce","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.892248Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:956ee6ca4c9466b796725ad15d20170ccdd99804df1f209bb5e5268a749e2e4e","observation_id":"95ad7bdf-d2b1-47fa-90b5-29f9f47ac959","resolution":{"observed_at":"2026-08-11T20:06:31.264591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.247271Z","title":"8 for the GraPE naive pipeline used in sec- tion 4.3","venue":null,"work_id":"91c46a46-af71-446f-b907-cd300dc30413","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.897536Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:698296c7e61a98f88d6711c43de0179bf1edde0a8607a4c4437f6f35808a0ca8","observation_id":"a9b6d4d4-eaaa-49b5-867e-bb23db5bfc61","resolution":{"observed_at":"2026-08-11T20:06:31.251327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.231641Z","title":"Unlike GraPE, SLD operates in image layout- space which is either generated using either LLMs or open- vocabulary object detectors","venue":null,"work_id":"2fe4ed48-4dce-4422-b5fa-1798593945d1","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.902550Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:d04d0864b5a4d61d0d6f644eb38ff815fea05156f0651ba896489cd2afd0f070","observation_id":"ea2346f2-a9be-48f5-b7db-8c1b765ff574","resolution":{"observed_at":"2026-08-11T20:06:31.236554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.216637Z","title":"golden apple, next to bronze, next to silver grapes","venue":null,"work_id":"d00c7964-0b38-4436-a5dd-5ad3bab44c2b","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.908055Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:68419403d4ac118cd3010ae7169721f5b31a81155b30ed900a0a97f6bb6c3238","observation_id":"944d8ac0-127a-4bd2-af3a-ee5bbb7b089f","resolution":{"observed_at":"2026-08-11T20:06:31.221772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.202735Z","title":null,"venue":null,"work_id":"4009b833-64c8-4590-976a-cb4a7547851a","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.914424Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:e78c26bc449d0495abaa07029bd81c4f8e2ba9e029327c1b338e3bf2f23f16f1","observation_id":"a922c883-212a-4f36-a984-bc4a1d470120","resolution":{"observed_at":"2026-08-11T20:06:31.207157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.186876Z","title":"A woman wearing a white shirt and gray shorts using a shovel to dig in snow","venue":null,"work_id":"ec325420-b238-4817-830e-347f8e1d8bf9","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.919448Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:5b8d16ef18a88f46321e0bb80c224e1c4e69dbdcaf3abf1ebef454d9a717087d","observation_id":"ae337b3c-36dc-45e6-b775-85a6ea27dc30","resolution":{"observed_at":"2026-08-11T20:06:31.192504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.173217Z","title":"Therefore we can use the following editing instructions to correct these","venue":null,"work_id":"4d5926b0-c2b8-40ed-872b-fd41780aa505","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.925081Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:8cf26a0e9f4dfcf118003ef3af0bf68aa79eb815f6279261214a056b8c85c5bd","observation_id":"cd0453f4-28b3-4e77-97dc-765c4cbcd0e6","resolution":{"observed_at":"2026-08-11T20:06:31.177474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.161069Z","title":null,"venue":null,"work_id":"2d27b72f-b1be-492f-b03f-960b10ba067d","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.934351Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:0748702258830b0659ea682b05c91ba56fe7036ace902b5d9c4d2cfac122f4fc","observation_id":"f258f834-36e0-486d-aa30-ccf856f85b5e","resolution":{"observed_at":"2026-08-11T20:06:31.165249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.146890Z","title":null,"venue":null,"work_id":"dc7e0422-72a6-44d6-8476-e5652f2e8553","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.938313Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:5c49494c2c6a8846953262459b2ae74841e6b3a9004082ed53a380e8319222fb","observation_id":"cf2e1a26-f3e8-468e-af0f-f92dbb66fa4c","resolution":{"observed_at":"2026-08-11T20:06:31.151215Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.125130Z","title":"Figure 8","venue":null,"work_id":"fcb7d9e7-ed24-42e1-9b37-47c38b7bd6a6","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.942764Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:d569ca0ab73d4bf88668c7d4e259af1a2476fda8c1fdc30d1679b31bacc60c98","observation_id":"a4046dbc-9326-47cd-af71-cfd4a9ec8989","resolution":{"observed_at":"2026-08-11T20:06:31.129872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:06:31.109198Z","title":"We look at the breakup of these 100 plans and how the planner and editing-model fare on them","venue":null,"work_id":"f109e29c-9975-4f97-b6bf-d0197ee24188","year":null},"citing_paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T20:06:30.948017Z"},"links":{"citing_paper":"/paper/2412.06089"},"observation_digest":"sha256:7187a01e13f22c1efbb02bd5f53a91f114db769bc900c98f0e0d88ae6f9bee24","observation_id":"88daf809-5308-4771-9c85-3dbcb14201e2","resolution":{"observed_at":"2026-08-11T20:06:31.115370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.06089","last_updated":"2025-03-11T15:34:16Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T15:56:58.110043Z","submitted_at":"2024-12-08T22:29:56Z","title":"GraPE: A Generate-Plan-Edit Framework for Compositional T2I Synthesis"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":23,"verified_exact":0,"verified_fuzzy":55},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 1 inbound Pith citation observation for arXiv:2412.06089."}