{"as_of":"2026-08-17T13:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:697404e14ef321fcc267b7732c527ec0a98613a2aa1042c8a944d96ecf18e432","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:48:57.591417Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23418/citation-record","integrity":"/paper/2506.23418/integrity","json":"/paper/2506.23418/citation-record.json","paper":"/paper/2506.23418"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:50.808315Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:50.808315Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:b4ef243ba43566a8036f56868c9fd1423d8be0aed3138e206b158cb8333b0539","observation_id":"1b45c9dc-5db5-4982-9ef1-e50edfe83359","resolution":{"observed_at":"2026-08-06T21:48:50.808315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:50.867916Z","title":"A-star: Test-time attention segregation and retention for text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:50.867916Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:73db298f735ca4b6f48c2e07cfafb4fca6d30fb76e418c261145fe81d9bcbf62","observation_id":"3f71b3e6-8ec6-463b-bbec-afd2add3b53b","resolution":{"observed_at":"2026-08-06T21:48:50.867916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03511","last_updated":"2024-06-28T11:23:11Z","snapshot_observed_at":"2026-08-16T14:37:09.655792Z","submitted_at":"2023-12-06T14:13:38Z","title":"Kandinsky 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03511","snapshot_observed_at":"2026-08-06T21:48:50.976891Z","title":"Kandinsky 3.0 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:50.976891Z"},"links":{"cited_paper":"/paper/2312.03511","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:9d3e4c161ce679494961b2a60674768d084369dfc5c8c86726aa67dad6396913","observation_id":"07799072-ad50-41b4-b658-3d6ceaf1db9d","resolution":{"observed_at":"2026-08-06T21:48:50.976891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:51.033654Z","title":"Finite-time analysis of the multiarmed bandit problem","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.033654Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:2d6a846a82222feedb7c1ae17039930aa720c4afa65bf441f4e876db30ac3c51","observation_id":"f2a69bfd-0dca-4dd9-8e21-23820b2719b6","resolution":{"observed_at":"2026-08-06T21:48:51.033654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:51.080754Z","title":"Spatext: Spatio-textual representation for controllable image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.080754Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e0a199c7c57846d84d91bc1bc104b4ff8ef9f415c3065c4625c137b0c17a1b95","observation_id":"6a8c774a-95af-48c2-849f-65c0d9e7309f","resolution":{"observed_at":"2026-08-06T21:48:51.080754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:51.127391Z","title":"Cc3d: Layout-conditioned generation of compositional 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.127391Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:430e04a8edf62def7cb88003bce40625a02e58f552ea0889485960186eb3a71f","observation_id":"4b624120-e17e-4a45-9d74-32299bfb1238","resolution":{"observed_at":"2026-08-06T21:48:51.127391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:51.167595Z","title":"Hrs-bench: Holistic, reliable and scalable benchmark for text-to-image models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.167595Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:619df32af22d0a8a4a4c7f026885b978668e21c6143d3215df0d00131d107338","observation_id":"2e40a2e8-8777-44e5-873e-7d0bd3629d80","resolution":{"observed_at":"2026-08-06T21:48:51.167595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08113","last_updated":"2023-02-16T06:28:29Z","snapshot_observed_at":"2026-08-16T15:54:58.628898Z","submitted_at":"2023-02-16T06:28:29Z","title":"MultiDiffusion: Fusing Diffusion Paths for Controlled Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08113","snapshot_observed_at":"2026-08-06T21:48:51.252650Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.252650Z"},"links":{"cited_paper":"/paper/2302.08113","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:91c4fde98f69bcc3ae7818c6f2169e9f3801f65bc9391bdaadd74d6eb1b347de","observation_id":"c3b64dc5-5646-4eef-900f-5df72f601870","resolution":{"observed_at":"2026-08-06T21:48:51.252650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:51.298620Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.298620Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ad78bcb66b00a6f268f4b8f0b9dd7e8ee54c672fedd2b3dfdcc1d3128218c980","observation_id":"41a8f068-b396-4a9b-b4e4-133192444c86","resolution":{"observed_at":"2026-08-06T21:48:51.298620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10210","last_updated":"2024-06-14T17:46:08Z","snapshot_observed_at":"2026-08-16T13:42:52.013374Z","submitted_at":"2024-06-14T17:46:08Z","title":"Make It Count: Text-to-Image Generation with an Accurate Number of Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10210","snapshot_observed_at":"2026-08-06T21:48:51.348576Z","title":"Make it count: Text-to-image generation with an accurate number of objects","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.348576Z"},"links":{"cited_paper":"/paper/2406.10210","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ffaa82424871e1a4ca2dc5a855c541983e917c1921044ac75c97512b951667f9","observation_id":"4fd1b3e2-497d-4ced-ae61-9af9773af035","resolution":{"observed_at":"2026-08-06T21:48:51.348576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:03.795290Z","title":"Conceptual 12M : Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"23f38074-73aa-47ce-a422-fc82bb47a203","year":2021},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.432547Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:a2a460706855cffa459f644ccf869e1182b66f359a4455cc0dd7f7d24976eeb3","observation_id":"26a059a3-eb12-4ace-b2ed-612a9e13c0e9","resolution":{"observed_at":"2026-08-06T21:49:03.878208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01197","last_updated":"2024-08-06T17:58:00Z","snapshot_observed_at":"2026-08-16T14:04:36.617233Z","submitted_at":"2024-04-01T15:55:25Z","title":"Getting it Right: Improving Spatial Consistency in Text-to-Image Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01197","snapshot_observed_at":"2026-08-06T21:48:51.518955Z","title":"Getting it right: Improving spatial consistency in text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.518955Z"},"links":{"cited_paper":"/paper/2404.01197","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:007f3176f720a59f23e0a8233c8a54eb4bb824f2bda114cd3e89e0cfd5bff11e","observation_id":"b3a0d950-88b9-4ea0-9329-aa5f0ab4ffb8","resolution":{"observed_at":"2026-08-06T21:48:51.518955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:03.652271Z","title":"Attend-and-excite: Attention-based semantic guidance for text-to-image diffusion models","venue":null,"work_id":"5ec7aa62-c7ab-41e3-94cc-e6e17b57746d","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.601008Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e0b88bd0c12442f49df13ac991d389cd251a0cf02a22e85dd7ed1783376e13a5","observation_id":"4bfb679c-f849-4704-bf91-e714a875ec45","resolution":{"observed_at":"2026-08-06T21:49:03.719627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-16T14:25:28.357525Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-06T21:48:51.657856Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.657856Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:33a8c41efc1fe7fc8a74299862b48c97dd1289e3a6a85beb4dd610b1eed2420b","observation_id":"e1d998d1-f294-4f63-905f-d4b06ff9f1f6","resolution":{"observed_at":"2026-08-06T21:48:51.657856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T21:48:51.736340Z","title":"Pixart- : Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.736340Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:f71d4e1dafd0c1059f26794b3ad67f37633065aaef1fd597aa097ef585f9179b","observation_id":"aaae8dd0-4517-47b7-bf31-a63a6426e88d","resolution":{"observed_at":"2026-08-06T21:48:51.736340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:03.494650Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":"f48af46f-07d9-48df-b88c-b8b0d773be52","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.783311Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:1401629e3d80b6f2fd9b16d01d65304b4f802d9d04f9fc746c62289de6f2f025","observation_id":"307c10fb-40cd-45ef-8cf9-05c055f67e7e","resolution":{"observed_at":"2026-08-06T21:49:03.564234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08908","last_updated":"2023-02-16T14:20:25Z","snapshot_observed_at":"2026-08-16T15:54:52.844450Z","submitted_at":"2023-02-16T14:20:25Z","title":"LayoutDiffuse: Adapting Foundational Diffusion Models for Layout-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08908","snapshot_observed_at":"2026-08-06T21:48:51.832817Z","title":"Layoutdiffuse: Adapting foundational diffusion models for layout-to-image generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.832817Z"},"links":{"cited_paper":"/paper/2302.08908","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:df91101a1d8d79edce5b8b757b5aa0d409129aa609908bc02055ae40ce5e87aa","observation_id":"f60b0b08-79b3-4092-81a7-67085a3a6130","resolution":{"observed_at":"2026-08-06T21:48:51.832817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:03.296883Z","title":"Dall·e mini, 7 2021","venue":null,"work_id":"197a20bc-20bd-4e74-8960-da98f957d24a","year":2021},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.883431Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:6aa2ab5329936f28d00d69b39a8a3e1f8774ca1b1a07a5fea18a6dda01c70cf8","observation_id":"4a510a3f-4052-400d-b187-98e87f161fd8","resolution":{"observed_at":"2026-08-06T21:49:03.406246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14217","last_updated":"2022-05-27T14:40:07Z","snapshot_observed_at":"2026-08-16T17:03:55.333855Z","submitted_at":"2022-04-28T15:51:11Z","title":"CogView2: Faster and Better Text-to-Image Generation via Hierarchical Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14217","snapshot_observed_at":"2026-08-06T21:48:51.971405Z","title":"Cogview2: Faster and better text-to-image generation via hierarchical transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.971405Z"},"links":{"cited_paper":"/paper/2204.14217","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:abce8bc5e21a8a6767ebac6655153c940c23f07e1d7f32e671dfea42cd5549d5","observation_id":"9765d374-7cba-47c7-84b2-6d72e643d53c","resolution":{"observed_at":"2026-08-06T21:48:51.971405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:03.104131Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis","venue":null,"work_id":"9e5cde13-94e8-4816-9577-1c02b351a6a4","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.059608Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:afc18c4f01c76682b35146996a60199943a29c64c7483771a137559d65b7f649","observation_id":"c7458bd6-c8d0-4088-bc99-df1b62ad21c2","resolution":{"observed_at":"2026-08-06T21:49:03.187547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-16T17:12:03.386482Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-08-06T21:48:52.182184Z","title":"Make-a-scene: Scene-based text-to-image generation with human priors, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.182184Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:7a4eca6536b9c9535fa16c9e747d99fb433881306141ed557bb81f49c8f04fbf","observation_id":"6e88afe7-aa0c-466e-b77f-134e9213febc","resolution":{"observed_at":"2026-08-06T21:48:52.182184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-08-16T14:51:16.293174Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-08-06T21:48:52.298002Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.298002Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:89059ed50efcc84f1648fa74dc9a80819abc6dc0c86db36f244f8571f7ce9cc3","observation_id":"f2b3f176-fa36-40c8-99f9-e08ba899c89e","resolution":{"observed_at":"2026-08-06T21:48:52.298002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-08-16T16:07:26.772862Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-06T21:48:52.391265Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.391265Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:09c16c982b1051c6d4bfa5d31ef73da0a5af02703020a7502c0747ef27ba7cc1","observation_id":"54e5f73d-cf88-4460-bc27-fa90af3275fe","resolution":{"observed_at":"2026-08-06T21:48:52.391265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14743","last_updated":"2024-10-15T19:37:51Z","snapshot_observed_at":"2026-08-16T13:58:39.931992Z","submitted_at":"2024-04-23T04:51:02Z","title":"Gradient Guidance for Diffusion Models: An Optimization Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14743","snapshot_observed_at":"2026-08-06T21:48:52.464757Z","title":"Gradient guidance for diffusion models: An optimization perspective, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.464757Z"},"links":{"cited_paper":"/paper/2404.14743","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:3ed9f5a0b314919b183d1e240f72a7d6c3d56cc1956d669f0c7724aca2cb2721","observation_id":"a97cb007-cd59-49c9-8682-85279d24b011","resolution":{"observed_at":"2026-08-06T21:48:52.464757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T21:48:52.605567Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.605567Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:4b3652519c101198ecdde724e7394daef919d78380c9fb6ee629e79945f898ab","observation_id":"56e3b960-01db-4269-88bc-a7be5e2209ab","resolution":{"observed_at":"2026-08-06T21:48:52.605567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08500","last_updated":"2018-01-12T14:05:44Z","snapshot_observed_at":"2026-08-14T20:51:33.836666Z","submitted_at":"2017-06-26T17:45:23Z","title":"GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08500","snapshot_observed_at":"2026-08-06T21:48:52.737177Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.737177Z"},"links":{"cited_paper":"/paper/1706.08500","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:af925b50c9cee718e3d1d57acad5be8baeaba11d11962f270033bf39c441858e","observation_id":"a5d12599-6650-44dc-a625-5dbe2c18cc58","resolution":{"observed_at":"2026-08-06T21:48:52.737177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:52.842219Z","title":"Probability inequalities for sums of bounded random variables","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.842219Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:874293dcd73dec57a1a503e574849c75029032af5d68f3195444d54124691724","observation_id":"a7b727f7-47fc-4c9b-83c7-40f10f905237","resolution":{"observed_at":"2026-08-06T21:48:52.842219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:52.928167Z","title":"Probability inequalities for sums of bounded random variables","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.928167Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:3e8b4dded6cec16c31916062d0b943bbcc0c0d13f0a066adfbf74e24b4b44f5d","observation_id":"b6111a05-8052-4a32-8d30-9ecd28e2c8e2","resolution":{"observed_at":"2026-08-06T21:48:52.928167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:02.909670Z","title":"Token merging for training-free semantic binding in text-to-image synthesis","venue":null,"work_id":"18a3e4f3-efd8-4e49-b781-b09be602404f","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.000087Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:03ce60202e609139060cc26ee1993ba8f73753bf3ee21603389ca152974a48de","observation_id":"f00c05be-3b62-4de4-a843-a95554a680d8","resolution":{"observed_at":"2026-08-06T21:49:03.036753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07451","last_updated":"2025-03-11T10:55:52Z","snapshot_observed_at":"2026-08-16T13:44:05.764042Z","submitted_at":"2024-06-11T16:57:48Z","title":"A Multi-Armed Bandit Approach to Online Selection and Evaluation of Generative Models","version":3},"cited_work":{"arxiv_id":"2406.07451","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07451","snapshot_observed_at":"2026-08-06T21:48:58.698551Z","title":"A Multi-Armed Bandit Approach to Online Selection and Evaluation of Generative Models","venue":"cs.LG","work_id":"88ec47f4-4a60-4e8c-979d-c005dc415c70","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.058729Z"},"links":{"cited_paper":"/paper/2406.07451","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:c2ee4264f827d0826fed560fd3ff0a9073ce48cbf59e186e58f155a345ff8e4d","observation_id":"79b60aa4-8021-40ee-a135-487356241c7b","resolution":{"observed_at":"2026-08-06T21:48:58.751381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:02.739811Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":"c4c2071c-37ca-4a87-9e88-8531f61fc028","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.116358Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:3468395ebe5b058c8ea715fc49cf1c314f0d425a6b58185d0cde5dca576fb93f","observation_id":"68e853c2-b619-4f9d-95ab-a9eda965bb51","resolution":{"observed_at":"2026-08-06T21:49:02.829715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:02.577989Z","title":"An information-theoretic evaluation of generative models in learning multi-modal distributions","venue":null,"work_id":"b47daf3d-7f60-4e13-ba1a-b512172ad94d","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.228368Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ebcb1f0b4994626d573a318f1886ac751db021c3986919e0cec07a3fd2c7e658","observation_id":"8206daf3-8e7a-48dc-9aa8-fead9a8a5ba7","resolution":{"observed_at":"2026-08-06T21:49:02.654824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09603","last_updated":"2024-01-25T22:22:14Z","snapshot_observed_at":"2026-08-16T14:38:40.931111Z","submitted_at":"2023-11-30T19:11:01Z","title":"Rethinking FID: Towards a Better Evaluation Metric for Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09603","snapshot_observed_at":"2026-08-06T21:48:53.316391Z","title":"Rethinking fid: Towards a better evaluation metric for image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.316391Z"},"links":{"cited_paper":"/paper/2401.09603","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:84a61c040e46ef01b6fffd8374b91588beddf09a5fe42ce9a40308757078256f","observation_id":"07d48034-0798-4fe7-9a7d-d13cc77c49dc","resolution":{"observed_at":"2026-08-06T21:48:53.316391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:02.423488Z","title":"What's ``up'' with vision-language models? investigating their struggle with spatial reasoning","venue":null,"work_id":"4aafd750-a0d7-47ce-9760-ba7bffcc7cbe","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.352085Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:936eb872e215fa0cea342306b52f9b3b60bea485e9aa64e439ef3882475774e9","observation_id":"f2b20c63-ef67-4c6f-8e17-fdad4f6363f6","resolution":{"observed_at":"2026-08-06T21:49:02.501071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13308","last_updated":"2023-05-22T17:59:41Z","snapshot_observed_at":"2026-08-16T15:30:58.021314Z","submitted_at":"2023-05-22T17:59:41Z","title":"If at First You Don't Succeed, Try, Try Again: Faithful Diffusion-based Text-to-Image Generation by Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13308","snapshot_observed_at":"2026-08-06T21:48:53.437835Z","title":"If at first you don't succeed, try, try again: Faithful diffusion-based text-to-image generation by selection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.437835Z"},"links":{"cited_paper":"/paper/2305.13308","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:7d974a0d371c2210d03c26b186cfb31a40d609fca8498cc36b836fb3407d6164","observation_id":"568f43b0-6aeb-4c70-a4c0-43df7e04bb1f","resolution":{"observed_at":"2026-08-06T21:48:53.437835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04544","last_updated":"2024-04-06T07:53:49Z","snapshot_observed_at":"2026-08-16T14:03:10.548857Z","submitted_at":"2024-04-06T07:53:49Z","title":"BeyondScene: Higher-Resolution Human-Centric Scene Generation With Pretrained Diffusion","version":1},"cited_work":{"arxiv_id":"2404.04544","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.04544","snapshot_observed_at":"2026-08-06T21:48:58.549114Z","title":"BeyondScene: Higher-Resolution Human-Centric Scene Generation With Pretrained Diffusion","venue":"cs.CV","work_id":"5527ca7c-a52d-44dc-b165-6d95a5167f08","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.533737Z"},"links":{"cited_paper":"/paper/2404.04544","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:6a9010903af1e520b82599091d7082dfaac949a84074f8f4d9e2fa6018649b5b","observation_id":"71edc826-1f08-423d-bc26-8dfe123c5cfb","resolution":{"observed_at":"2026-08-06T21:48:58.598720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:02.245273Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":"5ae5f660-396f-4ba3-ace0-c0beaf82d912","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.586132Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ef26766f63a7aa874e01f81b6e00be3acec99d2205331eaa3b700e24bc74b0e2","observation_id":"65b24792-db47-47ac-a5cb-977279bd3622","resolution":{"observed_at":"2026-08-06T21:49:02.338882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T21:48:53.722447Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.722447Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:0b8bbf1bbf7d5c138f5bcdfb758aa62363b82179abd6102fb5d0e45eee38c158","observation_id":"60788508-c8c4-4c60-b0e9-270c434757eb","resolution":{"observed_at":"2026-08-06T21:48:53.722447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06991","last_updated":"2019-10-30T12:33:29Z","snapshot_observed_at":"2026-08-14T16:46:31.708998Z","submitted_at":"2019-04-15T12:20:32Z","title":"Improved Precision and Recall Metric for Assessing Generative Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06991","snapshot_observed_at":"2026-08-06T21:48:53.852853Z","title":"Improved precision and recall metric for assessing generative models, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.852853Z"},"links":{"cited_paper":"/paper/1904.06991","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:16dd08b08f9e5165170ccc943cebda9644215f2b1edf4766681847de4d5afc95","observation_id":"632e5ff8-76bb-4f4e-89de-f5cc318033e6","resolution":{"observed_at":"2026-08-06T21:48:53.852853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:02.041799Z","title":"Laion-coco 600m","venue":null,"work_id":"fc42a689-d21f-482d-abc8-037041cd3b11","year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:53.993200Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:13d84a709666eb130d8d58fd15f80ebe05fdd26c470c17d7000659d48f4cd705","observation_id":"938ff7f5-8e90-47a5-b9f5-08632237ec65","resolution":{"observed_at":"2026-08-06T21:49:02.158280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20474","last_updated":"2024-11-01T04:33:52Z","snapshot_observed_at":"2026-08-16T13:05:38.402503Z","submitted_at":"2024-10-27T15:30:45Z","title":"GrounDiT: Grounding Diffusion Transformers via Noisy Patch Transplantation","version":2},"cited_work":{"arxiv_id":"2410.20474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.20474","snapshot_observed_at":"2026-08-06T21:48:58.424627Z","title":"GrounDiT: Grounding Diffusion Transformers via Noisy Patch Transplantation","venue":"cs.CV","work_id":"b2a8f0f6-c96a-45db-b71e-ddffd199cf3f","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.063558Z"},"links":{"cited_paper":"/paper/2410.20474","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ee1c45d4ca015a006e33f098054f25e13cd9b7cb7c4c134c0e7f23679df94b44","observation_id":"cc4b0226-9d4c-407a-8619-11b898df9d86","resolution":{"observed_at":"2026-08-06T21:48:58.472999Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.07093","last_updated":"2023-04-17T01:54:37Z","snapshot_observed_at":"2026-08-16T16:01:52.647972Z","submitted_at":"2023-01-17T18:58:58Z","title":"GLIGEN: Open-Set Grounded Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.07093","snapshot_observed_at":"2026-08-06T21:48:54.226577Z","title":"Gligen: Open-set grounded text-to-image generation, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.226577Z"},"links":{"cited_paper":"/paper/2301.07093","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:167b89d9a6eac58414db60663ddac4a040c88b8e6e99ffa69e8e643de774f08c","observation_id":"83dd898d-37de-4d8f-b1b2-ea746ca26f09","resolution":{"observed_at":"2026-08-06T21:48:54.226577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:01.869540Z","title":"Divide & bind your attention for improved generative semantic nursing","venue":null,"work_id":"448d7a1b-865a-4f63-94a5-1c894eec89a9","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.383202Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:b0776d866c67267039cc9c7050b2273a33554020ab04707e93700a1e65654b58","observation_id":"0981c3cf-42c0-4f5a-ad88-a0fa44bdb9bb","resolution":{"observed_at":"2026-08-06T21:49:01.947376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13655","last_updated":"2024-03-04T18:43:49Z","snapshot_observed_at":"2026-08-16T15:30:49.729694Z","submitted_at":"2023-05-23T03:59:06Z","title":"LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13655","snapshot_observed_at":"2026-08-06T21:48:54.541171Z","title":"Llm-grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.541171Z"},"links":{"cited_paper":"/paper/2305.13655","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:f237a0e8d99c0ab96c32a2b5907b19f3e109c51cfebf2679131407709f00126f","observation_id":"163ad252-7a8e-46fe-966d-63458b240b4e","resolution":{"observed_at":"2026-08-06T21:48:54.541171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-06T21:48:54.670059Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.670059Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ea7d56722d77eedca4b996f81ed43d154927529fdc22670d51596c82fbac7bd3","observation_id":"1b6393a3-ac2e-4b9f-b839-c7024428db99","resolution":{"observed_at":"2026-08-06T21:48:54.670059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-08-16T14:04:34.158327Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-06T21:48:54.778142Z","title":"Evaluating text-to-visual generation with image-to-text generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.778142Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:8ef5337891146b65a8953185982d38e7c45a5e3749e32d4436bd90f4caf1cacf","observation_id":"babd993d-63a6-4fb9-89a9-c3b2f7b3f4cd","resolution":{"observed_at":"2026-08-06T21:48:54.778142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01714","last_updated":"2023-01-17T17:08:51Z","snapshot_observed_at":"2026-08-16T16:55:27.102617Z","submitted_at":"2022-06-03T17:47:04Z","title":"Compositional Visual Generation with Composable Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01714","snapshot_observed_at":"2026-08-06T21:48:54.880447Z","title":"Tenenbaum","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.880447Z"},"links":{"cited_paper":"/paper/2206.01714","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ec857647d8ece4dc8d36fdb5a328deaa6837fc3182e5fe8b6b42347d6ab72437","observation_id":"0c9d4880-0781-4eaa-a364-e680ac9a6c13","resolution":{"observed_at":"2026-08-06T21:48:54.880447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:01.698019Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"117320d4-4c31-49df-9c5c-d7f2a19b2638","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.923631Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:a2b247cddede44eed72ee7859151fd4ee3ead853c0d421296e9243fbe148f002","observation_id":"ced64cf3-11ee-4234-afc1-7abfb9ed26c6","resolution":{"observed_at":"2026-08-06T21:49:01.783156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:01.489107Z","title":"Correcting diffusion generation through resampling","venue":null,"work_id":"70b422c6-9401-427b-b819-45d1d74cae58","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.042044Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e36355e624c4bb26dcd4719d92643d62ef31b4c452e409632a71f5590ae3ac5e","observation_id":"9fd69e75-d069-47bf-9d8d-e0c8a10bb6cf","resolution":{"observed_at":"2026-08-06T21:49:01.584642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-08-16T15:15:38.321253Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-06T21:48:55.131271Z","title":"Inference-time scaling for diffusion models beyond scaling denoising steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.131271Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:6d708ee92989b51e228f75f506e9de513e85170233582fb26525514a3b0a1338","observation_id":"9090d239-61cb-4e85-98b5-3771c792f67e","resolution":{"observed_at":"2026-08-06T21:48:55.131271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22775","last_updated":"2025-03-21T10:45:28Z","snapshot_observed_at":"2026-08-16T13:04:39.661516Z","submitted_at":"2024-10-30T07:43:29Z","title":"Diffusion Beats Autoregressive: An Evaluation of Compositional Generation in Text-to-Image Models","version":2},"cited_work":{"arxiv_id":"2410.22775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22775","snapshot_observed_at":"2026-08-06T21:48:58.268190Z","title":"Diffusion Beats Autoregressive: An Evaluation of Compositional Generation in Text-to-Image Models","venue":"cs.CV","work_id":"1fe5e2a0-6aaf-4ee9-97aa-27dee8fa6ae9","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.186979Z"},"links":{"cited_paper":"/paper/2410.22775","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:f79384ac15b42601950c9fa22ebf1e368db22aafa464ee26dfcc53fb31473d62","observation_id":"1a67cb10-e9b4-462b-8869-d8d9ce9ea2b3","resolution":{"observed_at":"2026-08-06T21:48:58.305767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:01.290943Z","title":"Scaling open-vocabulary object detection","venue":null,"work_id":"71786183-5e8b-4ce6-a318-8d826c851869","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.224103Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:71dc3abd7eedbfe5e086caf763eda58c28daa4f8d75089b571e07e718f3d67ee","observation_id":"b8d16741-9771-454f-b974-e8b3bc0b739c","resolution":{"observed_at":"2026-08-06T21:49:01.393772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06230","last_updated":"2022-07-20T12:24:25Z","snapshot_observed_at":"2026-08-17T01:35:20.658936Z","submitted_at":"2022-05-12T17:20:36Z","title":"Simple Open-Vocabulary Object Detection with Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06230","snapshot_observed_at":"2026-08-06T21:48:55.316835Z","title":"Simple open-vocabulary object detection with vision transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.316835Z"},"links":{"cited_paper":"/paper/2205.06230","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:ed4f66241baba7567836a95f90b32d0239fd9f5334df1c256742b513816c3836","observation_id":"9970ec12-3997-4701-9dba-82053fae0d7e","resolution":{"observed_at":"2026-08-06T21:48:55.316835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-06T21:48:55.441530Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.441530Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:0bcf2f3c65ffea82857e9809a81f59d7b36226a2d7b92990ad4aafcc12a2a311","observation_id":"a378cbee-6979-48cf-a0c9-9d1ed0c2c8aa","resolution":{"observed_at":"2026-08-06T21:48:55.441530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:48:55.619085Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.619085Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:d4c614e9931b79beca023dcb181ef7097384f5c939eb74b4eab216b42bc631a2","observation_id":"35e4c707-9e52-4348-b0d1-5155491146cf","resolution":{"observed_at":"2026-08-06T21:48:55.619085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T21:48:55.723845Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.723845Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:d651f043244a6bd8f1639d4d9c5a156c4f038b24a500dfa83131008a6d659a28","observation_id":"84c356ae-bf5c-4a8f-b989-9ee6242478a9","resolution":{"observed_at":"2026-08-06T21:48:55.723845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05427","last_updated":"2023-12-02T02:02:54Z","snapshot_observed_at":"2026-08-16T15:25:22.902996Z","submitted_at":"2023-06-08T17:59:59Z","title":"Grounded Text-to-Image Synthesis with Attention Refocusing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05427","snapshot_observed_at":"2026-08-06T21:48:55.795064Z","title":"Grounded text-to-image synthesis with attention refocusing, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.795064Z"},"links":{"cited_paper":"/paper/2306.05427","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:a7c52bce06354bd110b91227549653acfcb78163b23873530ffeedbd3027d583","observation_id":"676cee09-5884-4021-9fad-a5e72b17e219","resolution":{"observed_at":"2026-08-06T21:48:55.795064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T21:48:55.869024Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.869024Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:62987dc12c41df51af70a03a12ef585eac55ae6a54be0c9cdbc0bfba1d907121","observation_id":"721246fa-07dd-4586-a22c-97860a7034c4","resolution":{"observed_at":"2026-08-06T21:48:55.869024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:01.031625Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"fadc01f2-7fbd-4460-901e-67b880c1057a","year":2021},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:55.965615Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:a36f539031dff1d3d1de8ea67ac984b49cb959dce3faee6e24f1bb280a53018d","observation_id":"3a181d03-2143-46e2-898a-5e4a2f6f696a","resolution":{"observed_at":"2026-08-06T21:49:01.192900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:00.834549Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"198f845d-f4cf-47cb-b6e4-1d7b20139655","year":2021},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.023411Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:19a265c76c4f9f2f8e497a71022917034d5193f5aa9a76814bd9e1d592cf066f","observation_id":"e6aace94-dd9d-4064-93eb-a33d6b4d5ae1","resolution":{"observed_at":"2026-08-06T21:49:00.928478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T21:48:56.058839Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.058839Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:31c2da9d50779f96b59eb72653b5c14a7cbdc4f4df119aef61cf755a073e6817","observation_id":"26b51eb6-89dd-43c0-83c6-b8ba3c63a021","resolution":{"observed_at":"2026-08-06T21:48:56.058839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:00.645697Z","title":"Linguistic binding in diffusion models: Enhancing attribute correspondence through attention map alignment","venue":null,"work_id":"b698f472-4cb7-4f34-ada2-e8d3fdb47017","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.114052Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:69de291fa889a6a7721cbf9b627b76c8717fef1169549dc645da3c1715759fd1","observation_id":"f2edd81a-8cec-4252-a975-0b63c4d33ac0","resolution":{"observed_at":"2026-08-06T21:49:00.717211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:00.423508Z","title":"Arkhipkin, Igor Pavlov, Ilya Ryabov, Angelina Kuts, Alexander Panchenko, Andrey Kuznetsov, and Denis Dimitrov","venue":null,"work_id":"dd8760fc-15b8-46d9-adf5-6cb6c1ec4326","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.170409Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:deb6028f35d38ff66d4fcde259c2507871f0b0ff323d66ff481a33a2f6fcd459","observation_id":"367c2b0b-cd2b-4eb0-9ee8-07b77b7c9b72","resolution":{"observed_at":"2026-08-06T21:49:00.511252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-06T21:48:56.243827Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.243827Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:a2211f748ea410bd656e2ecc5c3a02100bc2a87aad3bf3da322c6420807b3274","observation_id":"112b0fc5-524c-4449-a5eb-e9e146ef55fd","resolution":{"observed_at":"2026-08-06T21:48:56.243827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:00.281095Z","title":"Be more diverse than the most diverse: Optimal mixtures of generative models via mixture- UCB bandit algorithms","venue":null,"work_id":"9973ad59-93cb-4e51-af39-028ea6c3ddf1","year":2025},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.338961Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:57dd82bceac1c0a3b608ecf2236fd0cabc92e72dea2a2f2c39278f6ec71da58b","observation_id":"9bf64bec-9478-44dd-9edb-b24615ee4229","resolution":{"observed_at":"2026-08-06T21:49:00.335950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:56.381683Z","title":"Some aspects of the sequential design of experiments","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.381683Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:8e8e3ba912877310b195a682a57909ce2d5c7eb3ed037d19b988217ca380cc14","observation_id":"dc1a2e9c-df3d-4cad-9d28-43c19116b4c3","resolution":{"observed_at":"2026-08-06T21:48:56.381683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:56.449019Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.449019Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:f8945514363848e268a811770680fd3cf58b8a4620493f6f4ebc94c3108f9a62","observation_id":"dce2eed6-d5f8-4927-b29d-0b19ead8005f","resolution":{"observed_at":"2026-08-06T21:48:56.449019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:00.077948Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"1023d62a-01cf-4f15-a689-60ca1d1f785b","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.503848Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:84d5aa839346cee90a4ba1f6f63fb689d53f838c09e5d01466b636ecd4e091c7","observation_id":"e97464c5-dbec-4752-bd3f-816cbb486125","resolution":{"observed_at":"2026-08-06T21:49:00.178187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:59.881072Z","title":"Predicated diffusion: Predicate logic-based attention guidance for text-to-image diffusion models","venue":null,"work_id":"4e1f2e3a-d2a5-47e3-b2c2-25feb1c50a6c","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.540544Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e0e862023d4cb121caf2d8043fd8fe54d9742cccef5771ae814ac2b98228fc78","observation_id":"1878b31b-1707-4e95-b649-8c5be5da182b","resolution":{"observed_at":"2026-08-06T21:48:59.979688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03290","last_updated":"2024-02-05T18:49:17Z","snapshot_observed_at":"2026-08-16T14:21:18.185210Z","submitted_at":"2024-02-05T18:49:17Z","title":"InstanceDiffusion: Instance-level Control for Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03290","snapshot_observed_at":"2026-08-06T21:48:56.611116Z","title":"Instancediffusion: Instance-level control for image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.611116Z"},"links":{"cited_paper":"/paper/2402.03290","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:7d704c8f63a43e7cc2259b899e3154db70515f89ad55ec76dfcd0a0149ced1e4","observation_id":"e6c76451-9de6-4185-a098-92aa33429390","resolution":{"observed_at":"2026-08-06T21:48:56.611116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2682922","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:58.070610Z","title":"Wolfe and Robert V","venue":null,"work_id":"afe2ec31-b57a-49b0-8c3c-b29be6c24bfc","year":1971},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.663174Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:fc0e3e5fcc15c5d22c22fccd070fee74e1fe71e201261dfa8384911451435e40","observation_id":"6eea2c92-3000-4d91-a3bb-cca1487973e0","resolution":{"observed_at":"2026-08-06T21:48:58.107706Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08872","last_updated":"2023-11-27T08:42:07Z","snapshot_observed_at":"2026-08-16T14:52:27.856619Z","submitted_at":"2023-10-13T05:48:42Z","title":"R&B: Region and Boundary Aware Zero-shot Grounded Text-to-image Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08872","snapshot_observed_at":"2026-08-06T21:48:56.745122Z","title":"R&b: Region and boundary aware zero-shot grounded text-to-image generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.745122Z"},"links":{"cited_paper":"/paper/2310.08872","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:1349458a81d15e8eea0c1e5a5b885a727d2dbdbf1776187d10b1b20991df305b","observation_id":"aa2d77d7-1af9-455d-87fa-796a078c9105","resolution":{"observed_at":"2026-08-06T21:48:56.745122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10816","last_updated":"2023-08-21T13:07:10Z","snapshot_observed_at":"2026-08-16T15:14:42.359659Z","submitted_at":"2023-07-20T12:25:06Z","title":"BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained Diffusion","version":4},"cited_work":{"arxiv_id":"2307.10816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.10816","snapshot_observed_at":"2026-08-06T21:48:57.854470Z","title":"BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained Diffusion","venue":"cs.CV","work_id":"043c9925-59e2-4269-906e-d1bbfff8b77a","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.816954Z"},"links":{"cited_paper":"/paper/2307.10816","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:78d2f816a66ed190e3d695b805f4d96aa20c768af538b9770f22d5850be60227","observation_id":"1d63d2f5-54b2-4226-bed7-c60f7208a5cd","resolution":{"observed_at":"2026-08-06T21:48:57.931564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:59.766133Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":"977a3812-e2c9-4f86-ad3d-15a0e858dfa6","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.852398Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:3f5ccd18e8deff6ac6b08bf5e98d454cae54bef7a52b684172b95d55c00013c6","observation_id":"8ba51f86-cc4a-4f76-a2b8-a0ccd79790fb","resolution":{"observed_at":"2026-08-06T21:48:59.834159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11708","last_updated":"2024-05-05T04:50:54Z","snapshot_observed_at":"2026-08-16T14:25:42.389620Z","submitted_at":"2024-01-22T06:16:29Z","title":"Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11708","snapshot_observed_at":"2026-08-06T21:48:56.923723Z","title":"Mastering text-to-image diffusion: Recaptioning, planning, and generating with multimodal llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.923723Z"},"links":{"cited_paper":"/paper/2401.11708","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:cb90bb7f0f9e08e8f95afec9603fae295d5c39ced197252f45d5d81ed72f9a90","observation_id":"ff379478-dc49-45a9-9c2d-0c34e5ca44a1","resolution":{"observed_at":"2026-08-06T21:48:56.923723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:59.632114Z","title":"Reco: Region-controlled text-to-image generation","venue":null,"work_id":"734da814-2e9d-4c7f-9b13-a8c412dc986f","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:56.998259Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:5674c88f2a5cd76e00e920f2357b9e933f016b83097c99005c4d442ba1c88688","observation_id":"855cada1-bf5a-43e5-8e87-dbdad5b0b6fc","resolution":{"observed_at":"2026-08-06T21:48:59.681822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11721","last_updated":"2025-06-05T15:25:55Z","snapshot_observed_at":"2026-08-16T13:24:51.686180Z","submitted_at":"2024-08-21T15:51:46Z","title":"Detection-Driven Object Count Optimization for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11721","snapshot_observed_at":"2026-08-06T21:48:57.035500Z","title":"Iterative object count optimization for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.035500Z"},"links":{"cited_paper":"/paper/2408.11721","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:9049338e821d501af3544ef2ad7f5f5dc199e22c9fc48c3a96ba76cefb97c0b7","observation_id":"3c0c1880-0a35-4d0d-a0ed-89c56d17e0ef","resolution":{"observed_at":"2026-08-06T21:48:57.035500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07844","last_updated":"2025-03-24T21:33:14Z","snapshot_observed_at":"2026-08-16T13:43:56.351260Z","submitted_at":"2024-06-12T03:21:34Z","title":"Improving Compositional Attribute Binding in Text-to-Image Generative Models via Enhanced Text Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07844","snapshot_observed_at":"2026-08-06T21:48:57.092979Z","title":"Understanding and mitigating compositional issues in text-to-image generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.092979Z"},"links":{"cited_paper":"/paper/2406.07844","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:c1d5ca9f89af0d3a657bab4f76fc177dc64e8b2d2b489e8762863c1aa5415794","observation_id":"0ecde0f2-5b63-4da1-a25c-e919df18b343","resolution":{"observed_at":"2026-08-06T21:48:57.092979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:59.481731Z","title":"Multi-grained vision language pre-training: Aligning texts with visual concepts","venue":null,"work_id":"007de748-bbdf-4402-b023-b8e2979350b3","year":2021},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.225701Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:91a98e2fa49f5c4d5cb1ee4786a0b347136f3750b88d3f028e3c511f513bb723","observation_id":"6c6e4dad-b9be-4ec0-9c4e-a2e4a8147b8d","resolution":{"observed_at":"2026-08-06T21:48:59.553613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-14T19:07:37.876970Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-06T21:48:57.313620Z","title":"Adding conditional control to text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.313620Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:d99e2c26336775c8f002dee29edb96cb858b887b82d95f4f06c5f2070dba3dbd","observation_id":"dbe8a91e-ea7b-491b-89ed-248bec555a13","resolution":{"observed_at":"2026-08-06T21:48:57.313620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:59.348538Z","title":"Realcompo: Balancing realism and compositionality improves text-to-image diffusion models","venue":null,"work_id":"8d31666c-cbba-42a4-b2e9-65acfc459100","year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.350636Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:3fea7d21cfb9951650cd6ca8377e1d08066dec5d140de94ab1e5c09115dfd7af","observation_id":"2075568a-7757-4427-bc8b-f412c48e1914","resolution":{"observed_at":"2026-08-06T21:48:59.423169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06381","last_updated":"2024-03-11T02:18:27Z","snapshot_observed_at":"2026-08-16T14:11:09.044694Z","submitted_at":"2024-03-11T02:18:27Z","title":"Enhancing Semantic Fidelity in Text-to-Image Synthesis: Attention Regulation in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06381","snapshot_observed_at":"2026-08-06T21:48:57.426716Z","title":"Enhancing semantic fidelity in text-to-image synthesis: Attention regulation in diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.426716Z"},"links":{"cited_paper":"/paper/2403.06381","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e1d9f7632fdd0a9e9b48688f01de676f47d3090c64e8913ae920b9a71e47ab0e","observation_id":"640cee54-8bbc-4849-9c19-455d032b15ab","resolution":{"observed_at":"2026-08-06T21:48:57.426716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17189","last_updated":"2024-03-12T13:15:24Z","snapshot_observed_at":"2026-08-16T15:44:10.126279Z","submitted_at":"2023-03-30T06:56:12Z","title":"LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation","version":2},"cited_work":{"arxiv_id":"2303.17189","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.17189","snapshot_observed_at":"2026-08-06T21:48:57.719480Z","title":"LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation","venue":"cs.CV","work_id":"8768fdd6-3105-4046-acc9-f99838973f5a","year":2023},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.484646Z"},"links":{"cited_paper":"/paper/2303.17189","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:cfe0946e107859c903f85dcb9dd9d1d5c8938c09748b6c640bd88fa4b2508bd3","observation_id":"ac7f8dd9-14e8-4c32-a600-b96082be45b4","resolution":{"observed_at":"2026-08-06T21:48:57.770163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:59.184218Z","title":"a henb \\","venue":null,"work_id":"7d150c67-b88c-4850-9b90-082802a2c741","year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.523921Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e8d3f9b2996005a78b761aa133770c15b581356a80106000104844e9d95fbcef","observation_id":"7924c320-10cd-4992-9f9a-459d6d3807d2","resolution":{"observed_at":"2026-08-06T21:48:59.258838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:48:57.591417Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:57.591417Z"},"links":{"citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:89e02d77be33ccf7bc1746026e9b1574462b6a1b264d0d6055cae32ece135365","observation_id":"092761a5-b219-4d41-b024-75209b95bd11","resolution":{"observed_at":"2026-08-06T21:48:57.591417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":51,"verified_exact":6,"verified_fuzzy":27},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2506.23418."}