{"as_of":"2026-08-10T05:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bcfe3bdf222387c375df50261497c555a1205d6352244aa5139c65867b5cf2fa","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:19:10.904066Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:49:29.849367Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-09T11:19:10.904066Z","title":"[Gokhale et al., 2022] Tejas Gokhale, Hamid Palangi, Be- smira Nushi, Vibhav Vineet, Eric Horvitz, Ece Kamar, Chitta Baral, and Yezhou Yang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04359","last_updated":"2025-02-04T22:58:15Z","snapshot_observed_at":"2026-08-09T11:11:00.029234Z","submitted_at":"2025-02-04T22:58:15Z","title":"Exploring Spatial Language Grounding Through Referring Expressions","version":1},"reference_index":166,"source":"pdf_text","source_observed_at":"2026-08-09T11:19:10.904066Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2502.04359"},"observation_digest":"sha256:f67d6598d1deb098fe7467ba673fd9f21f64e56c050479ec54a1df8e324dc3ba","observation_id":"5692ab96-29d4-4585-ae9c-5f51b1e7b0b4","resolution":{"observed_at":"2026-08-09T11:19:10.904066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-08T21:50:24.505718Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04725","last_updated":"2025-02-07T07:49:37Z","snapshot_observed_at":"2026-08-09T14:38:52.290788Z","submitted_at":"2025-02-07T07:49:37Z","title":"Can Diffusion Models Learn Hidden Inter-Feature Rules Behind Images?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T21:50:24.505718Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2502.04725"},"observation_digest":"sha256:f2221d618e485a193339fa04e7081e498998188d02a8acfb819404475d01c22a","observation_id":"c3e72552-b9b7-4add-a107-f91363c9ae06","resolution":{"observed_at":"2026-08-08T21:50:24.505718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-07T14:29:14.923026Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.923026Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:75e93e849937b0b73ca5d0f0b115d1483dbb6f770c87a37913af0eebd8b33d2c","observation_id":"c9468441-2afa-4be0-b5c9-cf182aa22214","resolution":{"observed_at":"2026-08-07T14:29:14.923026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-07T05:14:41.429534Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.429534Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:2520b37f0d929f86503dd223e58e0e5ff4c5449ef3746a48d217594ad3785fb9","observation_id":"fbaee488-b011-4168-9d0d-9bf5f8ac655b","resolution":{"observed_at":"2026-08-07T05:14:41.429534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-07T10:17:46.511922Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-08T16:55:23.964977Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.511922Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:15814c803391a054bec91ce22c21d220fd91ac62bb0e9cddaf90e5c037d20732","observation_id":"d00ac191-626e-49e9-bd97-7f9e6761377d","resolution":{"observed_at":"2026-08-07T10:17:46.511922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-06T21:48:52.391265Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.391265Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e6fe1da18395dbe39ef3f453126a2cf348ada11d7141b8a9b46c70e818818d05","observation_id":"54e5f73d-cf88-4460-bc27-fa90af3275fe","resolution":{"observed_at":"2026-08-06T21:48:52.391265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-06T18:50:42.353509Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08039","last_updated":"2025-07-09T18:40:17Z","snapshot_observed_at":"2026-08-09T16:00:35.383984Z","submitted_at":"2025-07-09T18:40:17Z","title":"Towards Evaluating Robustness of Prompt Adherence in Text to Image Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:50:42.353509Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2507.08039"},"observation_digest":"sha256:98674a4b635a838cadf40173ddedb6545987d6c94af7668e46a11b6279bc4893","observation_id":"8dda9b9c-2267-4826-8203-8d08ffa3620f","resolution":{"observed_at":"2026-08-06T18:50:42.353509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-05T22:23:09.608412Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07135","last_updated":"2025-08-10T01:15:37Z","snapshot_observed_at":"2026-08-09T08:28:13.984259Z","submitted_at":"2025-08-10T01:15:37Z","title":"Canvas3D: Empowering Precise Spatial Control for Image Generation with Constraints from a 3D Virtual Canvas","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:23:09.608412Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2508.07135"},"observation_digest":"sha256:2ee87065854d7cf8f7b68eb4647e667e07d0151ac03cf7bd8a547c3a72a538e9","observation_id":"9d0e6edc-0bf6-4db3-bc1a-0f0fca961dd1","resolution":{"observed_at":"2026-08-05T22:23:09.608412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-05T10:59:25.229741Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03385","last_updated":"2025-09-03T15:02:40Z","snapshot_observed_at":"2026-08-08T21:04:36.444975Z","submitted_at":"2025-09-03T15:02:40Z","title":"Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:25.229741Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2509.03385"},"observation_digest":"sha256:9c3bce0e05223c9496c8d6c9306f7e3bfce49e3fc204f1c196b043876c98a53e","observation_id":"a5df3ae9-484b-47a3-9946-033742454da1","resolution":{"observed_at":"2026-08-05T10:59:25.229741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2509.17458","last_updated":"2026-04-11T12:35:18Z","snapshot_observed_at":"2026-07-06T22:30:26.679189Z","submitted_at":"2025-09-22T07:51:28Z","title":"CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T15:25:39.116881Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2509.17458"},"observation_digest":"sha256:9e74baef474b0870af5e80d80b6505df9ae9e8019b3639ec63e8a0b243ab1e85","observation_id":"4cba0c9c-9294-49d7-96a7-d81c09a42921","resolution":{"observed_at":"2026-05-18T15:26:33.618048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-03T09:35:27.378827Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.17037","last_updated":"2026-06-23T18:08:52Z","snapshot_observed_at":"2026-08-03T09:35:21.823477Z","submitted_at":"2026-01-20T00:06:58Z","title":"AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T09:35:27.378827Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2601.17037"},"observation_digest":"sha256:1bfeeaf68c5359b440e32663ec99f0db83a198cdbea0b2b9590961da63e7f8d0","observation_id":"4fbf225c-09f3-4334-a9f3-ca043d6b7fa5","resolution":{"observed_at":"2026-08-03T09:35:27.378827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2603.00166","last_updated":"2026-05-11T07:16:33Z","snapshot_observed_at":"2026-08-07T10:45:22.942441Z","submitted_at":"2026-02-26T08:11:09Z","title":"Exploring the AI Obedience: Why is Generating a Pure Color Image Harder than CyberPunk?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T19:15:11.575505Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2603.00166"},"observation_digest":"sha256:b23ce603f36e3abfc5eda963e47cd41d35defc713951c4be7f2c08846b02c5e3","observation_id":"da2973fe-c940-41b8-a44c-8499cff71122","resolution":{"observed_at":"2026-05-15T19:16:31.387201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-07-12T19:10:04.790544Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:33.464951Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:2e8bb8e73e56a3733cd1adf3e8d8d782be174922342730cbb61662eaf93eddbb","observation_id":"63def0fd-170a-45bf-a37f-3b9949a7e061","resolution":{"observed_at":"2026-05-10T06:56:47.397746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-12T19:10:41.883296Z","title":"arXiv preprint arXiv:2212.10015 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-07-12T19:10:04.790544Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T19:10:41.883296Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:bd61749283d2c057ccc07c1d844855997515c87c2e76dd52268210135613ef90","observation_id":"9a3cbfd8-8b21-4830-ad48-68a08784bdde","resolution":{"observed_at":"2026-07-12T19:10:41.883296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2605.11722","last_updated":"2026-05-12T08:08:09Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:08:09Z","title":"EPIC: Efficient Predicate-Guided Inference-Time Control for Compositional Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T06:10:52.567634Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2605.11722"},"observation_digest":"sha256:119dfb99e8b335f26b53b4e70fce719e141096d33eb6a97daa1e91d304df5c2a","observation_id":"c5b2d4fb-eb60-40ee-838d-538e2cb0d628","resolution":{"observed_at":"2026-05-13T06:12:22.668531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2605.19532","last_updated":"2026-05-19T08:33:10Z","snapshot_observed_at":"2026-08-02T22:16:23.062173Z","submitted_at":"2026-05-19T08:33:10Z","title":"Boosting Text-to-Image Diffusion Models via Core Token Attention-Based Seed Selection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T06:25:32.694239Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2605.19532"},"observation_digest":"sha256:a6a9a9a981296caa1be53150beab4032f216dd463712f532180a2aacff1e6939","observation_id":"300a6ef3-f683-48d3-a286-9aa5671031eb","resolution":{"observed_at":"2026-05-20T06:28:05.540179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2606.07568","last_updated":"2026-05-26T02:19:47Z","snapshot_observed_at":"2026-07-06T23:47:10.030985Z","submitted_at":"2026-05-26T02:19:47Z","title":"A Systematic Study of Behavioral Cloning for Scientific Data Annotation","version":1},"reference_index":268,"source":"arxiv_source","source_observed_at":"2026-06-29T16:23:08.402194Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2606.07568"},"observation_digest":"sha256:ec4b5b26c0230d9f2fe88a5660b67bb484ce6194870238d2af66ea72183c2533","observation_id":"db924f41-522a-4d10-aa6d-5074d461b1f2","resolution":{"observed_at":"2026-06-29T16:23:39.188094Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2606.19941","last_updated":"2026-06-18T08:39:07Z","snapshot_observed_at":"2026-08-03T00:29:25.767611Z","submitted_at":"2026-06-18T08:39:07Z","title":"Compositionality Emerges in a Narrow Depth-Connectivity Regime: Architecture Constraints and Solution Manifolds","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:56.676469Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2606.19941"},"observation_digest":"sha256:ef67cf3be0607bd21b1fc9740092cb2e17ee2a22b583dfe0e588c59764dd6d2b","observation_id":"b3361d10-8a55-4354-b500-ec4d341334e8","resolution":{"observed_at":"2026-07-04T03:09:29.854512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2212.10015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-04T03:49:29.849367Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":"bd76e286-1461-47b4-94ea-25a689deacd4","year":2022},"citing_paper":{"arxiv_id":"2606.20924","last_updated":"2026-06-18T20:33:20Z","snapshot_observed_at":"2026-08-09T22:37:10.628084Z","submitted_at":"2026-06-18T20:33:20Z","title":"ELDiff: When Evidential Learning Meets Text-to-Image Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T17:40:14.587143Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2606.20924"},"observation_digest":"sha256:726338836a83814842e8fd4dda54347e3d13c76b4b9a3b0e52aa581a30ad59d9","observation_id":"3e74535b-719e-49d1-a2a2-c3d88c0dfca8","resolution":{"observed_at":"2026-07-04T03:49:29.850942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-07-11T19:17:19.634242Z","title":"arXiv preprint arXiv:2212.10015 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04423","last_updated":"2026-07-07T07:27:22Z","snapshot_observed_at":"2026-08-04T06:57:07.480777Z","submitted_at":"2026-07-05T17:33:59Z","title":"Transferability Between Understanding and Generation in Unified Multimodal Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:19.634242Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2607.04423"},"observation_digest":"sha256:1da77fea7c11c7d125be7e5e7241c089dbeb215446646fba5bc2e7e1cdbd1c4a","observation_id":"36b8fd0f-250a-427f-9c62-25dba55a608d","resolution":{"observed_at":"2026-07-11T19:17:19.634242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-01T08:39:37.518805Z","title":"Benchmarking spatial relationships in text-to-image generation.arXiv preprint arXiv:2212.10015 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:37.518805Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:430a7c7032b73f4189823d5f62dbb8b2569af20a8ce7bca00ce924bd44cff342","observation_id":"d397bc5e-c954-44b6-a872-c5f290657a1a","resolution":{"observed_at":"2026-08-01T08:39:37.518805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.10015/citation-record","integrity":"/paper/2212.10015/integrity","json":"/paper/2212.10015/citation-record.json","paper":"/paper/2212.10015"},"outbound":[],"paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2212.10015."}