{"as_of":"2026-08-09T11:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa50d11e9425d2a7016dfe0194a1007a3f21afc9bf421d77944cefafd73ee13a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:08:03.913503Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T14:57:03.724733Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":"2307.06350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-07-02T14:57:03.724733Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation","venue":null,"work_id":"abef9a28-fc7c-4a78-b385-0e9a1fd64b87","year":2025},"citing_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-05-12T08:27:53.446686Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2403.03206"},"observation_digest":"sha256:f69dcbdab640eeb2c5ecf0ad4f2c95d713ecfb5455a45b3bae1b5824316c6f82","observation_id":"3f602b83-fa9b-418a-b4af-a5f683562da0","resolution":{"observed_at":"2026-05-12T08:27:53.656561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":"2307.06350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-07-02T14:57:03.724733Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation","venue":null,"work_id":"abef9a28-fc7c-4a78-b385-0e9a1fd64b87","year":2025},"citing_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T02:48:44.900467Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2411.04996"},"observation_digest":"sha256:c8100b0b9e179c71e945b8c92633de44df625b90dc8ae3f3688a7befe6772851","observation_id":"c825cdfc-b5a3-4949-84de-ee6e671f6738","resolution":{"observed_at":"2026-05-18T02:48:45.006556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-07T13:08:03.913503Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.913503Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:67cd8be2270294094425d49aa75a53d0470ca8b98154ac0d05c6e30ae3c047ff","observation_id":"ab514049-398b-44d1-9f7b-4630afa36023","resolution":{"observed_at":"2026-08-07T13:08:03.913503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-07T05:25:43.869061Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07986","last_updated":"2025-07-23T03:45:11Z","snapshot_observed_at":"2026-08-08T06:05:05.430483Z","submitted_at":"2025-06-09T17:54:04Z","title":"Rethinking Cross-Modal Interaction in Multimodal Diffusion Transformers","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:43.869061Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2506.07986"},"observation_digest":"sha256:1876f34e555b5421be23c066cb6bfd5d1989ee72801f0265d3802792a549608a","observation_id":"9e5b577d-fd2d-40e7-b874-1a187add373d","resolution":{"observed_at":"2026-08-07T05:25:43.869061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-07T05:14:41.673571Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.673571Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:cc8777b8d121ed3b2b1935661108d362c0367ca54feb7b7da7a462abf6e13483","observation_id":"1240962d-56f1-466e-9851-e69f16a28d70","resolution":{"observed_at":"2026-08-07T05:14:41.673571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-06T19:18:50.365029Z","title":"T2I-CompBench++: An enhanced and compre- hensive benchmark for compositional text-to-image generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06033","last_updated":"2025-07-08T14:35:02Z","snapshot_observed_at":"2026-08-08T00:52:55.228538Z","submitted_at":"2025-07-08T14:35:02Z","title":"TextPixs: Glyph-Conditioned Diffusion with Character-Aware Attention and OCR-Guided Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:18:50.365029Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2507.06033"},"observation_digest":"sha256:7fd52b48c6568a089848e915806c0393babc042b912c47f15328db5beed53ff3","observation_id":"c2a97c68-a4ae-43ad-b5d8-45f9c83ae372","resolution":{"observed_at":"2026-08-06T19:18:50.365029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-06T18:50:42.784210Z","title":"T2I-CompBench: A Comprehensive Benchmark for Open-world Compositional Text-to- image Generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08039","last_updated":"2025-07-09T18:40:17Z","snapshot_observed_at":"2026-08-08T18:34:07.123516Z","submitted_at":"2025-07-09T18:40:17Z","title":"Towards Evaluating Robustness of Prompt Adherence in Text to Image Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:50:42.784210Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2507.08039"},"observation_digest":"sha256:e3195d29808babaf9ec1a236c4c54b30dcf6920299b541ad23bd703e38ff55bf","observation_id":"f2d2c8f5-04bc-4a5e-9d42-b0b4da157f9b","resolution":{"observed_at":"2026-08-06T18:50:42.784210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-05T20:44:12.680706Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.680706Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:db5bb3890cc3d0ca26c62d35fa85e2371e457fcd874bb82f0bfc72aff736add5","observation_id":"536242bd-79f5-4edf-b5cc-89f572b67e5e","resolution":{"observed_at":"2026-08-05T20:44:12.680706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-05T17:56:52.482995Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-08T09:52:34.305122Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:52.482995Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:045ef4a03058012737836bedcb058715de784daf21bb8bff41d0f9df32e5da28","observation_id":"39496e77-780b-4891-a077-0e698c61f2ef","resolution":{"observed_at":"2026-08-05T17:56:52.482995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-05T18:47:45.271784Z","title":"URL https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18235","last_updated":"2025-08-20T00:57:21Z","snapshot_observed_at":"2026-08-05T18:44:01.835548Z","submitted_at":"2025-08-20T00:57:21Z","title":"Sealing The Backdoor: Unlearning Adversarial Text Triggers In Diffusion Models Using Knowledge Distillation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T18:47:45.271784Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2508.18235"},"observation_digest":"sha256:e9b8e9c4f5775951ef319f22170fc9cf5022fb623ef6fa678753f892908a4edd","observation_id":"5f74645b-dff7-4ee7-b7a7-8e27c88559e4","resolution":{"observed_at":"2026-08-05T18:47:45.271784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":"2307.06350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-07-02T14:57:03.724733Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation","venue":null,"work_id":"abef9a28-fc7c-4a78-b385-0e9a1fd64b87","year":2025},"citing_paper":{"arxiv_id":"2604.25072","last_updated":"2026-04-27T23:57:29Z","snapshot_observed_at":"2026-08-05T02:34:39.806032Z","submitted_at":"2026-04-27T23:57:29Z","title":"Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T04:08:41.452018Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2604.25072"},"observation_digest":"sha256:1e2e999516f684f44a1fe8e3afc95b324db8d3498cf76bc64436a27da72d2ef6","observation_id":"2656f209-dea0-49ef-b843-3e4e825cc669","resolution":{"observed_at":"2026-05-11T21:51:18.468344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":"2307.06350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-07-02T14:57:03.724733Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation","venue":null,"work_id":"abef9a28-fc7c-4a78-b385-0e9a1fd64b87","year":2025},"citing_paper":{"arxiv_id":"2605.14876","last_updated":"2026-05-15T05:10:39Z","snapshot_observed_at":"2026-08-02T23:16:15.609028Z","submitted_at":"2026-05-14T14:22:25Z","title":"Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:43.166697Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2605.14876"},"observation_digest":"sha256:45f2b78eddf4bad6167905f04bd8a957931a01f117c1699c4fb5eb1f82a30ca3","observation_id":"1e361967-1b4b-4b51-8f21-44866183bc66","resolution":{"observed_at":"2026-05-19T16:37:39.744583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":"2307.06350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-07-02T14:57:03.724733Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation","venue":null,"work_id":"abef9a28-fc7c-4a78-b385-0e9a1fd64b87","year":2025},"citing_paper":{"arxiv_id":"2607.00402","last_updated":"2026-07-01T04:00:27Z","snapshot_observed_at":"2026-08-07T02:31:41.165567Z","submitted_at":"2026-07-01T04:00:27Z","title":"The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-02T14:56:40.860766Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2607.00402"},"observation_digest":"sha256:50b32f4d9cb8d143493e67656afba010d64d5e6dc4dfe2630a393d695a95d269","observation_id":"42f0a070-55d3-4d62-8bcf-99dd84e4ebf3","resolution":{"observed_at":"2026-07-02T14:57:03.726486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-01T21:07:58.733061Z","title":"T2i- compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16409","last_updated":"2026-07-17T18:02:44Z","snapshot_observed_at":"2026-08-08T00:27:24.450465Z","submitted_at":"2026-07-17T18:02:44Z","title":"Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T21:07:58.733061Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2607.16409"},"observation_digest":"sha256:3e13f3d4d1f2aab17109c5f16b75247380207761c86b61c01ccf951faf196638","observation_id":"d92e1202-1a7d-4e3f-a27d-2abe02fc04db","resolution":{"observed_at":"2026-08-01T21:07:58.733061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-01T14:24:46.083996Z","title":"T2I-CompBench: A comprehensive benchmark for open-world compositional text-to-image generation.arXiv preprint arXiv:2307.06350,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.083996Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:fdf2e5b35c0de3cf78af1df818b833bc12a0901adf647a04ee4f14444497e381","observation_id":"73280caa-25ab-44dd-b35d-df6f459a6509","resolution":{"observed_at":"2026-08-01T14:24:46.083996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-05T01:00:04.805025Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation.arXiv preprint arXiv:2307.06350, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00440","last_updated":"2026-08-01T04:39:59Z","snapshot_observed_at":"2026-08-09T01:26:58.815611Z","submitted_at":"2026-08-01T04:39:59Z","title":"Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T01:00:04.805025Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2608.00440"},"observation_digest":"sha256:5258d62800bb5af331cecb646d2c40fff30926169face8843903910987dc85fc","observation_id":"b58957d5-4016-4ffb-8860-bffa5b8c3866","resolution":{"observed_at":"2026-08-05T01:00:04.805025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-05T14:23:58.328521Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03708","last_updated":"2026-08-04T14:13:18Z","snapshot_observed_at":"2026-08-08T08:24:47.597977Z","submitted_at":"2026-08-04T14:13:18Z","title":"MultiCompose: Multi-Concept Personalized Composition with Per-Subject Attribute Binding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:58.328521Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2608.03708"},"observation_digest":"sha256:6cd1eda19c633360e5f67e4a101851100cebb01eb04d1ee28972890f131fe195","observation_id":"25e91c2f-579f-4e29-8be2-02b1c64c458f","resolution":{"observed_at":"2026-08-05T14:23:58.328521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-06T17:31:34.759041Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04750","last_updated":"2026-08-05T12:18:28Z","snapshot_observed_at":"2026-08-09T10:38:54.854484Z","submitted_at":"2026-08-05T12:18:28Z","title":"Simile Understanding in Text-to-Image Models: An Evaluation Framework","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:31:34.759041Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2608.04750"},"observation_digest":"sha256:48e8384c5975b629e3b22fac0a70f28c6d038647a7c5b520da7cc46a2b6c3018","observation_id":"9663b61d-8c42-451b-b1a5-acbf264ea2d5","resolution":{"observed_at":"2026-08-06T17:31:34.759041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2307.06350/citation-record","integrity":"/paper/2307.06350/integrity","json":"/paper/2307.06350/citation-record.json","paper":"/paper/2307.06350"},"outbound":[],"paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2307.06350."}