{"as_of":"2026-08-17T14:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10d60b858246b85d87baa3ea31036a302cb754489adc4daf97ecdb7e875437d6","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:48:56.713041Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T06:48:22.594002Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T06:54:20.749687Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.23493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23493","snapshot_observed_at":"2026-06-30T06:54:20.749687Z","title":"R2I- Bench: Benchmarking reasoning-driven text-to-image gen- eration.preprint","venue":null,"work_id":"c14b6eb1-2ab8-48ee-9102-2a20594ac7b9","year":2025},"citing_paper":{"arxiv_id":"2511.17171","last_updated":"2026-05-22T12:44:18Z","snapshot_observed_at":"2026-08-10T21:17:16.890967Z","submitted_at":"2025-11-21T11:45:22Z","title":"FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:15.034196Z"},"links":{"cited_paper":"/paper/2505.23493","citing_paper":"/paper/2511.17171"},"observation_digest":"sha256:4ff6b8191793f1fcac443f4652a64f2811a1c84af1c0b676c08f6dc68bee9c2a","observation_id":"46fadfc8-672a-4492-bd62-df72663c45b5","resolution":{"observed_at":"2026-05-17T20:50:15.265088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.23493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23493","snapshot_observed_at":"2026-06-30T06:54:20.749687Z","title":"R2I- Bench: Benchmarking reasoning-driven text-to-image gen- eration.preprint","venue":null,"work_id":"c14b6eb1-2ab8-48ee-9102-2a20594ac7b9","year":2025},"citing_paper":{"arxiv_id":"2511.17171","last_updated":"2026-05-22T12:44:18Z","snapshot_observed_at":"2026-08-10T21:17:16.890967Z","submitted_at":"2025-11-21T11:45:22Z","title":"FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T07:17:26.381232Z"},"links":{"cited_paper":"/paper/2505.23493","citing_paper":"/paper/2511.17171"},"observation_digest":"sha256:ec586273396e05ebf4e2da5b13bd38548d578828ea4d170342a45342c094a959","observation_id":"59c12a06-209e-4f77-b97a-d26040fdf814","resolution":{"observed_at":"2026-05-25T07:20:28.749989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.23493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23493","snapshot_observed_at":"2026-06-30T06:54:20.749687Z","title":"R2I- Bench: Benchmarking reasoning-driven text-to-image gen- eration.preprint","venue":null,"work_id":"c14b6eb1-2ab8-48ee-9102-2a20594ac7b9","year":2025},"citing_paper":{"arxiv_id":"2606.30124","last_updated":"2026-06-29T10:59:10Z","snapshot_observed_at":"2026-08-14T20:48:54.800865Z","submitted_at":"2026-06-29T10:59:10Z","title":"SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T06:48:22.594002Z"},"links":{"cited_paper":"/paper/2505.23493","citing_paper":"/paper/2606.30124"},"observation_digest":"sha256:23f78e25b7658a66245ed9bcb7ba711ba2197e2a3e5969f1f79e04285743d1c8","observation_id":"4d3fa62b-0fe2-424e-893c-4a4515adfa78","resolution":{"observed_at":"2026-06-30T06:54:20.751242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23493/citation-record","integrity":"/paper/2505.23493/integrity","json":"/paper/2505.23493/citation-record.json","paper":"/paper/2505.23493"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:00.030771Z","title":null,"venue":null,"work_id":"84d791c0-4271-4be7-a46f-e3d4ddd1cca5","year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:49.746943Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:c84ac0a88d86c7f03deb51ba3ab46bb8ee646f62f98592aaabfa2b204b53a327","observation_id":"d15d36c5-e011-4bda-8d2a-cfd185456321","resolution":{"observed_at":"2026-08-07T12:49:00.159374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T12:48:49.843304Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:49.843304Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:5813033dcbe9e334672fbac0ff4afbe4e63b267d6914794f7c85fd572b3fdfe1","observation_id":"010d06db-4492-4aa0-adc9-773aab591966","resolution":{"observed_at":"2026-08-07T12:48:49.843304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17283","last_updated":"2023-07-03T09:12:49Z","snapshot_observed_at":"2026-08-17T00:13:31.731203Z","submitted_at":"2022-10-31T13:04:07Z","title":"CausalBench: A Large-scale Benchmark for Network Inference from Single-cell Perturbation Data","version":2},"cited_work":{"arxiv_id":"2210.17283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.17283","snapshot_observed_at":"2026-08-07T12:48:58.502381Z","title":"CausalBench: A Large-scale Benchmark for Network Inference from Single-cell Perturbation Data","venue":"cs.LG","work_id":"648bc1ae-f68e-4eff-956c-185f5e66075a","year":2022},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.005107Z"},"links":{"cited_paper":"/paper/2210.17283","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:e2b633908bec56548e292632b8fc7a655f90951ae2bdf39645d2987f45fb1a4d","observation_id":"fef839bb-e848-40d5-a172-edfede8c32f1","resolution":{"observed_at":"2026-08-07T12:48:58.625556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18235","last_updated":"2024-03-13T21:58:59Z","snapshot_observed_at":"2026-08-16T14:48:13.614984Z","submitted_at":"2023-10-27T16:20:10Z","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18235","snapshot_observed_at":"2026-08-07T12:48:50.146992Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.146992Z"},"links":{"cited_paper":"/paper/2310.18235","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:ecbd8082a94a320d5b168392778f460ba70c53351ca173bb3783a5ace43065d7","observation_id":"7302757c-64c6-463a-891b-5be4aba836af","resolution":{"observed_at":"2026-08-07T12:48:50.146992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14324","last_updated":"2023-10-17T16:33:33Z","snapshot_observed_at":"2026-08-16T15:30:30.917843Z","submitted_at":"2023-05-23T17:54:57Z","title":"Ties Matter: Meta-Evaluating Modern Metrics with Pairwise Accuracy and Tie Calibration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14324","snapshot_observed_at":"2026-08-07T12:48:50.308918Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.308918Z"},"links":{"cited_paper":"/paper/2305.14324","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:3c5e8830212e1c1e6985fb133950bec351199f3acd37cd354dcbe7a0c06f1edc","observation_id":"bc722c93-31a9-456c-80b2-35d3d5367dfd","resolution":{"observed_at":"2026-08-07T12:48:50.308918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:59.687517Z","title":null,"venue":null,"work_id":"44098103-0109-49a2-99b8-26023eaae5d4","year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.460119Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:586b6c29a12a620ffac52affcd232a4a2afb686120e7b873eca0e6afcab90988","observation_id":"86f70d88-4b49-4d1f-b0ac-de7c90dfb821","resolution":{"observed_at":"2026-08-07T12:48:59.888400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-07T12:48:50.601657Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.601657Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:35dd27a6f83b568bd2fca3f9887c07051db28339d84272d0b16e6c8940e3fde1","observation_id":"a7e5a7b6-088a-45e7-a1b8-ac1e9abb352a","resolution":{"observed_at":"2026-08-07T12:48:50.601657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07546","last_updated":"2024-08-12T19:33:52Z","snapshot_observed_at":"2026-08-16T13:44:03.034288Z","submitted_at":"2024-06-11T17:59:48Z","title":"Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07546","snapshot_observed_at":"2026-08-07T12:48:50.711956Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.711956Z"},"links":{"cited_paper":"/paper/2406.07546","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:5675458dea4a9b847f205cf94fdf4bbfa911a2e50b398c0a5aa40b5fd96c1521","observation_id":"2a1e1bb1-ba1a-4820-90c6-e681d26cbd59","resolution":{"observed_at":"2026-08-07T12:48:50.711956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-16T13:53:57.994391Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-07T12:48:50.794369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.794369Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:2d7834edc05663424a8f1e54d1081bdd1f3ab14bc06c19ce979cf637d6a83117","observation_id":"369b99fb-2f79-4006-ae23-413dac14c3a7","resolution":{"observed_at":"2026-08-07T12:48:50.794369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:50.918448Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.918448Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:ffa72a622267b5566361016e7a90e720a534d46ca4aaa5b531e964ab6d0bf1fb","observation_id":"52f2d23d-c8a4-459b-a650-5772f282b9d7","resolution":{"observed_at":"2026-08-07T12:48:50.918448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-13T08:10:57.391295Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T12:48:51.044539Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.044539Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:7ed4aae40be547a1900d282e9e76a12da250dab364f9cef98464b7270891d2e6","observation_id":"c30ed327-5349-46e7-b27a-bb7d9de92dad","resolution":{"observed_at":"2026-08-07T12:48:51.044539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T12:48:51.198464Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.198464Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:8cbb7597b56cf152f41df86be2b6a9714ae144501234fe4024ab0d5883ae0416","observation_id":"cca02173-e221-4070-b608-b43bb1183361","resolution":{"observed_at":"2026-08-07T12:48:51.198464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T12:48:51.465446Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.465446Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:509b54e3954b30631ba34b8ab06cc14a07235383fe4f2bdafefa5f0cf1b8b4f1","observation_id":"45a045a7-98f8-420f-98c9-3d0e66a55142","resolution":{"observed_at":"2026-08-07T12:48:51.465446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:48:51.628628Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.628628Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:680370412106630c01c497b0168b37553f2710dfd2d29289fd60d79b72ad27b8","observation_id":"2231ea07-0147-4d7b-8f59-c4722310452a","resolution":{"observed_at":"2026-08-07T12:48:51.628628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.03725","last_updated":"2019-12-08T17:47:25Z","snapshot_observed_at":"2026-07-06T08:42:55.569794Z","submitted_at":"2019-12-08T17:47:25Z","title":"Kendall's Tau for Functional Data Analysis","version":1},"cited_work":{"arxiv_id":"1912.03725","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.03725","snapshot_observed_at":"2026-08-07T12:48:58.195839Z","title":"Kendall's Tau for Functional Data Analysis","venue":"stat.ME","work_id":"5d5c4d0d-24b7-4c6f-a198-8c10179bdf97","year":2019},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.794555Z"},"links":{"cited_paper":"/paper/1912.03725","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:73cd836d31f739c9881ecc69e7f550475cbd94ca52ecdfbe1f51bb940cd419dd","observation_id":"f62b6d8b-f62f-43d4-a2e3-82943ec1678e","resolution":{"observed_at":"2026-08-07T12:48:58.308666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T12:48:51.964061Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.964061Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:771e98fe97a539d5f647eef41db0bcc323e19f338f40cd7f9beb2676cbbac3ee","observation_id":"804ffdb4-d090-4c42-9dc0-ddf05b948e29","resolution":{"observed_at":"2026-08-07T12:48:51.964061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:59.492381Z","title":null,"venue":null,"work_id":"66f44775-472a-425d-9eb4-a2b869b3aabe","year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.147488Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:d95168ce8744913fe2246c5d451afabb37dac535e2ea4c38370422a796737110","observation_id":"db0e28d8-1cfa-40fa-a469-aa79a0625070","resolution":{"observed_at":"2026-08-07T12:48:59.602562Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14867","last_updated":"2024-06-03T16:59:20Z","snapshot_observed_at":"2026-08-16T14:32:08.254607Z","submitted_at":"2023-12-22T17:45:19Z","title":"VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14867","snapshot_observed_at":"2026-08-07T12:48:52.532034Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.532034Z"},"links":{"cited_paper":"/paper/2312.14867","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:8af6720ab950c0bb501e479dfcfeeae0645fabe8db254e0274dd92c01d2cce1c","observation_id":"ad65a177-2452-4707-8dac-e53ac9c1a002","resolution":{"observed_at":"2026-08-07T12:48:52.532034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:59.267649Z","title":null,"venue":null,"work_id":"8e7aaf02-a708-49d4-a442-acd2f0388190","year":2023},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.666804Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:513f41b87ab6f46654d8a1a795a15e7eabbea5bd3281f402900ed6626665e08e","observation_id":"b14e1c6f-fc45-420c-b189-7e1c833fb11e","resolution":{"observed_at":"2026-08-07T12:48:59.339026Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13920","last_updated":"2025-01-23T18:58:33Z","snapshot_observed_at":"2026-08-16T08:12:38.083229Z","submitted_at":"2025-01-23T18:58:33Z","title":"IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models","version":1},"cited_work":{"arxiv_id":"2501.13920","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13920","snapshot_observed_at":"2026-08-07T12:48:57.874105Z","title":"IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models","venue":"cs.CV","work_id":"d13fed39-aac8-48de-92b1-abf882b49a09","year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.817656Z"},"links":{"cited_paper":"/paper/2501.13920","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:09dc18bd61f031900dae355f366aa64d9a28f59191df92a3e4ef7d92b8e369d3","observation_id":"43c04451-4193-4182-b1fc-579930d9d841","resolution":{"observed_at":"2026-08-07T12:48:57.976466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-08-16T13:41:21.785733Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-07T12:48:52.975148Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.975148Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:29acce18bb47e49b8ac5b636cf804274599a7bb061b94428dfed35f5e1b235e3","observation_id":"836d8399-db45-4cb3-84f0-0bbc4b029464","resolution":{"observed_at":"2026-08-07T12:48:52.975148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19312","last_updated":"2025-03-25T03:18:46Z","snapshot_observed_at":"2026-08-16T12:47:07.583876Z","submitted_at":"2025-03-25T03:18:46Z","title":"ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19312","snapshot_observed_at":"2026-08-07T12:48:53.157072Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.157072Z"},"links":{"cited_paper":"/paper/2503.19312","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:31afc372fba603bb91430c3a7e44209c5a4f97c7cae750fd8b8e0291d57932e8","observation_id":"723ce008-02c0-4df6-8f68-b18827866cb5","resolution":{"observed_at":"2026-08-07T12:48:53.157072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16056","last_updated":"2022-10-28T11:07:48Z","snapshot_observed_at":"2026-08-16T16:20:23.198894Z","submitted_at":"2022-10-28T11:07:48Z","title":"MagicMix: Semantic Mixing with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16056","snapshot_observed_at":"2026-08-07T12:48:53.295857Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.295857Z"},"links":{"cited_paper":"/paper/2210.16056","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:1830ff899d63d6e38d05acca983ce741cb0ba9f0d1aee042910f52ee0f8b595a","observation_id":"33189b65-b17b-43ee-a9e5-0152e6f44c30","resolution":{"observed_at":"2026-08-07T12:48:53.295857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:53.425939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.425939Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:a4e51549a71a501c45b2c686d2c66655de53f4bee266c48df27d68be58350ced","observation_id":"5b8a8ef9-cba3-48d6-b038-4acffd83eaa5","resolution":{"observed_at":"2026-08-07T12:48:53.425939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-10T13:06:17.421919Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-07T12:48:53.577654Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.577654Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:861feb22292e230e32b5594bc9d87a863ededb1c5a2417c002e26c2dbafc0ff9","observation_id":"b30cb2e3-9dc7-4397-ad67-4a745b572ff1","resolution":{"observed_at":"2026-08-07T12:48:53.577654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:53.747961Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.747961Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:38dbc6365fa4ff7bb3e0d65a6c612b180b53681da8c28bf0659a8b13e8cb2bbb","observation_id":"e55c5242-413a-43ce-b7fa-cf86eb48aed6","resolution":{"observed_at":"2026-08-07T12:48:53.747961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:59.070704Z","title":null,"venue":null,"work_id":"9db856cb-92f0-4bb1-9168-c0e8ccff1814","year":2023},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.921825Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:202aa109281ff7b52a1baacfff4b9ddda83d2bb1e55acb1e9c963879a260e3a3","observation_id":"adda8c30-b5c0-439a-a532-f3d0e4ca0885","resolution":{"observed_at":"2026-08-07T12:48:59.129969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07767","last_updated":"2025-03-23T08:10:56Z","snapshot_observed_at":"2026-08-17T07:14:06.893038Z","submitted_at":"2024-12-10T18:59:31Z","title":"Learning Visual Generative Priors without Text","version":3},"cited_work":{"arxiv_id":"2412.07767","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.07767","snapshot_observed_at":"2026-08-07T12:48:57.600976Z","title":"Learning Visual Generative Priors without Text","venue":"cs.CV","work_id":"3ff58f49-86f3-4556-8a56-03117c0f0644","year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.032525Z"},"links":{"cited_paper":"/paper/2412.07767","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:34d6b476af08920e42e43b8ebdf206aa7ceddbd69f2895ea2245617977f560a7","observation_id":"05868bab-5a3c-4920-9e7d-12d77b8175ba","resolution":{"observed_at":"2026-08-07T12:48:57.707197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:54.106454Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.106454Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:43227bae4c9e3a1ada3b1d37d2a8effce4f3bc205f2ba99e5e478b4708b00b37","observation_id":"da3143c8-41f6-45b9-bec3-a3a40a0ef15f","resolution":{"observed_at":"2026-08-07T12:48:54.106454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-16T12:51:32.079370Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-07T12:48:54.317434Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.317434Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:63222623c303e04fc28f478c4356141599b78844e0c201c31df29d813baeb0ef","observation_id":"40408198-a49f-43fc-85d5-d6426c2ed649","resolution":{"observed_at":"2026-08-07T12:48:54.317434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-16T12:46:11.822024Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-08-07T12:48:54.580086Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.580086Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:e44cbc687e7ce610a942705385c34f7b55dc15cf53897835ad23893d99abb9c0","observation_id":"cf20f87c-f19c-496c-a84b-2ac9f43a21e6","resolution":{"observed_at":"2026-08-07T12:48:54.580086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:58.904163Z","title":null,"venue":null,"work_id":"e47d94ec-f774-4553-80ac-d6291b1a92a5","year":2022},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.692540Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:182e06c9f93424cefac761d38ee06b03870c515321289b35be3086a6d66c2012","observation_id":"17673e44-7f71-446b-bef4-7adb5565277b","resolution":{"observed_at":"2026-08-07T12:48:58.969246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T12:48:54.855706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.855706Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:0fd6eae3cd0b744055bc55bc21d548d16ab07d6c515af4d0784a443f130383ce","observation_id":"37859dc6-6fc7-41fa-a920-6b90ec0d4b14","resolution":{"observed_at":"2026-08-07T12:48:54.855706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-08-16T14:32:51.503158Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-07T12:48:55.005689Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.005689Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:9777871b5b7b8cbf0fff635e7fd378a278a79d1bf81bb6f29bdc373c25498d2a","observation_id":"c2c0e2d7-3117-4f63-9400-0e3e1d0fe880","resolution":{"observed_at":"2026-08-07T12:48:55.005689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-07T12:48:55.111828Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.111828Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:bcdbdd5c03c15c1e1463192427fb145aaa8daf8b6f511a16b882fab14e32034c","observation_id":"15fe29a9-c656-48bc-91ee-f800647ce3f3","resolution":{"observed_at":"2026-08-07T12:48:55.111828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:55.192746Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.192746Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:8c3a01b1957ac4851009c064fe281d80b7b97975defbfb1f12dbb16f0f25f040","observation_id":"03b63b66-149e-47b7-98ee-befe15c591cd","resolution":{"observed_at":"2026-08-07T12:48:55.192746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T12:48:55.384624Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.384624Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:fb1d65fcd91573483901828c3503178f6dfb16d9b19efcf0b73889b18282bb02","observation_id":"e33e3d93-ec1e-49a8-9ef6-5bc9596101ba","resolution":{"observed_at":"2026-08-07T12:48:55.384624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:58.730268Z","title":null,"venue":null,"work_id":"b0638794-0521-48a6-9e2c-9fa71f89d963","year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.514454Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:284cc2950469ef1e0f34c939dc8053535c4c8527689624591f3adee0d106f29b","observation_id":"fdb135d6-f843-4d5f-ae9b-5688fdadfc0c","resolution":{"observed_at":"2026-08-07T12:48:58.803715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T12:48:55.567187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.567187Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:ebd00a6ec8a4a648204184fdcfd34b2d43ac55b60177bb8ecbf5940e2de5c3e4","observation_id":"d961166e-2c35-4e17-a820-a5fe76732e65","resolution":{"observed_at":"2026-08-07T12:48:55.567187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14339","last_updated":"2024-08-26T15:08:12Z","snapshot_observed_at":"2026-08-16T13:23:47.424385Z","submitted_at":"2024-08-26T15:08:12Z","title":"ConceptMix: A Compositional Image Generation Benchmark with Controllable Difficulty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14339","snapshot_observed_at":"2026-08-07T12:48:55.570907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.570907Z"},"links":{"cited_paper":"/paper/2408.14339","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:87109791bce7b2b4fdb1cac9a04b9459b83e716cc9e004d2e308ed514623def3","observation_id":"9a7f49e9-8af9-4f8d-afc6-7bba26078876","resolution":{"observed_at":"2026-08-07T12:48:55.570907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-16T13:17:46.268142Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-07T12:48:55.618522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.618522Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:59d946ea93bd4a22ae4820e6e8119ecb21f11ada754abddfd0adcb73e913c3f1","observation_id":"2bee3ea4-59db-4fb9-9590-684383f90c07","resolution":{"observed_at":"2026-08-07T12:48:55.618522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-13T17:55:42.231540Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-07T12:48:55.829535Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.829535Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:d0f073af2f5ecef561c74ab61dbcc01e7a0b673e5bc1eb940c68962e55fc9f36","observation_id":"2898c4ff-0a6a-4f53-acae-e0166b00442a","resolution":{"observed_at":"2026-08-07T12:48:55.829535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T12:48:55.954212Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.954212Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:f5b24ba13e9c759efb0deba7e05ce8ffb9725f4cf2afd270c1a480385ec26d1e","observation_id":"2bd8c5a0-ceba-4d35-8cd3-c01cec3ba9e4","resolution":{"observed_at":"2026-08-07T12:48:55.954212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02015","last_updated":"2024-01-04T01:10:56Z","snapshot_observed_at":"2026-08-16T14:29:58.782661Z","submitted_at":"2024-01-04T01:10:56Z","title":"Improving Diffusion-Based Image Synthesis with Context Prediction","version":1},"cited_work":{"arxiv_id":"2401.02015","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02015","snapshot_observed_at":"2026-08-07T12:48:57.219105Z","title":"Improving Diffusion-Based Image Synthesis with Context Prediction","venue":"cs.CV","work_id":"7a8be654-1536-409e-949a-2538abe940fb","year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.036754Z"},"links":{"cited_paper":"/paper/2401.02015","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:21836049d987f80a063e8560e8edb9919989311c461fe133d0bb935f22000416","observation_id":"c40b6fc4-a2da-4dcb-8750-19d86b2d9706","resolution":{"observed_at":"2026-08-07T12:48:57.320478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01181","last_updated":"2024-08-02T11:03:22Z","snapshot_observed_at":"2026-08-16T13:28:59.406369Z","submitted_at":"2024-08-02T11:03:22Z","title":"VAR-CLIP: Text-to-Image Generator with Visual Auto-Regressive Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01181","snapshot_observed_at":"2026-08-07T12:48:56.108385Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.108385Z"},"links":{"cited_paper":"/paper/2408.01181","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:473f18877bc8cf3dfe1efd666517333f0951b5ac2347fcc511b74d01112e1726","observation_id":"9f2adca5-024e-4b9b-bbc3-bf397071ab34","resolution":{"observed_at":"2026-08-07T12:48:56.108385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02826","last_updated":"2025-05-27T15:54:58Z","snapshot_observed_at":"2026-08-16T12:44:10.399972Z","submitted_at":"2025-04-03T17:59:56Z","title":"Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02826","snapshot_observed_at":"2026-08-07T12:48:56.234527Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.234527Z"},"links":{"cited_paper":"/paper/2504.02826","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:ff97cfd929f452415c4003cb0027916fa448c853b25e833eb86c8b0bfd4c1d30","observation_id":"7d178482-6428-4976-96ef-9290457b12da","resolution":{"observed_at":"2026-08-07T12:48:56.234527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T12:48:56.360167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.360167Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:fab60ff35e4690e42a3aed412c37b795cfa6f8f1b3c34b9709285ba808838b28","observation_id":"eee34671-3498-47ed-bd10-555b3b04761a","resolution":{"observed_at":"2026-08-07T12:48:56.360167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10291","last_updated":"2025-04-17T08:31:14Z","snapshot_observed_at":"2026-08-16T13:09:42.598115Z","submitted_at":"2024-10-14T08:45:35Z","title":"Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective","version":4},"cited_work":{"arxiv_id":"2410.10291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10291","snapshot_observed_at":"2026-08-07T12:48:56.882097Z","title":"Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective","venue":"cs.CL","work_id":"cf9ad812-b334-4d36-b0b1-d3d34770a02f","year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.454870Z"},"links":{"cited_paper":"/paper/2410.10291","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:ded21fd4f1f2b524e45c70ccbaa19af06b16a1192cf654581afb1033f9436165","observation_id":"c8d31cea-5951-4100-ab35-8c0f3b4a3ad4","resolution":{"observed_at":"2026-08-07T12:48:57.030869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:56.601294Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.601294Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:953b734b19410045a6b1b96b68a1d1c086b11eab55aef0840977434bc42229f6","observation_id":"b556ee5a-ae57-4893-8b1e-1f03754f9921","resolution":{"observed_at":"2026-08-07T12:48:56.601294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:56.713041Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:56.713041Z"},"links":{"citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:5888803fca82259ad8641e75a299a65bd58359ca14c90a2f15946e728c7818da","observation_id":"c5e8baea-0cc1-4bb7-b1a2-1d462c9be9bf","resolution":{"observed_at":"2026-08-07T12:48:56.713041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 3 inbound Pith citation observations for arXiv:2505.23493."}