{"as_of":"2026-08-09T04:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6b3183ae9f82ec3c2edd00bdc8a0676447b3f31d757d3fe9a4e14ad15a386a9","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:39.125513Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04436/citation-record","integrity":"/paper/2608.04436/integrity","json":"/paper/2608.04436/citation-record.json","paper":"/paper/2608.04436"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.18730","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18730","snapshot_observed_at":"2026-08-07T00:15:41.320900Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","venue":"cs.CV","work_id":"71aeb9d3-821b-4452-a5a3-3a4421b74062","year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.003251Z"},"links":{"cited_paper":"/paper/2505.18730","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:0b44312d155e2f994bfda8e7d9ae471e4bbc74426b052f1d8d3a1ad702242356","observation_id":"f4cced5a-a747-4f11-ab60-922e101f0195","resolution":{"observed_at":"2026-08-07T00:15:41.386031Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-07T00:15:37.175322Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.175322Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:64182b7a23e77042cc96c3097662e80c78a50cd1460dca02bb37ac75833c1a97","observation_id":"589322b1-f649-457a-802b-72c2b985e498","resolution":{"observed_at":"2026-08-07T00:15:37.175322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T00:15:37.290999Z","title":"Pixart-α: Fast training of diffusion transformer for photorealistic text-to-image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.290999Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:183d33c65394b2ec36e6298470e7308389763eaf50e1219604228ed6dae57b8d","observation_id":"304b4280-e528-4849-a48b-0aab005f9f19","resolution":{"observed_at":"2026-08-07T00:15:37.290999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:37.407731Z","title":"Unify-agent: A unified multimodal agent for world-grounded image synthesis, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.407731Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:6592de60b131077ca1c3c4dd868df75a9e070caa74c3bfcbd121288999154325","observation_id":"bd365d23-98d6-4c9b-b397-2e92feba0156","resolution":{"observed_at":"2026-08-07T00:15:37.407731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21605","last_updated":"2026-05-22T02:16:59Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:12:29Z","title":"GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21605","snapshot_observed_at":"2026-08-07T00:15:37.549104Z","title":"Genevolve: Self-evolving image generation agents via tool-orchestrated visual experience distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.549104Z"},"links":{"cited_paper":"/paper/2605.21605","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:fff9d5110db153997d60b1482da140447993c1ef34e93a65e3b9204d1cbb609e","observation_id":"653e64f5-e909-4828-89fa-a148fcc84429","resolution":{"observed_at":"2026-08-07T00:15:37.549104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14491","last_updated":"2022-11-22T02:09:38Z","snapshot_observed_at":"2026-08-03T22:24:49.500281Z","submitted_at":"2022-09-29T00:57:28Z","title":"Re-Imagen: Retrieval-Augmented Text-to-Image Generator","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14491","snapshot_observed_at":"2026-08-07T00:15:37.706082Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.706082Z"},"links":{"cited_paper":"/paper/2209.14491","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:b44415abbd346aed3a873fedaadd87207ada6b31384a608fe635e10a123408fa","observation_id":"0cbe4b8d-b2e4-4b47-8431-493a4cf4bce4","resolution":{"observed_at":"2026-08-07T00:15:37.706082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T00:15:37.847345Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.847345Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:8a9bad2aa8e893c23f6ae22334a8e80f80848f61778d45475bfd84fb0a66f341","observation_id":"045cae11-6dd4-45f1-ab2b-70bb179ab2f9","resolution":{"observed_at":"2026-08-07T00:15:37.847345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-07T15:13:13.622286Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-07T00:15:37.958795Z","title":"Emu3.5: Native multimodal models are world learners, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.958795Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:d0c6ecf4724bf96074cfae9a66982564d3622438088ca442468a0def1b35554f","observation_id":"3ae2b93c-2391-4649-8aea-bf48113677a2","resolution":{"observed_at":"2026-08-07T00:15:37.958795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-07T00:15:38.098358Z","title":"Emerging properties in unified multimodal pretraining, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.098358Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:406e4b959f473d939a0d34706cd26b1049204e0a90f3f5e3bd530a089e232aea","observation_id":"3081dbd7-c498-4520-b610-47e6b2990731","resolution":{"observed_at":"2026-08-07T00:15:38.098358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28767","snapshot_observed_at":"2026-08-07T00:15:38.217313Z","title":"Gen-searcher: Reinforcing agentic search for image generation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.217313Z"},"links":{"cited_paper":"/paper/2603.28767","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:43aba8c29f75a65e1d98ad9209e2f6361335c2875b358ac9da17f30aabf58211","observation_id":"97a849ac-d1d9-43d2-beea-addf51bf98d6","resolution":{"observed_at":"2026-08-07T00:15:38.217313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07546","last_updated":"2024-08-12T19:33:52Z","snapshot_observed_at":"2026-07-06T18:29:08.586253Z","submitted_at":"2024-06-11T17:59:48Z","title":"Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07546","snapshot_observed_at":"2026-08-07T00:15:38.364743Z","title":"Commonsense-t2i challenge: Can text-to- image generation models understand commonsense?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.364743Z"},"links":{"cited_paper":"/paper/2406.07546","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:ec34355440adf390d8fb367f9d01bcf2892a18b91148ea0ee2733f4e70283049","observation_id":"b8e6eff9-412a-43a9-9940-376db9b11c24","resolution":{"observed_at":"2026-08-07T00:15:38.364743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09595","last_updated":"2025-07-13T11:51:53Z","snapshot_observed_at":"2026-08-06T17:49:37.795167Z","submitted_at":"2025-07-13T11:51:53Z","title":"Demystifying Flux Architecture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09595","snapshot_observed_at":"2026-08-07T00:15:38.504110Z","title":"Demystifying flux architecture, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.504110Z"},"links":{"cited_paper":"/paper/2507.09595","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:a010bf0a4e7eae3a8212a20357733756548caffab5cd1e17198a9cad74837c39","observation_id":"5da3c431-64e4-40f9-8d53-0f79d2030517","resolution":{"observed_at":"2026-08-07T00:15:38.504110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.622986Z","title":"Beyond words and pixels: A benchmark for implicit world knowledge reasoning in generative models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.622986Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:e39fa8d252fe6b1827a386a8ae07c3908612e9355bc334b4dc06f7ab47e7caec","observation_id":"fe808141-0b6a-4c12-9b3f-0087ebacd1b8","resolution":{"observed_at":"2026-08-07T00:15:38.622986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11824","last_updated":"2025-07-28T09:36:29Z","snapshot_observed_at":"2026-07-06T19:34:01.458836Z","submitted_at":"2024-10-15T17:50:37Z","title":"KITTEN: A Knowledge-Intensive Evaluation of Image Generation on Visual Entities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11824","snapshot_observed_at":"2026-08-07T00:15:38.757043Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.757043Z"},"links":{"cited_paper":"/paper/2410.11824","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:7e2ee0041d53cfcfb75bcf1adedbb1fea2b423e204fe3ba77dab209c7d4efeb1","observation_id":"11e6ce3e-d9fb-4fa3-bc0e-51dfd75a9153","resolution":{"observed_at":"2026-08-07T00:15:38.757043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.1334","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.151250Z","title":"T2i-factualbench: Benchmarking the factuality of text-to-image models with knowledge-intensive concepts","venue":null,"work_id":"ab0ae51e-69d8-4caf-a23d-3a5ac9329052","year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.850394Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:bcee91f07aa7d047a928319878e240fa4607f4afc50618172594cf8de27f7046","observation_id":"9dc6bc0e-8888-4669-a835-53b7bd753216","resolution":{"observed_at":"2026-08-07T00:15:39.164239Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.858364Z","title":"Genagent: Scaling text-to-image generation via agentic multimodal reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.858364Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:68fce0cdb6a0e9087b57e4719f18e655c74cf68ae6c773c455a3b67d82ffcc45","observation_id":"891bda99-d29c-4b28-9199-d231d78b09fd","resolution":{"observed_at":"2026-08-07T00:15:38.858364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-07T00:15:38.870713Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.870713Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:63caf90dbdd225b39e445f45394f6c112c38de478036d76e3a2bec4a07717f35","observation_id":"47b277f9-4a99-4dd6-8559-4ad526cc082a","resolution":{"observed_at":"2026-08-07T00:15:38.870713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05579","snapshot_observed_at":"2026-08-07T00:15:38.894887Z","title":"Llms-as-judges: A comprehensive survey on llm-based evaluation methods, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.894887Z"},"links":{"cited_paper":"/paper/2412.05579","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:8eb5ed8b9157685f681b2fb3d7eacc5cc0c29857715ea98ca561366c804def55","observation_id":"5ee90300-f5c7-4a68-8bda-cb214e044708","resolution":{"observed_at":"2026-08-07T00:15:38.894887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:42.674739Z","title":"Unigrpo: Unified policy optimization for reasoning-driven visual generation,","venue":null,"work_id":"1f746d27-6498-4b10-ab65-978e0561bbbb","year":null},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.913425Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:e5c20c007bdec68ca8c85547afb08894e5cad96acac30afa0d730e3e24e5d6b1","observation_id":"d4d414c5-45ac-4f32-bad0-65de41975c9c","resolution":{"observed_at":"2026-08-07T00:15:42.834847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.09538","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.883918Z","title":"Towards unified multimodal interleaved generation via group relative policy optimization, 2026","venue":null,"work_id":"071ffb58-cbed-4874-b65b-37fa383354b3","year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.958815Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:d163fc9a0703fbfcc097677b7b38a972c78695e20ced1a209ae9054e5308a1ee","observation_id":"83683b37-4165-45b9-8cf8-5a9dee1287ca","resolution":{"observed_at":"2026-08-07T00:15:40.087957Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-07T00:15:38.962629Z","title":"Wise: A world knowledge-informed semantic evaluation for text-to-image generation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.962629Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:5c040092e5c681d65a1df57a0b4b822a14e180746f5a4e390c399d68c57b6e9e","observation_id":"e96e6f37-f4f3-40cf-a77b-f52cbd65b9d6","resolution":{"observed_at":"2026-08-07T00:15:38.962629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T00:15:38.966639Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.966639Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:83ad1e69fe81096f7791548f88fcb7f0885e0cc75debd58fe18c7f1d80a6fd6b","observation_id":"ef9a1d55-f28e-4a1c-a270-35deafa9adec","resolution":{"observed_at":"2026-08-07T00:15:38.966639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.970501Z","title":"Bermano, and Ohad Fried","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.970501Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:5c337a70589af95e996639a5e13f91658983afe68ed77b17cfdfc9e1a10e11eb","observation_id":"025dd2f3-746e-4a69-ba7d-718778b2484f","resolution":{"observed_at":"2026-08-07T00:15:38.970501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T00:15:38.979572Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.979572Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:4670686fb7b777aae237af99e57c35d18467516b39f201acb95feaeb921da96d","observation_id":"30ab19c4-b198-439d-8c3e-29f1c3803536","resolution":{"observed_at":"2026-08-07T00:15:38.979572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17005","last_updated":"2025-05-22T17:58:26Z","snapshot_observed_at":"2026-08-08T00:22:35.765951Z","submitted_at":"2025-05-22T17:58:26Z","title":"R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17005","snapshot_observed_at":"2026-08-07T00:15:38.984695Z","title":"R1-searcher++: Incentivizing the dynamic knowledge acquisition of llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.984695Z"},"links":{"cited_paper":"/paper/2505.17005","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:b43fcc1cf4bf5ffc8890922f5bf595ed9d5004aa6974d851260bc4ed6c3c03a8","observation_id":"aa9dca68-a0df-46d2-9ece-67f68e64cd7d","resolution":{"observed_at":"2026-08-07T00:15:38.984695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-07T00:15:38.987981Z","title":"Longcat-image technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.987981Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:587503d991d10f445129a352ac72bc831a40a3561c5a5060d1bcc45cce512104","observation_id":"8691bc38-f3cb-4d90-83b1-b31ccbf23de2","resolution":{"observed_at":"2026-08-07T00:15:38.987981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23951","snapshot_observed_at":"2026-08-07T00:15:38.991808Z","title":"Hunyuanimage 3.0 technical report, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.991808Z"},"links":{"cited_paper":"/paper/2509.23951","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:1bf04858c9b96c7457d73ae0d36dee8555bef76be241028bf9bcf718b184530d","observation_id":"1b9ca539-0aea-46de-8e61-2dd5e3472e48","resolution":{"observed_at":"2026-08-07T00:15:38.991808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05382","last_updated":"2026-07-24T20:32:35Z","snapshot_observed_at":"2026-08-05T09:49:25.195615Z","submitted_at":"2026-07-06T17:56:12Z","title":"Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation","version":4},"cited_work":{"arxiv_id":"2607.05382","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.05382","snapshot_observed_at":"2026-08-07T00:15:39.563813Z","title":"Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation","venue":"cs.CV","work_id":"e13bf881-95ff-4c41-ac6b-0800bab22465","year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.009144Z"},"links":{"cited_paper":"/paper/2607.05382","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:e0a56d75b5c6e136a1e40e6a61b44a92f5edc2518c9a0f76ea79ac669e9c7257","observation_id":"a687681b-92c3-4b73-b4dd-56e7c1a35950","resolution":{"observed_at":"2026-08-07T00:15:39.574168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T00:15:39.013329Z","title":"Emu3: Next-token prediction is all you need, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.013329Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:733c7ac8737a98a3406ee956335875c2081ac63d26e317e9141f4039b76c6043","observation_id":"b5b9e53c-ae7a-464c-b324-a1d7306013f5","resolution":{"observed_at":"2026-08-07T00:15:39.013329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-07T00:15:39.016775Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.016775Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:aafaf6b3732734ea1331f20b7c7ea2089504f59b4a8ad738b3224966c9d5719e","observation_id":"93e2c5a1-8cc8-4bed-ba3c-0eea7571ef07","resolution":{"observed_at":"2026-08-07T00:15:39.016775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08541","last_updated":"2024-08-14T17:43:25Z","snapshot_observed_at":"2026-08-04T18:22:59.333944Z","submitted_at":"2023-10-12T17:34:20Z","title":"Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08541","snapshot_observed_at":"2026-08-07T00:15:39.031010Z","title":"Idea2img: Iterative self-refinement with gpt-4v(ision) for automatic image design and generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.031010Z"},"links":{"cited_paper":"/paper/2310.08541","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:911928afa255dd755d66d6b2887f137cbde231aacef0c60dbc1c49ec9274874e","observation_id":"0f0591e6-38b2-4b0a-8b80-70f60dc6d1a1","resolution":{"observed_at":"2026-08-07T00:15:39.031010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T00:15:39.039044Z","title":"React: Synergizing reasoning and acting in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.039044Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:5bab5b2fa9b04d75baa1e9405f922d7f03cf444f9d7bbc9478571b65a3bd5546","observation_id":"d3b98ec3-f4b3-4feb-923e-446f55dac0ec","resolution":{"observed_at":"2026-08-07T00:15:39.039044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30248","last_updated":"2026-05-29T03:57:25Z","snapshot_observed_at":"2026-07-06T23:39:34.232661Z","submitted_at":"2026-05-28T17:13:18Z","title":"GenClaw: Code-Driven Agentic Image Generation","version":2},"cited_work":{"arxiv_id":"2605.30248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30248","snapshot_observed_at":"2026-08-07T00:15:39.449689Z","title":"GenClaw: Code-Driven Agentic Image Generation","venue":"cs.CV","work_id":"37384707-ea28-4399-af11-413b3d1e8698","year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.042271Z"},"links":{"cited_paper":"/paper/2605.30248","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:5545035acfbfb8bf8f0922cb196bdb29cfe6465816bc4b3563bc60c8a57dfcb8","observation_id":"fcfbedb8-094b-49bf-b0a2-18b471803ab6","resolution":{"observed_at":"2026-08-07T00:15:39.458384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.053450Z","title":"Genpilot: A multi-agent system for test-time prompt optimization in image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.053450Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:66c553c5d9058725478938eaa92991c2ecd2e216656d9090e391175f106772d9","observation_id":"f6985950-4be7-4ee9-b73b-1a47128f7bfc","resolution":{"observed_at":"2026-08-07T00:15:39.053450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01490","last_updated":"2025-05-02T17:59:06Z","snapshot_observed_at":"2026-08-07T15:56:58.971781Z","submitted_at":"2025-05-02T17:59:06Z","title":"WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01490","snapshot_observed_at":"2026-08-07T00:15:39.056728Z","title":"Worldgenbench: A world-knowledge-integrated benchmark for reasoning-driven text-to-image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.056728Z"},"links":{"cited_paper":"/paper/2505.01490","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:b5a662f5b624d18bc680a2d4b0e54a1be7e8c545dc233d4a4ebc2e0dcb8253d7","observation_id":"ae267b74-6094-4415-a9d5-4277b5df018e","resolution":{"observed_at":"2026-08-07T00:15:39.056728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26907","last_updated":"2026-06-26T14:10:09Z","snapshot_observed_at":"2026-08-07T03:18:39.904639Z","submitted_at":"2026-06-25T11:40:12Z","title":"Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation","version":2},"cited_work":{"arxiv_id":"2606.26907","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.26907","snapshot_observed_at":"2026-08-07T00:15:39.331735Z","title":"Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation","venue":"cs.CV","work_id":"ed860572-a609-4f12-b4e3-6f75764a4f01","year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.060537Z"},"links":{"cited_paper":"/paper/2606.26907","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:c009dc3877017ae977626e57b6c5f397f3d232d4b0953e371971154863ddf9f6","observation_id":"7aaedbb5-5bfc-4fec-8a90-e714d7e0ea61","resolution":{"observed_at":"2026-08-07T00:15:39.339882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.074996Z","title":"\"\"You are a","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.074996Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:e7cd5f9be6b184f6e638581a3b4722eab0abd0d72ce644a2724bb59807e8a310","observation_id":"9ee431e9-9018-4bfd-899a-05fac29ca45b","resolution":{"observed_at":"2026-08-07T00:15:39.074996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:42.294000Z","title":null,"venue":null,"work_id":"3342d3a7-bd8b-46d7-917b-fc90663c6a35","year":null},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.080550Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:73c4996d6ecf74cd283a6f0f2007cf3901baa7062714a5c046ee5bc779f1941d","observation_id":"a1b30b39-cfc0-49f3-b8f3-a70246623dcb","resolution":{"observed_at":"2026-08-07T00:15:42.490196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:42.075797Z","title":"according to the document","venue":null,"work_id":"042cb7fc-a3d1-436b-8eef-2a8364c57c51","year":null},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.094934Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:097c5e5e65b8f72bdf6b7989b66111400ca4361c05cbb888033702d3146f5dd2","observation_id":"9c5b5567-0bfb-4219-8122-0e2496dba551","resolution":{"observed_at":"2026-08-07T00:15:42.175268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:41.814294Z","title":null,"venue":null,"work_id":"8cc211c4-c660-4c06-9b4e-b309ba45d51e","year":null},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.117117Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:b136fd7326b87b490a4c2991f239005ea588cc060f175a79c01b43c9880c74b7","observation_id":"6fec7dc4-0cd6-4b21-9692-0984b3ba3fbf","resolution":{"observed_at":"2026-08-07T00:15:41.934761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:41.526065Z","title":"Avoid being overly vague","venue":null,"work_id":"eb500530-9974-41f8-876a-951e911d41dd","year":null},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.121702Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:c6e23d8fa79ad45998eb7ba8454640e4ca2664755af40c83de1041392ad369ce","observation_id":"6a98c200-8729-4518-b91b-59a22722cbd3","resolution":{"observed_at":"2026-08-07T00:15:41.657398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6752.3141","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.237479Z","title":"name\": \"text_search","venue":null,"work_id":"f4b42d95-ec65-4f46-84b1-f672ebea85ad","year":1975},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.125513Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:686b8226f534057d2c8198441329ca4e8cc43fb0fa0b49c2f70620d516303585","observation_id":"cef43b31-d857-4142-ab78-f47d9a09ada4","resolution":{"observed_at":"2026-08-07T00:15:39.243712Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.947081Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.947081Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:34adcd2f1239beff1fbbea39b731c13190e9cf827193c7cf4052e2c803a23b8a","observation_id":"07d4a842-96f5-4ece-890f-2afc96a33d97","resolution":{"observed_at":"2026-08-07T00:15:38.947081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:11:40.624914Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":6,"verified_fuzzy":3},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2608.04436."}