{"as_of":"2026-08-17T19:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c6e9a7a2d39bd2a4349127934e3788028261206450270f8fbc88183822d4bfd","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T05:16:43.756525Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.21090/citation-record","integrity":"/paper/2605.21090/integrity","json":"/paper/2605.21090/citation-record.json","paper":"/paper/2605.21090"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:d9e2351f167696af6a6c0ee9e4a1339d50f91f80b3200ef882dd38cdf1d34d01","observation_id":"3032792d-d2eb-4cd1-907d-c7ee7ebdc27f","resolution":{"observed_at":"2026-05-21T05:19:39.403523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.546729Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"182396b0-39b5-4e35-adfd-c6dbe856535f","year":2023},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:e90a659b1506b4b22d6701fa428b46a9621b3ce4154839c6d359de71e18cd606","observation_id":"06e32318-9ad1-46cd-b1c6-2256ce4dbbb6","resolution":{"observed_at":"2026-05-21T05:24:39.866709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:13:45.233244Z","title":"Textdiffuser: Diffusion models as text painters.Advances in Neural Information Processing Systems, 36:9353– 9387","venue":null,"work_id":"496da14d-c548-4a42-9bfc-547df0e34e7c","year":2023},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:242982f24efcf427545f2d7e48bf62fcd20871a6ca3b8ef9157a2f023b6223fb","observation_id":"90d53b30-32de-4d92-be47-3e498619acce","resolution":{"observed_at":"2026-05-21T05:24:39.860686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paddleocr 3.0 technical report","venue":null,"work_id":"5199cc31-0f8a-4bd6-ae73-14033ec356c3","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:afd16561d292fc93d0546dbd73742591b0cde844e2ca26f4134f7acf48ea6c22","observation_id":"9eea23af-0979-4c8f-90a6-446f828863af","resolution":{"observed_at":"2026-05-21T05:24:39.864660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:6d047fe0d7b3e6da33c1c336f301f57a890d4872de001c9f7960badaba4e6b85","observation_id":"e880fb75-7176-44fb-bcbf-ac24bb537257","resolution":{"observed_at":"2026-05-21T05:19:39.390736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nano banana pro - gemini ai image generator & photo editor","venue":null,"work_id":"4fefe9b7-f4c9-4126-aa52-71fc8003ffd2","year":null},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:42680502e332c36c9da2a0e9cf0f1b020d8894d2863aa591a1e8b3045a2f5b9e","observation_id":"f6417d4b-7382-4cdb-8493-da36765d98db","resolution":{"observed_at":"2026-05-21T05:24:39.868713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:98163e33ff93eeef6c543345d4711ab55fffe2a169f95ee4a4bf3978853b8cee","observation_id":"e7e00a78-0c6c-4903-9cb1-0d95b694a8cc","resolution":{"observed_at":"2026-05-21T05:19:39.396867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23461","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:58.047391Z","title":"Textcrafter: Accurately rendering multiple texts in complex visual scenes","venue":null,"work_id":"4d349026-15b1-433b-ace5-5104109b2bef","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:127cf7f474d693c01d3fd36a60d2acf269232de70a2818bc75eb5e09f4ab0b60","observation_id":"851455f0-8f93-4f71-8741-3524b080d5ee","resolution":{"observed_at":"2026-05-21T05:19:39.400471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datacomp: In search of the next generation of multimodal datasets.Advances in Neural Information Processing Systems, 36:27092–27112","venue":null,"work_id":"d243f71d-caba-42b4-a017-27bc255b8c92","year":2023},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:5719c85e3f24d8050f133b2e5f2384196e8ded7a844596721e9476d807c79e14","observation_id":"658faa31-fde0-47d4-b7d2-c11446c5ae24","resolution":{"observed_at":"2026-05-21T05:24:39.870640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seed-data-edit technical report: A hybrid dataset for instructional image editing","venue":null,"work_id":"16f8c9f1-96b3-469a-ad1a-331abd293e98","year":2024},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:ee8a147266aabf710bb0f0fc19dd3478554ca14e863a809cb47941b6a74f0048","observation_id":"c83a9311-9a2a-4a72-abb6-86654b8514fc","resolution":{"observed_at":"2026-05-21T05:24:39.862803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-15T19:53:33.201174Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"cited_work":{"arxiv_id":"2507.22058","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22058","snapshot_observed_at":"2026-07-04T13:39:51.493261Z","title":"X-omni: Reinforcement learning makes discrete autoregressive image generative models great again","venue":null,"work_id":"3ee0ee57-31b9-49d4-98fc-c12c499a14b9","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2507.22058","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:2946624333dead901bf16de696fba0fe4d738d97a226c94f2c5a77188dd09861","observation_id":"77ed8e33-4fab-48c3-a683-ab77626e93c3","resolution":{"observed_at":"2026-05-21T05:19:39.340658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Texteditbench: Evaluating reasoning-aware text editing beyond rendering","venue":null,"work_id":"d7b87af0-dde8-4d2a-8ea6-621b9164ef07","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:25334b747312d59f965a94ee8456930fa0d4d0f495c14f17392e649cf5d852e3","observation_id":"7d7a0ee5-87fa-46e6-9a86-ba0de6c37583","resolution":{"observed_at":"2026-05-21T05:19:39.369834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:10:44.809615Z","title":"Smartedit: Exploring complex instruction-based image editing with multimodal large language models","venue":null,"work_id":"416b7995-18f5-49d6-9418-df4cd94a8244","year":2023},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:e67ca28c3754b7c3031878b59031bf2deff6e0638aa1aff19fb24b2e9915df08","observation_id":"525f4746-65cd-437e-afeb-d117b7d54737","resolution":{"observed_at":"2026-05-21T05:24:39.852030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hq-edit: A high-quality dataset for instruction-based image editing","venue":null,"work_id":"79e25f94-c6c9-4c7d-95e0-5f0ab38ae2cf","year":2024},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:e2773a3693ec385dc07aa0e5d4c4403ad8b854216a9760527ecdab204dec862b","observation_id":"53831b51-b48c-4a94-9d49-f7c81da6790c","resolution":{"observed_at":"2026-05-21T05:24:39.854006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.23568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.812115Z","title":"Thinkgen: Generalized thinking for visual generation","venue":null,"work_id":"e7b9510c-c818-4bbc-9fcd-2a330175af26","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:4ad1369a241571d187e19a86146772bf71512186e8dd6fbd0ae23d4d1a80bdbb","observation_id":"553ab99f-c689-455d-818d-7797e3dce85d","resolution":{"observed_at":"2026-05-21T05:19:39.361154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception.Advances in Neural Information Processing Systems, 37:18535–18556","venue":null,"work_id":"898264ee-0030-4a7f-b1ac-e12a323e3df8","year":2024},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:cb2fac1a0392d030d493b9589e69cbb185c186a7385250f75de7f6387df3295d","observation_id":"b3ad57e8-d10a-4080-a380-7ab5e895762c","resolution":{"observed_at":"2026-05-21T05:24:39.856260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-08-15T10:26:22.896514Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":"2504.17761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-10T01:46:41.223286Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","venue":"cs.CV","work_id":"3392f2c8-a1cb-4d6c-8c82-2cdccffa33f9","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:0b277627d0c1cbfc6596ce4cc5694d0ac864f660c9e9a6c8d210f872312737c7","observation_id":"412b2b29-e6fa-4ab8-9a42-4201cc6d76be","resolution":{"observed_at":"2026-05-21T05:19:39.334768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-5.2.https://openai.com/index/introducing-gpt-5-2/","venue":null,"work_id":"231f72ac-76f9-4e26-8c17-a0cec0f57340","year":null},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:5be3bbe7a4240ed6a7c5749f7b773e4de762bd13e881607bc6f01312272ed66e","observation_id":"bcae5455-e60a-4175-9e14-6569de74617e","resolution":{"observed_at":"2026-05-21T05:24:39.846371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing 4o image generation","venue":null,"work_id":"4ff779ce-8069-4c6b-9b63-61916e2e74e1","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:4cb586e9fb3442a59e4f2393e97a9d7176f54bb3ed9ed082d9cd6851bfc4c517","observation_id":"df7b3eb1-3c9f-4d26-bc0b-74ea491ffe1b","resolution":{"observed_at":"2026-05-21T05:24:39.837911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.19808","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T07:06:43.979452Z","title":"Pico-banana-400k: A large-scale dataset for text-guided image editing","venue":null,"work_id":"13101bd5-0123-4ec6-842d-132b042d2013","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:a0f7e6cf0046e627f6f9fc38e7618bc03422c4f6154d52a704ebe4e86e3e8c72","observation_id":"698ff842-6e83-41cf-81d4-10e5135f9288","resolution":{"observed_at":"2026-05-21T05:19:39.375644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20427","last_updated":"2025-12-10T16:37:54Z","snapshot_observed_at":"2026-08-13T15:50:14.892321Z","submitted_at":"2025-09-24T17:59:04Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","version":3},"cited_work":{"arxiv_id":"2509.20427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.20427","snapshot_observed_at":"2026-07-11T00:07:42.259448Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","venue":"cs.CV","work_id":"15c839a0-48a3-4218-82b6-cac5b7f66e13","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2509.20427","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:e5608c6a2f3731a2bbd383e9b9795d1cf3e1c7515a56a1430d5cb0e9c801d174","observation_id":"8fe427b1-bfd5-47f6-a2c3-63b5f2ebda10","resolution":{"observed_at":"2026-05-21T05:19:39.358116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-08-16T15:04:17.022785Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:39746b6f89ce05e3351bfa1f7f038678dd2a7df50f4786d0045fdc0636a53a65","observation_id":"ad4f41a2-5759-4c78-95e3-59860989fcc4","resolution":{"observed_at":"2026-05-21T05:19:39.364125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.13344","doi":"10.48550/arxiv.2602.13344","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Firered-image-edit-1.0 techinical report","venue":"Open MIND","work_id":"a5aa2473-f5d3-42f8-9a6c-4bff4cb94ac7","year":2026},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:308ea8e5b9b5bf397118a3e8f98ca52aecfa37a6f1f30a84b4e1b0a7ea6371ca","observation_id":"fa1b9d44-f257-4a89-a033-6b9897413f61","resolution":{"observed_at":"2026-05-21T05:19:39.367175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-16T18:20:01.123890Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:de8b5390d8a699e9b3e3bda3a0698b26f774f77f3c5fd641d431e4233e1e9296","observation_id":"93fe4d9c-ca9d-4f57-81ca-9437f9c2e4e9","resolution":{"observed_at":"2026-05-21T05:19:39.382658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-15T14:08:11.489191+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T14:08:11.489191+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03054","last_updated":"2024-02-21T07:12:45Z","snapshot_observed_at":"2026-08-16T14:45:42.266486Z","submitted_at":"2023-11-06T12:10:43Z","title":"AnyText: Multilingual Visual Text Generation And Editing","version":5},"cited_work":{"arxiv_id":"2311.03054","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03054","snapshot_observed_at":"2026-07-04T10:29:44.518677Z","title":"Anytext: Multilingual visual text generation and editing","venue":null,"work_id":"6ca52f26-db50-422e-86c6-89c334703122","year":2023},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2311.03054","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:b9ce5516be4f2ae0b3ffc22dbafef874d15c8734df1a7553c0da4ed4423cb913","observation_id":"b56b7d7c-64c9-49c4-9b6e-28b482781552","resolution":{"observed_at":"2026-05-21T05:19:39.352485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.07870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T07:16:44.596474Z","title":"Textatlas5m: A large-scale dataset for dense text image generation","venue":null,"work_id":"976bc5c4-edad-4331-8335-e538f135fe18","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:6d5d05ee346aadd18827bb54895aaea64fdf694e50a7e8bb64ea5d077cba38df","observation_id":"4962b327-e96a-4738-813d-5a3fa7b36bd1","resolution":{"observed_at":"2026-05-21T05:19:39.378530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructedit: Improving automatic masks for diffusion-based image editing with user instructions","venue":null,"work_id":"50b724c7-f1d1-4887-8a48-56347d98bf83","year":2023},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:80938d96f1547ca450601a5887e9978d5ec39d84645f547cb857ff6e58f996cc","observation_id":"53517340-c7df-4c5f-abc1-ac700c881d0f","resolution":{"observed_at":"2026-05-21T05:24:39.844168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21033","last_updated":"2025-07-28T17:54:04Z","snapshot_observed_at":"2026-08-12T23:50:24.433472Z","submitted_at":"2025-07-28T17:54:04Z","title":"GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset","version":1},"cited_work":{"arxiv_id":"2507.21033","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21033","snapshot_observed_at":"2026-07-04T10:09:44.737452Z","title":"Gpt-image-edit-1.5m: A million-scale, gpt-generated image dataset","venue":null,"work_id":"08f1d418-cbc2-4c3a-9ed7-5fcb38dc1241","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2507.21033","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:161d802a49ff8595595509286c7082047fc6ec7cc6d0ba65dcc9bb5d03b8c1eb","observation_id":"dedc9623-590f-480b-8b92-1112562b4e66","resolution":{"observed_at":"2026-05-21T05:19:39.343635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:ed24529cc529872856d4e171d57a6e57bd7a08038b5f21f4ec64643025b15f2a","observation_id":"c0e4f0df-4349-43a9-b60f-4e45e8b545dd","resolution":{"observed_at":"2026-05-21T05:19:39.349319Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:789c3b06769ca1e6f8f03ea8f2e0a0676fba78b32d39f54c4097b8af29586b6c","observation_id":"c3067916-5e3c-4624-9876-aeba1f467f30","resolution":{"observed_at":"2026-05-21T05:19:39.355311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnigen: Unified image generation","venue":null,"work_id":"fe6bd2bb-ee62-4596-b39f-d9282f65671a","year":2024},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:1beb54ef2b9851c4b2e08d951ae1cb6f008800b8acbc027b4c2a6b6ba9b6f84b","observation_id":"87dfed79-4629-4833-9c1c-6f8b31aa1abc","resolution":{"observed_at":"2026-05-21T05:24:39.848291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-16T09:12:52.847939Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:efc14b1a820a81d1e239acf4250428d4e975530538ae739ba7a312a9d0fe45d1","observation_id":"22edd390-9aec-43c3-90e6-85f988829d6e","resolution":{"observed_at":"2026-05-21T05:19:39.346678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":"2505.20275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-07-10T13:27:05.927875Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","venue":"cs.CV","work_id":"059b5c3a-404c-4d30-a631-68c1d88a08a7","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:fbfa2d3a3511ab86391511a232b87f63a6c76e7fa6ecf894e4adff50b49dc3d0","observation_id":"24ed30e2-ba21-4b0e-b88b-cd8a377d7f21","resolution":{"observed_at":"2026-05-21T05:19:39.386416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anyedit: Mastering unified high-quality image editing for any idea","venue":null,"work_id":"2ba754b0-6bda-4913-8235-16fd5e3e17da","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:606fd9395e05ad153ad6d0e5a3dffae79fda17650af68558d0fa03fdf99ba8c8","observation_id":"51e7453a-6ea4-47f2-9ca8-f80555b5b4dc","resolution":{"observed_at":"2026-05-21T05:24:39.850096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"cited_work":{"arxiv_id":"2603.11593","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.11593","snapshot_observed_at":"2026-07-20T03:19:15.682913Z","title":"Weedit: A dataset, benchmark and glyph-guided framework for text-centric image editing","venue":null,"work_id":"332d4cb2-01dd-4221-b10d-c05af70c6c22","year":2026},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2603.11593","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:6852052ad1981c73918ab65ccb5a210efc77d38c37b52fa360bb200c955dd627","observation_id":"df92818b-f87d-41e2-82f7-820b887676e6","resolution":{"observed_at":"2026-07-20T03:19:15.682913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing","venue":null,"work_id":"daff141d-15f9-494c-9eb0-8eddf8db2fcd","year":2024},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:f3219da1b900884e0e5c554602b48feab36dcecbf1d4b970ee43d2c6254ac29d","observation_id":"3faf826b-7a9f-485e-b21b-c598d9747528","resolution":{"observed_at":"2026-05-21T05:24:39.858375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:10:44.835687Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale","venue":null,"work_id":"edd511b5-9fb1-44a5-9f8c-4acb1e16ea68","year":2024},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:e9e265957388899d28de450799c17fcf0addeebad6cc06084cb66bc988520581","observation_id":"34bb7998-b72d-4589-9a73-37ce878c9062","resolution":{"observed_at":"2026-05-21T05:24:39.840162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21749","last_updated":"2025-03-27T17:56:15Z","snapshot_observed_at":"2026-08-16T12:46:12.294086Z","submitted_at":"2025-03-27T17:56:15Z","title":"LeX-Art: Rethinking Text Generation via Scalable High-Quality Data Synthesis","version":1},"cited_work":{"arxiv_id":"2503.21749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21749","snapshot_observed_at":"2026-07-02T07:16:44.582872Z","title":"Lex-art: Rethinking text generation via scalable high-quality data synthesis.arXiv preprint arXiv:2503.21749","venue":null,"work_id":"27ff3608-2b86-4bf4-ab6c-fdf6fd0388b3","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2503.21749","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:a178a7a7726d993d4aec37ade9e57e077a45eb744994957e32c81ca9108db2ee","observation_id":"5fd8d1df-9824-4c1d-9f62-5fd10d925177","resolution":{"observed_at":"2026-05-21T05:19:39.337951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Envisioning beyond the pixels: Benchmarking reasoning-informed visual editing (risebench)","venue":null,"work_id":"cb8e9c03-d909-4b40-bfb6-1ab8665302d9","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:1fea0f7262ff6f44d950adc86d7f4d4231dda87ff36d9131bbe16836b21af613","observation_id":"26796bec-0fef-447c-834e-cc54793220e0","resolution":{"observed_at":"2026-05-21T05:24:39.842323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":22,"verified_fuzzy":17},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2605.21090."}