{"as_of":"2026-08-20T04:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a759ce986aaf1dc71a87f34dcb03585fff72e0acd63e22e71beaac3247fc1c2","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:48:44.403025Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T05:51:12.688134Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19724","snapshot_observed_at":"2026-08-01T05:51:12.688134Z","title":"arXiv preprint arXiv:2504.19724 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22101","last_updated":"2026-07-24T08:54:22Z","snapshot_observed_at":"2026-08-13T04:38:40.224586Z","submitted_at":"2026-07-24T08:54:22Z","title":"InnoText: A Unified Model for Visual Text Generation and Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T05:51:12.688134Z"},"links":{"cited_paper":"/paper/2504.19724","citing_paper":"/paper/2607.22101"},"observation_digest":"sha256:883631b2339381a2b889858227a8af8103bd5e9e6cadc7d31b5d43f3a16dbf79","observation_id":"0239d9a0-36d8-4d16-8800-07fd96ec56f4","resolution":{"observed_at":"2026-08-01T05:51:12.688134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.19724/citation-record","integrity":"/paper/2504.19724/integrity","json":"/paper/2504.19724/citation-record.json","paper":"/paper/2504.19724"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.894258Z","title":null,"venue":null,"work_id":"729c1b8a-bb78-47d1-b1bd-94def0037f12","year":null},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.531514Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:f59c5985076691024c93f08d7ab8b1d218fd006609a0e7adeca4cdd30cab7538","observation_id":"a11a629a-6559-460c-bb5b-0c8c25cb21ff","resolution":{"observed_at":"2026-08-16T05:48:45.898581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02395","last_updated":"2024-11-04T18:59:05Z","snapshot_observed_at":"2026-08-19T12:24:47.963220Z","submitted_at":"2024-11-04T18:59:05Z","title":"Training-free Regional Prompting for Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02395","snapshot_observed_at":"2026-08-16T05:48:43.568363Z","title":"arXiv preprint arXiv:2411.02395 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.568363Z"},"links":{"cited_paper":"/paper/2411.02395","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:0246ae6fda87c5c7e2296dc0b9f35319823077486e156c6d4724cea80c5591e7","observation_id":"07a9f934-dd49-4581-85b5-859f1df043ff","resolution":{"observed_at":"2026-08-16T05:48:43.568363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.880193Z","title":"Advances in Neural Information Processing Systems 36, 9353–9387 (2023)","venue":null,"work_id":"7d5cef42-ee91-474a-b127-457ef6704a46","year":2023},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.617263Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:6bd2ade4269cff64feb3f34d4ba16995cc09e05a98bd195c3e3e01287cafe255","observation_id":"14d20167-1305-4a48-85d4-bd2842504c74","resolution":{"observed_at":"2026-08-16T05:48:45.884888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.866358Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"739edb45-cb50-428d-9f5d-8b2eae2aa7d3","year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.637870Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:e688779e03d203dbf18e16088c7e26994830eec1ebf034a27d58a0d35fbc0807","observation_id":"0e43f044-3da1-452b-8e6f-78f6b8d52f1d","resolution":{"observed_at":"2026-08-16T05:48:45.870540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-16T13:01:22.658904Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-16T05:48:43.642599Z","title":"arXiv preprint arXiv:2411.06558 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.642599Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:77fbc6f8257ad98c2acabf2b1ddb8ca5a0c8dcdc8288ac7750ec37ca67a8fc70","observation_id":"df6407ff-6f84-4d3b-87ba-8776adc56e58","resolution":{"observed_at":"2026-08-16T05:48:43.642599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.798669Z","title":"https://huggingface.co/ alimama-creative/FLUX.1-dev-Controlnet-Inpainting-Beta (2024)","venue":null,"work_id":"7662e879-e945-4ca3-a9d1-cea19b8a488c","year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.647569Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:12e17b05532af5fde952c61f4def0d3c39b8667918758865d8a23226c1959ebf","observation_id":"4b329f04-296c-48bd-862b-318b53e8561f","resolution":{"observed_at":"2026-08-16T05:48:45.854913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.656683Z","title":null,"venue":null,"work_id":"146ffeba-142b-4d4c-b654-04d846eecafc","year":null},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.651948Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:b4893be77f035f43e9d22e7e62d01f659c74e8a7b0b42f6628f1b195b2493891","observation_id":"1d865ae5-68c8-46b8-8eeb-41c49fe9a034","resolution":{"observed_at":"2026-08-16T05:48:45.710291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.583197Z","title":"In: Forty-first international conference on machine learning (2024)","venue":null,"work_id":"d0b754f9-4a92-4df4-a80f-778ca0aa0b4b","year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.656692Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:baee9724d05ec65b92fc58864fd97bc0a62a5fbbbc05369583e66543ecccf2a1","observation_id":"081b865d-a871-4a61-a27e-3b084ac9b27e","resolution":{"observed_at":"2026-08-16T05:48:45.587913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-16T05:48:43.662359Z","title":"arXiv preprint arXiv:2208.01618 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.662359Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:e6794203e61b3b453a7cd5ec2535978d305252b8caa5d35807d3c16d80f0d067","observation_id":"f68f84fa-8579-49f1-bfd5-586f6f1f5408","resolution":{"observed_at":"2026-08-16T05:48:43.662359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.569387Z","title":null,"venue":null,"work_id":"c34cbe97-1f89-4803-afc8-c9bd0306070c","year":2025},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.667270Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:c8ef5ae0510fbbf2b40415c2dcb5bf05e8b270589db4197b819bb746c1c20195","observation_id":"f5757dc3-b16c-4d13-916d-f611e2f677e6","resolution":{"observed_at":"2026-08-16T05:48:45.573034Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.555048Z","title":"Advances in neural information processing systems 33, 6840–6851 (2020) 9","venue":null,"work_id":"c62041fc-811e-444e-93e7-4c01d6fd7758","year":2020},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.672163Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:18f6e7d276225097b29a205db4158b932005bc0b77f2e8c38b371bb83b1c6cc4","observation_id":"24646b09-df08-475f-8bb7-be9975aecc0f","resolution":{"observed_at":"2026-08-16T05:48:45.559733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:43.676697Z","title":"ICLR 1(2), 3 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.676697Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:9f4e102adfc5515132bd585cb7536965e8cef3627e9ad4e32629455e463698e1","observation_id":"87a4825d-e120-4d9d-acef-ca943d7c7130","resolution":{"observed_at":"2026-08-16T05:48:43.676697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23775","last_updated":"2024-11-05T06:41:27Z","snapshot_observed_at":"2026-08-17T23:31:59.305347Z","submitted_at":"2024-10-31T09:45:00Z","title":"In-Context LoRA for Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23775","snapshot_observed_at":"2026-08-16T05:48:43.680692Z","title":"arXiv preprint arXiv:2410.23775 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.680692Z"},"links":{"cited_paper":"/paper/2410.23775","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:21a8b4dd8022fd9da1f2f473f247c4cc0fff3e365d9abe879f77428a904699be","observation_id":"60b502c6-bc61-44f8-9d52-4a785862bf43","resolution":{"observed_at":"2026-08-16T05:48:43.680692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.531923Z","title":null,"venue":null,"work_id":"5a554e64-1e9a-4024-944c-570193fb0058","year":null},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.685206Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:ebf0b094244cb00311adca9321df0728eb411a858cd46acf109f95a2ad91bcd0","observation_id":"8208cd62-8408-493e-bae1-c9412a7b9373","resolution":{"observed_at":"2026-08-16T05:48:45.536279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:43.689140Z","title":"arXiv preprint arXiv:2502.10999 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.689140Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:ff23d4642a1cab9f10a73dc39980babd0c70d29123d1d6b6785fa9579e8972cc","observation_id":"8f13d4b8-06bd-4159-bcdb-216ae9f1630c","resolution":{"observed_at":"2026-08-16T05:48:43.689140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.517697Z","title":null,"venue":null,"work_id":"8da0301d-ab8d-47f0-abfc-4a56b5dfaf60","year":null},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.692728Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:37229998c11ae5178ace51c7d42b6e86a7ef094b581361fb765269285320442b","observation_id":"4d2a2af1-1502-4096-9c1c-1d9762c7af81","resolution":{"observed_at":"2026-08-16T05:48:45.522138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:43.697324Z","title":"https://github.com/black-forest-labs/flux (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.697324Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:302d0762fa4301e389a6a1fdf034b798cce6f6bf1054a506bf9282ce569dffeb","observation_id":"dee795f3-464b-4c19-b0b0-0af48bd1188e","resolution":{"observed_at":"2026-08-16T05:48:43.697324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17524","last_updated":"2025-03-28T03:27:40Z","snapshot_observed_at":"2026-08-16T19:13:10.534807Z","submitted_at":"2024-09-26T04:23:17Z","title":"JoyType: A Robust Design for Multilingual Visual Text Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17524","snapshot_observed_at":"2026-08-16T05:48:43.701098Z","title":"arXiv preprint arXiv:2409.17524 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.701098Z"},"links":{"cited_paper":"/paper/2409.17524","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:71f3c83388e9911e239f759bcb4c0f86c851e94f1ea9aec10e1307e7c588eed6","observation_id":"79f64c3e-3867-4e99-b093-0e1085bf0653","resolution":{"observed_at":"2026-08-16T05:48:43.701098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03001","last_updated":"2022-06-14T12:00:10Z","snapshot_observed_at":"2026-08-19T13:30:52.002013Z","submitted_at":"2022-06-07T04:33:50Z","title":"PP-OCRv3: More Attempts for the Improvement of Ultra Lightweight OCR System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03001","snapshot_observed_at":"2026-08-16T05:48:43.706421Z","title":"arXiv preprint arXiv:2206.03001 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.706421Z"},"links":{"cited_paper":"/paper/2206.03001","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:2fffcc0ec9f15aa07cc6a3c1a92f60fe0a92899776c97b1bf3cee7f3624c903e","observation_id":"494c6109-c638-4d72-9936-82a7a0d77f95","resolution":{"observed_at":"2026-08-16T05:48:43.706421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-08-16T13:11:20.195602Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-16T05:48:43.711111Z","title":"5: Three insights to- wards enhancing aesthetic quality in text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.711111Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:35ffbf43251123e3907e3e75639733adef319bab55f05da8553bc0fb9796e31c","observation_id":"269c6063-4e0c-4fd5-91b2-821b612f6f5c","resolution":{"observed_at":"2026-08-16T05:48:43.711111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.495106Z","title":null,"venue":null,"work_id":"18e74bc6-d36d-4a9b-b72d-1604dc2d2cf9","year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.715550Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:681c1c36355c372b72d2ef7c3e2dece0f06a3235628c5c65d3e4c6b2e93fd1eb","observation_id":"67af91d5-f523-42cf-adf3-95064745a703","resolution":{"observed_at":"2026-08-16T05:48:45.499398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:43.719698Z","title":"arXiv preprint arXiv:2504.07960 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.719698Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:a190c56ae17d1e7a103d7e6ee17e8bd61a7d92aa2b3ec4992c87fb558bc4b0f2","observation_id":"e1189785-1303-4b45-888c-9b4c05364c07","resolution":{"observed_at":"2026-08-16T05:48:43.719698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-16T13:18:02.646429Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-16T05:48:43.723577Z","title":"arXiv preprint arXiv:2409.10695 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.723577Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:ee5628eeab49f00e047f9b71b4fe7800e052b756d3b53c378f68dbc28a7b9444","observation_id":"cd739ac7-a0df-484f-898e-50b74e96a432","resolution":{"observed_at":"2026-08-16T05:48:43.723577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10208","last_updated":"2024-07-12T16:26:40Z","snapshot_observed_at":"2026-08-20T00:31:19.820276Z","submitted_at":"2024-06-14T17:44:09Z","title":"Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10208","snapshot_observed_at":"2026-08-16T05:48:43.795100Z","title":"arXiv preprint arXiv:2406.10208 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.795100Z"},"links":{"cited_paper":"/paper/2406.10208","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:07a79ec520df983c2c0f576acf4ce8e544c1bafddca31405f5811a715a49fd05","observation_id":"2df8daa3-a059-4569-b057-667585fb213c","resolution":{"observed_at":"2026-08-16T05:48:43.795100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.481086Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"a92b534e-a509-4fd9-9082-32eadda93aaf","year":2025},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:43.915777Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:80c1705ede40154b01865d865c2f828d67fd5fd1b442f453d0c4fe5c2a1b6c52","observation_id":"c98011f7-1489-47aa-99b0-28300c88f9ce","resolution":{"observed_at":"2026-08-16T05:48:45.485490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02487","last_updated":"2025-01-15T13:07:56Z","snapshot_observed_at":"2026-08-16T12:59:41.777279Z","submitted_at":"2025-01-05T09:40:58Z","title":"ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02487","snapshot_observed_at":"2026-08-16T05:48:44.022014Z","title":"arXiv preprint arXiv:2501.02487 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.022014Z"},"links":{"cited_paper":"/paper/2501.02487","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:e13b843ed7b651a08190ab4203c4f996fa9f3b08e43cd225d10e97579b246caa","observation_id":"81dbcb31-96f9-44d7-9ae7-204ac38eccc6","resolution":{"observed_at":"2026-08-16T05:48:44.022014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.465440Z","title":"https://www.midjourney.com/updates/v7-alpha (2025)","venue":null,"work_id":"b16efdf9-1633-445a-8eee-d2c511ca7e3c","year":2025},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.027097Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:78ef3aa4c11ed3147ebf9d2787d1a0e59a561ec03f70a9328d426d1130d5f5c3","observation_id":"607eea7d-36b7-4555-8d4d-3e2929ba47ce","resolution":{"observed_at":"2026-08-16T05:48:45.470724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:44.031832Z","title":"In: Proceedings of the AAAI conference on artificial intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.031832Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:efbeff0e37fbad911b184813f1d788d4d8659b6e75d7d4b9f34fea27350c4f35","observation_id":"ee70af78-cc7b-45db-be28-c2f2c03e9a69","resolution":{"observed_at":"2026-08-16T05:48:44.031832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.384786Z","title":null,"venue":null,"work_id":"a4e29837-4de2-40fa-a8b5-96843bc5cb22","year":null},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.036356Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:bcb0afdf6716517656e7e8623b4cd8c69e8417c6c3fc29571d14529a944de385","observation_id":"53cd0397-b121-4fdc-871a-e074ffae5501","resolution":{"observed_at":"2026-08-16T05:48:45.446571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-19T10:37:36.887221Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-16T05:48:44.040880Z","title":"arXiv preprint arXiv:2504.06256 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.040880Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:f388d62001b317b7031f87d4ee3945c25b9c14bf77adaf7d09118216fffab401","observation_id":"02ed6009-05e7-4c55-978f-3b45e43f5b22","resolution":{"observed_at":"2026-08-16T05:48:44.040880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-16T05:48:44.045437Z","title":"arXiv preprint arXiv:2307.01952 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.045437Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:b606a9cf7e49a2a90bcecedce0df21cd60ec77dcccb1f2a7e1bbf3269d00d981","observation_id":"a57479b2-8500-42a2-ab3e-8fac77baf1f0","resolution":{"observed_at":"2026-08-16T05:48:44.045437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:44.050247Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.050247Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:de1a7a2a53b57569bc2573441f534781aed7d331731d46d31131c549d87676fa","observation_id":"686fee7a-7687-4460-b10a-d6a6659e41ef","resolution":{"observed_at":"2026-08-16T05:48:44.050247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:44.055016Z","title":"Journal of machine learning research 21(140), 1–67 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.055016Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:9172433d5c9efcdbca9c1b8f4041daaa28537c10a682f4cc9b599a90b6df9de9","observation_id":"6483a735-5c65-44b0-bd9d-7fcc18fc8fe1","resolution":{"observed_at":"2026-08-16T05:48:44.055016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.168374Z","title":null,"venue":null,"work_id":"afa7d23c-6d53-4903-87b6-0e0afed7a91b","year":null},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.059573Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:5aac9d5f6235fe14008bef3115545f62dbbb5e53ce332b21e7da942af72a016a","observation_id":"867fc8d5-e948-46f2-82cb-1f1b96ebbd7b","resolution":{"observed_at":"2026-08-16T05:48:45.242003Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.074972Z","title":null,"venue":null,"work_id":"705e526c-da53-4b95-9530-d7f637839bcc","year":null},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.064898Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:7521558044d19a5e11ec15c0c735d65709807001196e2908f39fa8ff31dda5e8","observation_id":"fdd36493-2262-4a68-ba3f-3623282893b4","resolution":{"observed_at":"2026-08-16T05:48:45.109216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:44.069247Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.069247Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:45a056c3e2670e101822e46e15f17c4b4ca458397012f64e70896d4d2932614c","observation_id":"482a91e0-a7a9-4f73-a40b-30bec605540f","resolution":{"observed_at":"2026-08-16T05:48:44.069247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:44.073532Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.073532Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:c35e1143909fbaba1a97531b728dce0d2f86d721ee29a510d2e6e7af5da73f7a","observation_id":"42b54467-8266-409b-a5be-3a14a2b4b602","resolution":{"observed_at":"2026-08-16T05:48:44.073532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.037762Z","title":"https://huggingface.co/Shakker-Labs/FLUX","venue":null,"work_id":"07ff117b-f00f-478c-8d78-3125d148a740","year":2025},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.077881Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:33bd7e37f88dac09be0180b05e05248fdb8940101d140c86feed9295d09e87d0","observation_id":"b4666c72-9aac-47f0-9889-b157589a816c","resolution":{"observed_at":"2026-08-16T05:48:45.043214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15098","last_updated":"2025-07-07T17:33:23Z","snapshot_observed_at":"2026-08-12T17:19:10.028618Z","submitted_at":"2024-11-22T17:55:15Z","title":"OminiControl: Minimal and Universal Control for Diffusion Transformer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15098","snapshot_observed_at":"2026-08-16T05:48:44.082011Z","title":"arXiv preprint arXiv:2411.15098 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.082011Z"},"links":{"cited_paper":"/paper/2411.15098","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:cc39ba813663f6fb2f630d7c389a4704db1e69779a9880806f703a1f2233c448","observation_id":"f75117c8-d6da-4c63-8ae1-6d2a744babb7","resolution":{"observed_at":"2026-08-16T05:48:44.082011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12395","last_updated":"2025-04-16T18:01:59Z","snapshot_observed_at":"2026-08-16T19:13:06.570964Z","submitted_at":"2025-04-16T18:01:59Z","title":"InstantCharacter: Personalize Any Characters with a Scalable Diffusion Transformer Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12395","snapshot_observed_at":"2026-08-16T05:48:44.086426Z","title":"arXiv preprint arXiv:2504.12395 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.086426Z"},"links":{"cited_paper":"/paper/2504.12395","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:0df51bb1edb1f230f7968e2994ac2f86f81e5112734a5263c078ec66c24e0917","observation_id":"4e020307-4300-4ade-baf9-2a66862b4b2a","resolution":{"observed_at":"2026-08-16T05:48:44.086426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.020957Z","title":"https://huggingface.co/InstantX/FLUX","venue":null,"work_id":"d58f09db-1933-4a9b-aa43-0151e4d9524e","year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.091488Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:8e647e1533d018832996553dd49f9ae37c65b76e6edccdab53a2a34e8e84e2b4","observation_id":"c175546d-4e92-4646-b574-57070923dbcf","resolution":{"observed_at":"2026-08-16T05:48:45.025968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:45.004292Z","title":"arXiv preprint (2024)","venue":null,"work_id":"0e23f7ef-eb5c-4fe9-adcd-0155decb5a2f","year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.095995Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:9a3485e1bbde6e4394a0879df2ee7809324c5309bd3e6834f6c90dc82768ce96","observation_id":"e303a1da-b540-4873-91be-5e62ae24b6d9","resolution":{"observed_at":"2026-08-16T05:48:45.009067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:44.989631Z","title":null,"venue":null,"work_id":"dab9df77-5f48-4ca3-a8cc-5729af944ef4","year":null},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.100075Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:14c59c42c4006aeb40a124a59096bcc0af9315bfb84d5dd3388bfe820b663bc9","observation_id":"13e38d5b-48ba-416b-86e2-ef0705421ff1","resolution":{"observed_at":"2026-08-16T05:48:44.994434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15245","last_updated":"2024-11-22T03:31:56Z","snapshot_observed_at":"2026-08-18T02:16:48.017019Z","submitted_at":"2024-11-22T03:31:56Z","title":"AnyText2: Visual Text Generation and Editing With Customizable Attributes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15245","snapshot_observed_at":"2026-08-16T05:48:44.104100Z","title":"arXiv preprint arXiv:2411.15245 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.104100Z"},"links":{"cited_paper":"/paper/2411.15245","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:2f79976697d63f4cf84fe208c37b3db8fa7f724bf0ed52c4840b063e8e41ea6b","observation_id":"00262b90-0873-4e35-9552-e3f7fc4f5072","resolution":{"observed_at":"2026-08-16T05:48:44.104100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03054","last_updated":"2024-02-21T07:12:45Z","snapshot_observed_at":"2026-08-18T18:25:23.717451Z","submitted_at":"2023-11-06T12:10:43Z","title":"AnyText: Multilingual Visual Text Generation And Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03054","snapshot_observed_at":"2026-08-16T05:48:44.108835Z","title":"arXiv preprint arXiv:2311.03054 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.108835Z"},"links":{"cited_paper":"/paper/2311.03054","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:ac8794517348ccadd60ad79f532b9b46d3cdab8467136eff92f28d5dbe68ddaf","observation_id":"843762f8-ae1b-4ba1-a7ae-2762bc22edf4","resolution":{"observed_at":"2026-08-16T05:48:44.108835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:44.974305Z","title":null,"venue":null,"work_id":"04a2657e-9bfe-4c58-8451-4e6acdcb442a","year":2025},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.169653Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:c019949606dfd4d454b37fba3788d1f3f4875dd67aaeb3584c404c4c34b29f6a","observation_id":"b3bb9de2-a067-4f59-aa7a-44b6a8067248","resolution":{"observed_at":"2026-08-16T05:48:44.979157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02733","last_updated":"2024-04-04T19:42:32Z","snapshot_observed_at":"2026-08-16T14:03:57.454330Z","submitted_at":"2024-04-03T13:34:09Z","title":"InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02733","snapshot_observed_at":"2026-08-16T05:48:44.278455Z","title":"arXiv preprint arXiv:2404.02733 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.278455Z"},"links":{"cited_paper":"/paper/2404.02733","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:b93539d5054d7f2168dd64ddfa41a9de043564b6dfa21f5c88ea11d5bbf914ea","observation_id":"c2174857-4f96-4b70-b22f-9969b9811c84","resolution":{"observed_at":"2026-08-16T05:48:44.278455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00788","last_updated":"2024-06-30T18:05:33Z","snapshot_observed_at":"2026-08-16T13:38:21.547609Z","submitted_at":"2024-06-30T18:05:33Z","title":"InstantStyle-Plus: Style Transfer with Content-Preserving in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00788","snapshot_observed_at":"2026-08-16T05:48:44.349261Z","title":"arXiv preprint arXiv:2407.00788 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.349261Z"},"links":{"cited_paper":"/paper/2407.00788","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:cbb3d9de2275e0d7c953f24f658384aa196c4161ee809698c4189041ca59aeff","observation_id":"57932362-d681-48de-82c4-61420ae6386a","resolution":{"observed_at":"2026-08-16T05:48:44.349261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-16T06:18:35.139211Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-16T05:48:44.354223Z","title":"arXiv preprint arXiv:2401.07519 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.354223Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:9862312c5c0df818a1b6224a5c354cac57649a0d674bdfb6e98de7d149e5e88a","observation_id":"12a5c8a9-0b16-47b9-bb87-fff9ecc2b424","resolution":{"observed_at":"2026-08-16T05:48:44.354223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-16T05:48:44.359050Z","title":"arXiv preprint arXiv:2410.13848 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.359050Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:eb76334570b122a696f79b07524415de94269aeaf606e0a967cd6209f76744cc","observation_id":"9dc2d0bb-9296-4a48-a99b-ba17b93968e6","resolution":{"observed_at":"2026-08-16T05:48:44.359050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02160","last_updated":"2025-04-02T22:20:21Z","snapshot_observed_at":"2026-08-19T15:53:04.710976Z","submitted_at":"2025-04-02T22:20:21Z","title":"Less-to-More Generalization: Unlocking More Controllability by In-Context Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02160","snapshot_observed_at":"2026-08-16T05:48:44.364381Z","title":"arXiv preprint arXiv:2504.02160 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.364381Z"},"links":{"cited_paper":"/paper/2504.02160","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:2147891b38c2cda737dc7bc7159fb7cd8aaab288d496404598f3754d0342458b","observation_id":"2511fb06-4f6d-4170-b77a-7d95927d3a2c","resolution":{"observed_at":"2026-08-16T05:48:44.364381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-16T13:17:46.268142Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-16T05:48:44.368790Z","title":"arXiv preprint arXiv:2409.11340 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.368790Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:691326fcff81bb27c9d993ae77e6fbfad663af87295c8684ddbfc13cddda089d","observation_id":"a6e8c3d5-a6c6-4473-a88c-9291bfc68546","resolution":{"observed_at":"2026-08-16T05:48:44.368790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-16T05:48:44.373150Z","title":"arXiv preprint arXiv:2408.12528 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.373150Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:31b3e3ef01feb106711540f202d2d3d36d5db333edebee58a51769b79bb4d5df","observation_id":"ddc30508-6b41-482c-904f-141daa70862b","resolution":{"observed_at":"2026-08-16T05:48:44.373150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16766","last_updated":"2024-09-04T10:42:41Z","snapshot_observed_at":"2026-08-16T13:22:49.816942Z","submitted_at":"2024-08-29T17:59:30Z","title":"CSGO: Content-Style Composition in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16766","snapshot_observed_at":"2026-08-16T05:48:44.377065Z","title":"arXiv preprint arXiv:2408.16766 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.377065Z"},"links":{"cited_paper":"/paper/2408.16766","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:7649a850f837291950b627cfd29c50b94ee6cef75d72fac14b3fa9b32403c774","observation_id":"1366937f-fb30-403b-b9d3-0baf562e690a","resolution":{"observed_at":"2026-08-16T05:48:44.377065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:44.959319Z","title":"Transactions of the Association for Computational Linguistics 10, 291–306 (2022)","venue":null,"work_id":"160f4cf5-8909-4887-bc83-d98618cbc7f9","year":2022},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.381470Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:88fc84597869f5ee263648a03eb304fb1bc5dfc795ed2620e370a9e192f83dd2","observation_id":"6280025f-7c9e-470e-a71e-ea4a5632838c","resolution":{"observed_at":"2026-08-16T05:48:44.964368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11934","last_updated":"2021-03-11T18:45:13Z","snapshot_observed_at":"2026-08-17T02:24:20.015689Z","submitted_at":"2020-10-22T17:58:14Z","title":"mT5: A massively multilingual pre-trained text-to-text transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11934","snapshot_observed_at":"2026-08-16T05:48:44.386552Z","title":"arXiv preprint arXiv:2010.11934 (2020) 11","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.386552Z"},"links":{"cited_paper":"/paper/2010.11934","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:0b35bffab41a73bd7663168dc974151ee089b1c380742cf69c9f537948a4cccc","observation_id":"6885f687-28d7-4e87-a1d9-a6acead2c36b","resolution":{"observed_at":"2026-08-16T05:48:44.386552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:44.943266Z","title":"Advances in Neural Information Processing Systems 36, 44050–44066 (2023)","venue":null,"work_id":"062c17ff-ed66-4269-ac44-5285a907894f","year":2023},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.390612Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:ec8d2339a7a5b9ad3b530901dd4a9afe4cb11fc7175e39b46db294f6e74a635d","observation_id":"fce62f2c-71d8-45dc-b536-7f0f0cf03354","resolution":{"observed_at":"2026-08-16T05:48:44.949686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-16T05:48:44.394516Z","title":"arXiv preprint arXiv:2308.06721 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.394516Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:e159a3312e7058c274d9917732c0ed144412494e83fbf40adf9604af1e5adac7","observation_id":"c30cd350-b1df-41e6-9d74-4d095bf703d6","resolution":{"observed_at":"2026-08-16T05:48:44.394516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:48:44.398799Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.398799Z"},"links":{"citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:c177a6ebab213997ed76f6784db29ef991cf337728ed70887aa719a31e7ea557","observation_id":"4045be6b-1d78-4b69-8d05-05edc0690d53","resolution":{"observed_at":"2026-08-16T05:48:44.398799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07027","last_updated":"2025-03-10T08:07:17Z","snapshot_observed_at":"2026-08-16T19:12:37.996751Z","submitted_at":"2025-03-10T08:07:17Z","title":"EasyControl: Adding Efficient and Flexible Control for Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07027","snapshot_observed_at":"2026-08-16T05:48:44.403025Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T05:48:44.403025Z"},"links":{"cited_paper":"/paper/2503.07027","citing_paper":"/paper/2504.19724"},"observation_digest":"sha256:bc637e36135ce667babe37904e1322a7a0f28ee771a10028a808b50ecaa33965","observation_id":"6a9e256e-fb9a-49f4-841f-131d88cd5614","resolution":{"observed_at":"2026-08-16T05:48:44.403025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.19724","last_updated":"2025-04-28T12:19:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T23:10:34.175088Z","submitted_at":"2025-04-28T12:19:53Z","title":"RepText: Rendering Visual Text via Replicating"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2504.19724."}