{"as_of":"2026-08-14T08:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df9eef57a9f38a57c7898aa00b8791ad1b5f6946ae1cabe61b0a6a791eccb01f","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:45:54.168593Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T05:51:12.656627Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.246299Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"cited_work":{"arxiv_id":"2412.17225","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17225","snapshot_observed_at":"2026-07-03T21:28:58.246299Z","title":"Chargen: High accurate character-level visual text generation model with multimodal encoder.arXiv preprint arXiv:2412.17225, 2024","venue":null,"work_id":"0b9dac9f-ae1e-479c-b80b-f2328b5545f7","year":2024},"citing_paper":{"arxiv_id":"2606.12280","last_updated":"2026-06-10T16:19:49Z","snapshot_observed_at":"2026-08-11T05:41:00.695343Z","submitted_at":"2026-06-10T16:19:49Z","title":"Holding the FP8 Quality Ceiling at 8-Bit Weights and Activations: INT8 and GGUF Post-Training Quantization of Ideogram 4.0 for Consumer GPUs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T10:05:40.235610Z"},"links":{"cited_paper":"/paper/2412.17225","citing_paper":"/paper/2606.12280"},"observation_digest":"sha256:78084d3ecbdf9971d8bb464da004d4b2a8f32d94f73856bce9dc59205a856b3a","observation_id":"800ea31d-774f-4249-835e-68c4aa3970ec","resolution":{"observed_at":"2026-07-03T10:17:58.047058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"cited_work":{"arxiv_id":"2412.17225","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17225","snapshot_observed_at":"2026-07-03T21:28:58.246299Z","title":"Chargen: High accurate character-level visual text generation model with multimodal encoder.arXiv preprint arXiv:2412.17225, 2024","venue":null,"work_id":"0b9dac9f-ae1e-479c-b80b-f2328b5545f7","year":2024},"citing_paper":{"arxiv_id":"2607.00920","last_updated":"2026-07-02T02:41:37Z","snapshot_observed_at":"2026-08-03T22:17:48.449247Z","submitted_at":"2026-07-01T13:23:45Z","title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-02T13:56:43.671622Z"},"links":{"cited_paper":"/paper/2412.17225","citing_paper":"/paper/2607.00920"},"observation_digest":"sha256:c0d48fcad45c7ef53e7c0939692fa1826c6d17bdab768b5585ffb7463ac8b891","observation_id":"8daa24de-0235-4b42-a24e-0ddd934bb10e","resolution":{"observed_at":"2026-07-02T13:56:58.996534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"cited_work":{"arxiv_id":"2412.17225","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17225","snapshot_observed_at":"2026-07-03T21:28:58.246299Z","title":"Chargen: High accurate character-level visual text generation model with multimodal encoder.arXiv preprint arXiv:2412.17225, 2024","venue":null,"work_id":"0b9dac9f-ae1e-479c-b80b-f2328b5545f7","year":2024},"citing_paper":{"arxiv_id":"2607.00920","last_updated":"2026-07-02T02:41:37Z","snapshot_observed_at":"2026-08-03T22:17:48.449247Z","submitted_at":"2026-07-01T13:23:45Z","title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-03T21:23:41.271521Z"},"links":{"cited_paper":"/paper/2412.17225","citing_paper":"/paper/2607.00920"},"observation_digest":"sha256:b30fbc8988c054b8befa940b46a79f28dc95220cbc3617adc0c61e54163846c6","observation_id":"f9fc143e-5a29-4ec9-8905-b2e272ea7998","resolution":{"observed_at":"2026-07-03T21:28:58.247930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17225","snapshot_observed_at":"2026-08-01T05:51:12.656627Z","title":"arXiv preprint arXiv:2412.17225 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22101","last_updated":"2026-07-24T08:54:22Z","snapshot_observed_at":"2026-08-13T04:38:40.224586Z","submitted_at":"2026-07-24T08:54:22Z","title":"InnoText: A Unified Model for Visual Text Generation and Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T05:51:12.656627Z"},"links":{"cited_paper":"/paper/2412.17225","citing_paper":"/paper/2607.22101"},"observation_digest":"sha256:a2db3aa1fbecfeecd231c0d87dceaa926167d70bb8243f6cfdb92d06b3e10c7b","observation_id":"df547916-2f60-4f9e-a17d-0164114a8eb5","resolution":{"observed_at":"2026-08-01T05:51:12.656627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17225/citation-record","integrity":"/paper/2412.17225/integrity","json":"/paper/2412.17225/citation-record.json","paper":"/paper/2412.17225"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.628556Z","title":"Improving Image Gen- eration with Better Captions","venue":null,"work_id":"6443267c-5056-489e-9ce1-39f34942b29b","year":2023},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.027737Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:0ea23ef2f8a5c8d0542e9cc1fd3ee9eb55ae274c6b29ffc3981ba90a36ca9fbb","observation_id":"32dcee00-c070-47fe-a50a-c395288bfe3c","resolution":{"observed_at":"2026-08-11T05:45:54.632585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.617111Z","title":"Freeman, Michael Rubinstein, Yuanzhen Li, and Dilip Krishnan","venue":null,"work_id":"f87cafad-9bcd-43a6-81b2-b33440aee7cb","year":2023},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.032151Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:6eb7f621d6a3af649691b741753f3593134d41c579c9ef72c847c9200cc2d14f","observation_id":"d644f7f7-218a-4241-8348-8e52a477c2d7","resolution":{"observed_at":"2026-08-11T05:45:54.620509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.607114Z","title":"Diffute: Universal text editing diffusion model","venue":null,"work_id":"e436a753-42ad-47c7-955d-ffe3a7cd9b07","year":2024},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.037798Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:a1b25e06b92336d7ffccf346cf93768274b76fbf7b553e7251865f7212532e69","observation_id":"aa59fca9-478b-42bf-ad77-66a533438e79","resolution":{"observed_at":"2026-08-11T05:45:54.610514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16465","last_updated":"2023-11-28T04:02:40Z","snapshot_observed_at":"2026-08-13T20:41:37.026877Z","submitted_at":"2023-11-28T04:02:40Z","title":"TextDiffuser-2: Unleashing the Power of Language Models for Text Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16465","snapshot_observed_at":"2026-08-11T05:45:54.042101Z","title":"TextDiffuser-2: Unleashing the Power of Language Models for Text Rendering, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.042101Z"},"links":{"cited_paper":"/paper/2311.16465","citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:38f1dcd8bcbe142a970c5ddb2aa00d04234b98ab54b293d79398d405e07e9364","observation_id":"af6c4dbe-363e-4cd0-a785-3fd33ceaf91e","resolution":{"observed_at":"2026-08-11T05:45:54.042101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.596534Z","title":"Textdiffuser: Diffusion models as text painters","venue":null,"work_id":"789a7c21-8b3f-425a-9a3f-ad508bda0ac0","year":2024},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.046269Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:1e06fa01befb928f658452be87ac62b6e0a56a8f34c73f3b513c7fe75feaa5ac","observation_id":"5be04580-7bc3-41bf-a3b5-123cfd3eeea4","resolution":{"observed_at":"2026-08-11T05:45:54.600198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.05233","snapshot_observed_at":"2026-08-11T05:45:54.049939Z","title":"Diffusion Models Beat GANs on Image Synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.049939Z"},"links":{"cited_paper":"/paper/2105.05233","citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:34edae2ab371de81aa52a2dda81182aae7d0051de5bb95e252266a89cf86288d","observation_id":"0f6a3fba-73d8-4b6f-9915-8b934c5132e1","resolution":{"observed_at":"2026-08-11T05:45:54.049939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.585632Z","title":"Odm: A text-image further alignment pre-training approach for scene text detection and spotting","venue":null,"work_id":"d022ccf9-1633-4939-9b63-bf4761c7793b","year":2024},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.054305Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:eb6feee29e687074434b8f8fb8c9734d861fe9fbf3e615e21666163697b2a47c","observation_id":"a105cabf-43bc-426b-b935-3f12b69ce34c","resolution":{"observed_at":"2026-08-11T05:45:54.589550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.574899Z","title":"Duguangocr","venue":null,"work_id":"5b8f76f9-ad5f-4152-a939-b568d2f3df52","year":2023},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.057863Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:5796f3c947ac79bdc72df25001c9b7cb3006678ea22a64f538159ff4435d8826","observation_id":"a33befb2-80d5-47d5-98fd-700c80dbde74","resolution":{"observed_at":"2026-08-11T05:45:54.578511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.061352Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.061352Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:8906b5f6e289125a2e4ade39f270967687e61ea7b69e7a25207e1207de682ac8","observation_id":"4fdb2fe9-d5c1-46df-a71d-66b3a84b97ba","resolution":{"observed_at":"2026-08-11T05:45:54.061352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.554424Z","title":"Wukong: 100 million large-scale chinese cross-modal pre-training dataset and a foundation frame- work, 2022","venue":null,"work_id":"40858a18-4674-45f4-b55d-d6f5c15c849a","year":2022},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.064964Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:2583e3f72dfd40e216cdf9f4868ee3cb6f8396c0691d23ef3b652b54daedd9d9","observation_id":"f6730221-9216-40c4-bccd-9301fa904acb","resolution":{"observed_at":"2026-08-11T05:45:54.558944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.541911Z","title":"Denoising Dif- fusion Probabilistic Models, 2020","venue":null,"work_id":"2e0463cc-9af7-433d-b2bc-d8787b083764","year":2020},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.068410Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:cf4150d4f5e914b7871a9723f8fbeb027a09aa7143b6ba347219e4c514cffc2e","observation_id":"78774e74-34d5-4000-bd64-99259f3d4ee9","resolution":{"observed_at":"2026-08-11T05:45:54.546182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.529360Z","title":"Auto-encoding varia- tional bayes, 2022","venue":null,"work_id":"3846f84a-968d-40c4-8b9c-1a40fe70a2e3","year":2022},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.072712Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:f134c4a2d43d23816e0acd9d9e0b5a2d11fe64114be3b97b0d05494062d041c7","observation_id":"87be2020-c36d-43de-ad5c-6df12c40f426","resolution":{"observed_at":"2026-08-11T05:45:54.533173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.517424Z","title":"Pp-ocrv3: More attempts for the improvement of ultra lightweight ocr system,","venue":null,"work_id":"1b5d2638-c82c-443b-a785-8e348476005b","year":null},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.076401Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:80a7c6ac841e1a54e7d146a788ad8efb627601e08c6b44bb34e22bff7f84911a","observation_id":"11d9325a-7517-4838-9095-db005ac98a92","resolution":{"observed_at":"2026-08-11T05:45:54.521099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.504657Z","title":"Character-aware models improve visual text rendering, 2023","venue":null,"work_id":"7bbae09c-09c0-4fc3-a86b-76696d424e10","year":2023},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.079905Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:b62b91596535b8ad861b1f89a480e15548d158a2f1c672caa0787482d8b1364e","observation_id":"4a50ce3e-f731-474e-8afe-a05b6511c937","resolution":{"observed_at":"2026-08-11T05:45:54.509116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10562","last_updated":"2023-05-03T16:36:38Z","snapshot_observed_at":"2026-08-13T13:17:49.689853Z","submitted_at":"2022-12-20T18:59:23Z","title":"Character-Aware Models Improve Visual Text Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10562","snapshot_observed_at":"2026-08-11T05:45:54.083336Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.083336Z"},"links":{"cited_paper":"/paper/2212.10562","citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:0bfc71bc530ffffa18717303d258fa82e822cfaa2351bf24a53815c70bbd0896","observation_id":"ba0c7ce2-e223-4f68-b8c1-413f868882c1","resolution":{"observed_at":"2026-08-11T05:45:54.083336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.491664Z","title":"Glyph-ByT5: A Cus- tomized Text Encoder for Accurate Visual Text Rendering,","venue":null,"work_id":"d2a06f95-d6eb-4e70-9b33-a00956586953","year":null},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.086895Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:bd27019ed842fab720a1d1f88ca8868d8015e6f8222c2a397dc39390fa97c567","observation_id":"5708ea8d-5278-4cc3-8bc1-46d4e43f1593","resolution":{"observed_at":"2026-08-11T05:45:54.495477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10208","last_updated":"2024-07-12T16:26:40Z","snapshot_observed_at":"2026-08-12T23:42:29.448793Z","submitted_at":"2024-06-14T17:44:09Z","title":"Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10208","snapshot_observed_at":"2026-08-11T05:45:54.094448Z","title":"Glyph-ByT5-v2: A Strong Aesthetic Base- line for Accurate Multilingual Visual Text Rendering, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.094448Z"},"links":{"cited_paper":"/paper/2406.10208","citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:39a6c0c60f43164c0f216521610f9e01ecc44dc907a383cac5c19f71958004fa","observation_id":"0c45c0d0-fc72-4ab9-b27b-a285b2cdd64f","resolution":{"observed_at":"2026-08-11T05:45:54.094448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17870","last_updated":"2023-05-23T04:07:00Z","snapshot_observed_at":"2026-08-13T12:12:43.873574Z","submitted_at":"2023-03-31T08:06:33Z","title":"GlyphDraw: Seamlessly Rendering Text with Intricate Spatial Structures in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17870","snapshot_observed_at":"2026-08-11T05:45:54.097886Z","title":"GlyphDraw: Seamlessly Rendering Text with Intricate Spatial Structures in Text-to- Image Generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.097886Z"},"links":{"cited_paper":"/paper/2303.17870","citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:0fcd1af94f9e6e60476ece0795d5182c466c8b1d43a8537963f99e039bf147fe","observation_id":"2ecb5dfd-4802-4cc8-b0dc-60425446d0bd","resolution":{"observed_at":"2026-08-11T05:45:54.097886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.478702Z","title":"Glyphdraw2: Automatic generation of complex glyph posters with diffusion models and large language models,","venue":null,"work_id":"040a340d-99d3-4108-9c82-648d07019719","year":null},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.101959Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:7b45b55068b2b522dfde509c1df04ac34b4c0b7a81d7efb7e1ccfbf2432a861a","observation_id":"ad03fc6a-a382-4c15-9bc4-a7aba992e08e","resolution":{"observed_at":"2026-08-11T05:45:54.482727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.463754Z","title":"Midjourney","venue":null,"work_id":"b9d04044-1812-48c8-83cf-ee919ff08861","year":2023},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.105504Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:32c4d762c5aa431c4aa9e8dab6e3153a8adff0e77c12f534318b1554e08cfca3","observation_id":"5e344d80-5f47-487b-9baf-fec339db194f","resolution":{"observed_at":"2026-08-11T05:45:54.468583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.452131Z","title":"Improved denoising dif- fusion probabilistic models, 2021","venue":null,"work_id":"549f9b79-777d-4b89-9c42-7ef34bbef0ed","year":2021},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.108873Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:984d686db9bb6d685eda75d2d481e881650ea54c8b2b5f3db37190aa137e41b3","observation_id":"37c395c1-3718-43a0-91ce-d99a458aecaf","resolution":{"observed_at":"2026-08-11T05:45:54.455745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.112155Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.112155Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:0c4e1ccabab84cea749d63447f7157a28fc7047be05adeaa953dc07b41c071e2","observation_id":"fe117036-b7ff-4752-85c2-25ea340eb4ee","resolution":{"observed_at":"2026-08-11T05:45:54.112155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.115472Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.115472Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:5b523789994433fe7e5287dfdbfdb27cd3bd5bd087479970aaa8bdbc5947bb2f","observation_id":"098b4e94-2f61-4228-a1b5-6d8025581694","resolution":{"observed_at":"2026-08-11T05:45:54.115472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.118609Z","title":"Zero-shot text-to-image generation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.118609Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:64cdfc5b1653a39d73853b99028479ee0af0ae941032a328f2c605604440a7a6","observation_id":"59b35edd-5e0c-46be-8542-5ed4add82c13","resolution":{"observed_at":"2026-08-11T05:45:54.118609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.122161Z","title":"Hierarchical text-conditional image gener- ation with clip latents, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.122161Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:cc0889f5cf14ee86f38285af3b6c53211ae28a304fea1826694fb6f5850c8e4d","observation_id":"f74ce017-246f-456e-85b6-1d9d3748c3ed","resolution":{"observed_at":"2026-08-11T05:45:54.122161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.407574Z","title":"Ocr-vqgan: Taming text- within-image generation","venue":null,"work_id":"3f64d93a-1325-4cbc-803b-6d94642210cd","year":2023},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.126126Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:67ba2d1f5deeac9fd8d846a107ad90ae7a0ef029e680519e3c53c26a33e250d5","observation_id":"8f16315b-4474-4658-a26c-796c1c0801fe","resolution":{"observed_at":"2026-08-11T05:45:54.410844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.397042Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"b990eb7e-8e53-47f8-8312-7ace9929477b","year":2022},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.129746Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:d368123894fb87c961c71f74244abeb974223fd926e369733373b27de09e46b4","observation_id":"18160161-c409-440f-88f1-a2b150a5e58c","resolution":{"observed_at":"2026-08-11T05:45:54.400593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-08-12T12:48:35.419134Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-11T05:45:54.134047Z","title":"Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.134047Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:80124ebe6e3cc4f03631fe5a3ffd2015aedb6957de86e180392c0611ffbc3d42","observation_id":"2b65121d-7aa4-46a7-8d28-d0f51b1b9144","resolution":{"observed_at":"2026-08-11T05:45:54.134047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-11T05:45:54.137766Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.137766Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:c0dbd8030304a102c005419c815e40aa5929da6df816fb6e7afd3ac403573e8b","observation_id":"a1522277-adbe-44d6-8b8e-e58ff6b58c12","resolution":{"observed_at":"2026-08-11T05:45:54.137766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.141208Z","title":"Kingma, Ab- hishek Kumar, Stefano Ermon, and Ben Poole","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.141208Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:bbae69abb1f67406ba09c8065dc73f25f96600e407c1d89eb2e8e54debb6e66b","observation_id":"3dfd3bf8-f8d6-4cdb-a245-7165c583f528","resolution":{"observed_at":"2026-08-11T05:45:54.141208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03054","last_updated":"2024-02-21T07:12:45Z","snapshot_observed_at":"2026-08-13T05:32:13.331302Z","submitted_at":"2023-11-06T12:10:43Z","title":"AnyText: Multilingual Visual Text Generation And Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03054","snapshot_observed_at":"2026-08-11T05:45:54.144468Z","title":"AnyText: Multilingual Visual Text Gen- eration And Editing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.144468Z"},"links":{"cited_paper":"/paper/2311.03054","citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:b89ac2e0a8bf8307e205eed75eb0544e022556c029ffdf686dfd60292f60d9c0","observation_id":"0d02f40a-f4d3-4215-9539-a03046be485f","resolution":{"observed_at":"2026-08-11T05:45:54.144468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.376173Z","title":"Glyphcontrol: Glyph conditional control for visual text generation","venue":null,"work_id":"536af28d-63cf-44e2-8c53-032f2dd65738","year":2024},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.147962Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:7fa1996ab2172f3c4bf92ee561d323f823112b06b56c87d973af6587e6acd1ff","observation_id":"5c17193d-3251-4244-af5a-c4db9ddaa9a3","resolution":{"observed_at":"2026-08-11T05:45:54.379824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.362991Z","title":"Long-clip: Unlocking the long-text capability of clip, 2024","venue":null,"work_id":"e1201b8f-54a4-4c82-9ea8-816f177ae077","year":2024},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.151114Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:97d43752e8c0d1aed8abc8d69e0d2e44a49ea3ef4a2a1caa257b9898fb620d89","observation_id":"2d8c04b4-8d3e-46c3-a1c3-eee0ee9c063d","resolution":{"observed_at":"2026-08-11T05:45:54.367440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.350724Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"b6d9fc24-8b4a-4196-839e-2e2f68415808","year":2023},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.154138Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:ac45fa6975ae04e41ceef510af385c3e2fbc5642acf2986371d02c185fa4172b","observation_id":"f03aad97-a15e-49a2-ad58-e27632021fe1","resolution":{"observed_at":"2026-08-11T05:45:54.354679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.157738Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.157738Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:9b608a810142868b3c93ed29acf76323397fc7dd7b4b269eafc67a836a336c6c","observation_id":"c02d6877-585f-4d82-ab71-d409ae8d0b2b","resolution":{"observed_at":"2026-08-11T05:45:54.157738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:54.331723Z","title":"Brush your text: Synthesize any scene text on im- ages via diffusion model","venue":null,"work_id":"c07604c8-e69c-412a-9de2-50613c826aaf","year":2024},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.165257Z"},"links":{"citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:392f7d90faa7107e060e6a32932854e56698beffa89986c2c843bcca3fb49480","observation_id":"40ef395d-b24b-4269-8b3e-ad783d5a255e","resolution":{"observed_at":"2026-08-11T05:45:54.335900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04884","last_updated":"2023-12-08T07:47:46Z","snapshot_observed_at":"2026-08-13T05:07:25.275771Z","submitted_at":"2023-12-08T07:47:46Z","title":"UDiffText: A Unified Framework for High-quality Text Synthesis in Arbitrary Images via Character-aware Diffusion Models","version":1},"cited_work":{"arxiv_id":"2312.04884","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.04884","snapshot_observed_at":"2026-08-11T05:45:54.200834Z","title":"UDiffText: A Unified Framework for High-quality Text Synthesis in Arbitrary Images via Character-aware Diffusion Models","venue":"cs.CV","work_id":"593a5ec5-327a-4dab-98f3-2cd6f71c6af7","year":2023},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.168593Z"},"links":{"cited_paper":"/paper/2312.04884","citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:4bcc615c2fdadc561897aa69ffcd5eeb70da94f1de13ea8a501951647e26ab48","observation_id":"13b981e2-4f9b-4bc2-9c69-9a6572dca6a3","resolution":{"observed_at":"2026-08-11T05:45:54.207012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-04T15:27:22.366324Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-11T05:45:54.161125Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.161125Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:136e8c511805bf53fdd4e846160089485bf30d8759f78fca371b0359051f7df2","observation_id":"bfd22a16-6f0b-4425-9200-70da3b6ed929","resolution":{"observed_at":"2026-08-11T05:45:54.161125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09622","last_updated":"2024-07-12T16:39:31Z","snapshot_observed_at":"2026-08-13T00:54:03.593903Z","submitted_at":"2024-03-14T17:55:33Z","title":"Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09622","snapshot_observed_at":"2026-08-11T05:45:54.090483Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:54.090483Z"},"links":{"cited_paper":"/paper/2403.09622","citing_paper":"/paper/2412.17225"},"observation_digest":"sha256:b672c44e0bb40ad41c88a2ddaae3235fb19f066af13914cef07096f976e3d57c","observation_id":"fa5c5579-92f7-4b53-9ea1-4408977906f0","resolution":{"observed_at":"2026-08-11T05:45:54.090483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.17225","last_updated":"2024-12-23T02:40:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T04:34:48.407281Z","submitted_at":"2024-12-23T02:40:07Z","title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 4 inbound Pith citation observations for arXiv:2412.17225."}