{"as_of":"2026-08-14T03:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b29c6b176d995ab0f808f8367178b2f35223286c8e1f2f58b64fc42dc2abde82","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:47:42.242811Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T11:01:35.324580Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09910","snapshot_observed_at":"2026-07-13T11:01:35.324580Z","title":"Igd: Instructional graphic design with multimodal layer generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04192","last_updated":"2026-04-07T16:58:37Z","snapshot_observed_at":"2026-08-13T05:13:04.666226Z","submitted_at":"2026-04-05T17:20:08Z","title":"Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T11:01:35.324580Z"},"links":{"cited_paper":"/paper/2507.09910","citing_paper":"/paper/2604.04192"},"observation_digest":"sha256:a41a02b9d10f6edd94ccd4919edb110964a6557ae3e9e5e263770d4fd6694cef","observation_id":"5298d330-c62b-4909-82ab-65f92a3c9499","resolution":{"observed_at":"2026-07-13T11:01:35.324580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09910/citation-record","integrity":"/paper/2507.09910/integrity","json":"/paper/2507.09910/citation-record.json","paper":"/paper/2507.09910"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.238953Z","title":null,"venue":null,"work_id":"2977dd46-8c2e-46fd-af0e-d33b343afc42","year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.863278Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:41f408635ca42e346ea53e64a95ba091119d2ba6432c3a19493ad28ab9c487e0","observation_id":"a4e54592-735e-4b61-977b-0fe01082064d","resolution":{"observed_at":"2026-08-06T17:47:43.243860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.220106Z","title":null,"venue":null,"work_id":"2e1bf1e5-02f2-4f33-96b3-df9c84858666","year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.870086Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:f4c813a7867b2855030867e358a693979e425045dea481542fc1550e0d0d9845","observation_id":"3c4fa836-310e-400e-ab99-fbd0a875cea8","resolution":{"observed_at":"2026-08-06T17:47:43.224866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:47:41.878400Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.878400Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:720718009cb1ef8a0c5b1ae7f89cc19d00a6df368cd41b937784519194f005e1","observation_id":"6e88a922-1f40-4fe7-8189-52ea1204f035","resolution":{"observed_at":"2026-08-06T17:47:41.878400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:41.884469Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.884469Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:20a03d2d38de3d91742ad9ddfae5b74d21e96878303b2fd14392566a8be6ee07","observation_id":"a5086db3-5d58-4a34-a95b-82559296c4ee","resolution":{"observed_at":"2026-08-06T17:47:41.884469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.194576Z","title":"Variational transformer networks for layout generation","venue":null,"work_id":"2a3c7c67-ae6c-4f64-bb54-3b0e3f8980be","year":2021},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.889936Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:56d2cc07dc300d74622f93c1b1564fcb33ef84878d5c21f9ec053d86c9bee17e","observation_id":"919c5d69-ec93-42ef-9cbf-c8e0a860fb12","resolution":{"observed_at":"2026-08-06T17:47:43.198889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T17:47:41.894526Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.894526Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:eff1fc517dfe176235b5d9e6540e016d1b5f4490dce5ecd3039dc2a075adc0c8","observation_id":"733f5543-a6eb-44d6-847f-688b5b187373","resolution":{"observed_at":"2026-08-06T17:47:41.894526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T17:47:41.899765Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.899765Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:fbf80bdd419f4a6601c186d20e967bba65e813a6b491e80315596f1c74c9d5b1","observation_id":"5b2bc7a1-9ebf-4326-b4b4-f3a163d66eac","resolution":{"observed_at":"2026-08-06T17:47:41.899765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T17:47:41.908874Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.908874Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:5622c6c0ec7a31ef0269d08102279103389040bea5e763490f6460af1a0461a4","observation_id":"445a8dba-1b05-4cba-a628-2d456a35a3c4","resolution":{"observed_at":"2026-08-06T17:47:41.908874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.178562Z","title":"Improving image generation with better captions","venue":null,"work_id":"7c3e113a-1c9a-408c-b9a2-5b38c7a75944","year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.915784Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:1707bd1aa5a8e34826a87a137a0a32f0d40271d712df7ed6309423f6bac0d480","observation_id":"c224a429-d1c4-4f99-aab7-e75314fdc53a","resolution":{"observed_at":"2026-08-06T17:47:43.184028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.164716Z","title":"Textdiffuser: Diffusion models as text painters","venue":null,"work_id":"1775da00-3af7-4719-a81d-ca0f308a8924","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.924619Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:39a06b3433c7bec552cfe90bb0be1daac1d6290d3bac3185dced5db85c00abb2","observation_id":"74a07166-c16f-402d-b723-a1414da3285e","resolution":{"observed_at":"2026-08-06T17:47:43.168793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14368","last_updated":"2024-04-22T17:20:38Z","snapshot_observed_at":"2026-08-13T00:24:28.233767Z","submitted_at":"2024-04-22T17:20:38Z","title":"Graphic Design with Large Multimodal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14368","snapshot_observed_at":"2026-08-06T17:47:41.931816Z","title":"Graphic design with large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.931816Z"},"links":{"cited_paper":"/paper/2404.14368","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:9edb67dccea899624eb71a02a6875ad8bce03b6bc2ab31f53d2d46a9c35e8f26","observation_id":"31929ebe-cb4e-4b4b-a9f3-294e446b3fd9","resolution":{"observed_at":"2026-08-06T17:47:41.931816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:41.941981Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.941981Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:61c09a3ae15f0073cac80c351695dc6b7c8e1968c37128dd46dd807138ed6672","observation_id":"70155036-c6ca-4475-8b94-2042b36a02b2","resolution":{"observed_at":"2026-08-06T17:47:41.941981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-13T10:09:02.594270Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-06T17:47:41.947691Z","title":"Dreamllm: Synergistic multimodal com- prehension and creation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.947691Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:e904c7bbb321ff5a28caf0e8f056674e4cadf0672764658bf6941eb5abbf94ac","observation_id":"cf6090df-98ed-4ee5-ad71-6b3591a22ea3","resolution":{"observed_at":"2026-08-06T17:47:41.947691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.139874Z","title":"SVTR: scene text recognition with a single visual model","venue":null,"work_id":"ba3ab87c-4787-431d-a4d8-240adb9bd0e9","year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.956111Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:771f3bce3b477d0574c9c976f0cb75a12009ac13adcb85efe2dc9e909d9c0ac6","observation_id":"3b794eb6-5fad-440b-8743-27aa6c1f2f3e","resolution":{"observed_at":"2026-08-06T17:47:43.144154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.125508Z","title":"Instruction-guided scene text recognition","venue":null,"work_id":"6ed70602-f31c-4d5c-a8c9-59798680b4df","year":2025},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.963491Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:4dc298e8b285a82496bdb7790e7c7ac393529bf79521b4817f0a4c301f40dbfc","observation_id":"e1541148-cc24-480e-9540-a48ea2b0d4de","resolution":{"observed_at":"2026-08-06T17:47:43.129948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.109799Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"f9e3bc4f-ae72-4b97-af3d-bc6907144918","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.968074Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:898ae220ea1aa61e3768843a83b5ee1208c422c829aee90a100b9d7dc29fa6ad","observation_id":"46609264-79a7-4edd-90d7-b7d7ba357821","resolution":{"observed_at":"2026-08-06T17:47:43.114389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:41.973122Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.973122Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:295e69d9c14b5e19d087dacf679f12d5669f54a83cc8b65cabcf0f36fb0871d4","observation_id":"b5e7c1be-e26b-4f77-af65-067c569573de","resolution":{"observed_at":"2026-08-06T17:47:41.973122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-13T05:59:18.617832Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-06T17:47:41.979247Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.979247Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:d59f36f48bcf4eb3181c97423393b7abc1a3ad21f3b21df7e7c01a76b1df341e","observation_id":"05fce673-ba5d-4366-9c62-e29eeb872097","resolution":{"observed_at":"2026-08-06T17:47:41.979247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-06T17:47:41.985558Z","title":"Seed-x: Mul- timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.985558Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:36f3fdb1ceb4dc974ad315e2aa13885dc9a07d135ef72a3906103823fde6b85c","observation_id":"88ca3cc1-fbc8-423e-9d9e-217e944030c2","resolution":{"observed_at":"2026-08-06T17:47:41.985558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.083905Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"f1282da4-037b-4714-a46e-f89505209349","year":2020},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.993765Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:8b0b3c75ec4cbdd731410f28e4b26391bf4e7f1f5306a75a2d617ff67a719d14","observation_id":"18edc930-1f67-4b6d-b9eb-fbcf9bcd0b3f","resolution":{"observed_at":"2026-08-06T17:47:43.088348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.067999Z","title":"Opencole: Towards reproducible automatic graphic design generation","venue":null,"work_id":"c4e01733-1f01-451b-9dd0-26b841647c1e","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.999236Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:4fb92db4f2c06bc1bc89244c423853f866b54838ab9e6044a901c45448454d82","observation_id":"dc38da2c-88b1-4629-8e91-e807231aba34","resolution":{"observed_at":"2026-08-06T17:47:43.073239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16974","last_updated":"2024-03-18T21:43:20Z","snapshot_observed_at":"2026-08-13T05:15:12.217982Z","submitted_at":"2023-11-28T17:22:17Z","title":"COLE: A Hierarchical Generation Framework for Multi-Layered and Editable Graphic Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16974","snapshot_observed_at":"2026-08-06T17:47:42.004083Z","title":"Cole: A hierarchical generation frame- work for multi-layered and editable graphic design","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.004083Z"},"links":{"cited_paper":"/paper/2311.16974","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:cf14dce5b50dbf2b088658d65b542e385ce84e1c81fe34a082d3660f7d8e6017","observation_id":"babf702b-01fb-4cd0-87d8-e236593b5333","resolution":{"observed_at":"2026-08-06T17:47:42.004083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.013451Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.013451Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:9c7437aaaa2eca29cd74b44cf76fb44dfd9d11b4091e28fa1a3132bd095f200a","observation_id":"096a90b3-fda0-4ac3-8022-32059becb0ee","resolution":{"observed_at":"2026-08-06T17:47:42.013451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.040560Z","title":"Autoposter: A highly automatic and content-aware design system for ad- vertising poster generation","venue":null,"work_id":"a53a834a-2f4f-4e90-b172-a66b9110a888","year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.019100Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:964a9f2838d61fd7b328b1aa4984742481ae71abc0425148971cf5c7e3e7caa3","observation_id":"fd0d7816-3cff-464b-9dfe-d78b4ff9b31e","resolution":{"observed_at":"2026-08-06T17:47:43.045116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10562","last_updated":"2023-05-03T16:36:38Z","snapshot_observed_at":"2026-08-13T13:17:49.689853Z","submitted_at":"2022-12-20T18:59:23Z","title":"Character-Aware Models Improve Visual Text Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10562","snapshot_observed_at":"2026-08-06T17:47:42.024222Z","title":"Character-aware models improve visual text rendering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.024222Z"},"links":{"cited_paper":"/paper/2212.10562","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:33caefc244234c2fba2cdae2df814f742833a2228c361fa4b2fa327ab7179f16","observation_id":"b2704528-4dfe-49f8-9cd7-40541872ba29","resolution":{"observed_at":"2026-08-06T17:47:42.024222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.025983Z","title":"Glyph-byt5: A customized text encoder for accurate visual text rendering","venue":null,"work_id":"add839fc-0053-40e7-aa43-51e1b654c8e8","year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.030050Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:d7ce3df4bebbadbf0b45e25f6152e1011575e41ec2d0579416f06cd4bb662e00","observation_id":"fa96d78e-d396-496c-a62a-441f87825ca6","resolution":{"observed_at":"2026-08-06T17:47:43.030779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17870","last_updated":"2023-05-23T04:07:00Z","snapshot_observed_at":"2026-08-13T12:12:43.873574Z","submitted_at":"2023-03-31T08:06:33Z","title":"GlyphDraw: Seamlessly Rendering Text with Intricate Spatial Structures in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17870","snapshot_observed_at":"2026-08-06T17:47:42.036151Z","title":"Glyphdraw: Learning to draw chinese characters in image synthesis models coher- ently","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.036151Z"},"links":{"cited_paper":"/paper/2303.17870","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:0ffadbab9d68c18849f9834d9727a3ba30ffefae72a8a5b7aaef47919b12a033","observation_id":"2ddcc802-8b17-4f34-9de4-ece4572caa94","resolution":{"observed_at":"2026-08-06T17:47:42.036151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.011146Z","title":"Novelai improvements on stable diffusion, 2023","venue":null,"work_id":"6c310afe-7d05-4fd5-b503-b1381bec75c8","year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.043255Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:5ef5db109339c362eb12e1374d55ef8d1bc7de489ae7d3bbfa146cb748e001da","observation_id":"d788e3b7-32e8-4ea4-87dc-b8b1ee0aff3b","resolution":{"observed_at":"2026-08-06T17:47:43.015767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T17:47:42.051268Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.051268Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:433654ef1fc9171ae848314024431dd663245443f27952c3cc2dd2da4b5284b8","observation_id":"aff5b46b-fcc3-45f6-a307-41ff1fd70512","resolution":{"observed_at":"2026-08-06T17:47:42.051268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.996563Z","title":"Boosting semi- supervised scene text recognition via viewing and summariz- ing","venue":null,"work_id":"89386910-8751-416c-b0e7-f4da8b2a0b88","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.058715Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:dc7b2481aefbb8496a5d921598a1a2fee69d4ac358ab946e135a15205dc30546","observation_id":"e4bded86-80e2-403f-9a71-759394563fce","resolution":{"observed_at":"2026-08-06T17:47:43.001415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.067377Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.067377Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:24cf576aeccc46b31676ff797d55802ffb8f03a56a8c12f8d4dcf401466a3e52","observation_id":"91da3966-957b-4d08-b220-6b5504d921de","resolution":{"observed_at":"2026-08-06T17:47:42.067377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.074676Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.074676Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:f27b78850ecad75e9e9eda55ce59f3f0b69c744e17c3933fa61d9864f980785f","observation_id":"3be1c975-559e-47fa-9d17-8118c74d5379","resolution":{"observed_at":"2026-08-06T17:47:42.074676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.961804Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"a0ad0340-f1b7-4287-8b65-217b0172b6cc","year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.080604Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:a8870e6d958b1e97093cd522a684eb98af9c01ecb8fb1e3be5b9568fddd08ab4","observation_id":"bb8ce54d-b144-4f0d-8dce-04bf941c641e","resolution":{"observed_at":"2026-08-06T17:47:42.966745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.947712Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"7b5f7379-b6e6-4237-b362-9bcf8d7c8594","year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.086926Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:4a0aa95bb10798ab3b7d28c113d0ec0c9b8b09634804107b65dc4a8c63d0e810","observation_id":"f167a077-312d-4a70-a80e-e7cd79108757","resolution":{"observed_at":"2026-08-06T17:47:42.952023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.932485Z","title":"Potrace: a polygon-based tracing algorithm,","venue":null,"work_id":"9b19bc0e-6740-46f9-8d20-b806535a25fa","year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.096229Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:52b0587a223ceb8c18fb1afb4221dcddd6c7e0203b59cce6584fde6b4fdba644","observation_id":"b47c8be5-9084-4c27-a0e5-a4c037ba4327","resolution":{"observed_at":"2026-08-06T17:47:42.936592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T17:47:42.108931Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.108931Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:b3a300f4b50796cccece0fbe11c545602a264016efe60c493acf01a0c3300ca4","observation_id":"415d539d-9c43-4796-8eee-dca08f895b24","resolution":{"observed_at":"2026-08-06T17:47:42.108931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.918236Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"5084e5a6-ca09-4f96-8ce3-891c5acb309e","year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.116688Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:c210e7c8d372929103bc61fa692767a37b073a043808802edf655e17dfca7e3c","observation_id":"21956ea7-c28a-42f7-863f-f05cb26a2042","resolution":{"observed_at":"2026-08-06T17:47:42.922603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T17:47:42.124987Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.124987Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:33f9d67460a32893526fb0db3500e6fee933e7376d879f708a6e68b8f36018aa","observation_id":"f82b1e0f-c223-43c8-881a-3f9ee12d6e47","resolution":{"observed_at":"2026-08-06T17:47:42.124987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T17:47:42.130015Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.130015Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:3778cf6f7bb46baf4fc7a38abec4e73e0a53d77d9296a0eb2ec995740d05bf91","observation_id":"42d2d490-4099-47d5-bd80-5866f4bce8a6","resolution":{"observed_at":"2026-08-06T17:47:42.130015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03054","last_updated":"2024-02-21T07:12:45Z","snapshot_observed_at":"2026-08-13T05:32:13.331302Z","submitted_at":"2023-11-06T12:10:43Z","title":"AnyText: Multilingual Visual Text Generation And Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03054","snapshot_observed_at":"2026-08-06T17:47:42.136102Z","title":"Anytext: Multilingual visual text gen- eration and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.136102Z"},"links":{"cited_paper":"/paper/2311.03054","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:ca1d808670fc7d8a4f23c70111959dbb3290b8423b117b0974978b5fb4f3b118","observation_id":"4f180de3-5e9d-43a7-9968-a0d7f54a9c4d","resolution":{"observed_at":"2026-08-06T17:47:42.136102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.141183Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.141183Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:96c71fe17c933dfc808fd2c98c2528f0b99683d953b432bc66dcb4ab32aa2b61","observation_id":"349e10fd-3156-4aee-88bc-9defb7f64707","resolution":{"observed_at":"2026-08-06T17:47:42.141183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T17:47:42.148888Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.148888Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:995b245f49a5be376657c86ee4d210c02ede0b665eb00208ab47636a5be604ac","observation_id":"835e50c9-c67b-4656-9988-7c2800815202","resolution":{"observed_at":"2026-08-06T17:47:42.148888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T17:47:42.156308Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.156308Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:05efaa476aaac896831b3644fcde9a9675d0cca6b839d16c5112950dd7325690","observation_id":"8ca5c10e-e30f-435e-9a27-aadbf8e43556","resolution":{"observed_at":"2026-08-06T17:47:42.156308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-06T17:47:42.162445Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.162445Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:69088d389d73aaaab7781b926a21dae4ed2a41a39fbb79a0361871a685e4b9b2","observation_id":"54ddac35-e20a-46b0-b768-1c0de6e45bf3","resolution":{"observed_at":"2026-08-06T17:47:42.162445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-06T17:47:42.167491Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.167491Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:41b5fc0138ada927d1ccef67a2546d857a40e08e09d97f58d7cbe723e417106a","observation_id":"0d483399-029a-4025-af25-f559a1e4b9e7","resolution":{"observed_at":"2026-08-06T17:47:42.167491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T17:47:42.177873Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.177873Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:72e9a86847d95ec56f381cb9e5997281f00edf98b51da6832195ec51e29b7b35","observation_id":"ec8ccf61-5e2a-4ef2-90d2-3f8abc6388b1","resolution":{"observed_at":"2026-08-06T17:47:42.177873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02884","last_updated":"2024-11-26T06:29:12Z","snapshot_observed_at":"2026-08-12T23:50:00.187022Z","submitted_at":"2024-06-05T03:05:52Z","title":"PosterLLaVa: Constructing a Unified Multi-modal Layout Generator with LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02884","snapshot_observed_at":"2026-08-06T17:47:42.183539Z","title":"Posterllava: Constructing a uni- fied multi-modal layout generator with llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.183539Z"},"links":{"cited_paper":"/paper/2406.02884","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:0d37880702af973fe5906ac9a1cd09a9f1fbb4d913214bf7c79a6806f84b821a","observation_id":"65f3be12-cf3c-416b-8424-352dd227a140","resolution":{"observed_at":"2026-08-06T17:47:42.183539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.892748Z","title":"Glyphcontrol: Glyph conditional control for visual text generation","venue":null,"work_id":"23de48ed-3ac3-4162-b324-6eaad6855346","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.191543Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:25d9313f7b167bb7a30bf508e54216edead758a4de1078ecc3f69048730a3ecb","observation_id":"6856253a-2d9e-4c4b-937c-68b9fb68e6d7","resolution":{"observed_at":"2026-08-06T17:47:42.897579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T17:47:42.202248Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.202248Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:f1b45ba79e5d286f9cfaf05bc370a6fb0b351f2125ec7f33520404b45ba55b90","observation_id":"2d5e9827-7b29-4420-b91b-f365fe9ac499","resolution":{"observed_at":"2026-08-06T17:47:42.202248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11502","last_updated":"2024-07-21T08:22:18Z","snapshot_observed_at":"2026-08-12T23:21:19.826826Z","submitted_at":"2024-07-16T08:40:21Z","title":"How Control Information Influences Multilingual Text Image Generation and Editing?","version":2},"cited_work":{"arxiv_id":"2407.11502","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.11502","snapshot_observed_at":"2026-08-06T17:47:42.387728Z","title":"How Control Information Influences Multilingual Text Image Generation and Editing?","venue":"cs.CV","work_id":"8dc31572-38c6-4178-a2f9-3e317aa6045f","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.207523Z"},"links":{"cited_paper":"/paper/2407.11502","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:a96e2109c26b459710932c7faf151319c49930881b2042ac2fab2727c4d6b8c8","observation_id":"05cf33f3-0a00-4dbf-a5be-a25db379dd1b","resolution":{"observed_at":"2026-08-06T17:47:42.393461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.213468Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.213468Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:fdfd5e39be6436d29fad414d4e7e96d86f9d388c3c6e942df7efd43e4ae0511d","observation_id":"0614e2be-3e94-4567-92b2-7e43003ffb8f","resolution":{"observed_at":"2026-08-06T17:47:42.213468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.861330Z","title":"CDistNet: Perceiving multi- domain character distance for robust text recognition","venue":null,"work_id":"c4873ead-ee69-4ddd-abb0-a181c167e1a6","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.219019Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:71bcb23375a0e32ff9d98aaa64a6b58865dd8627c434a0cec8969d0868de78f7","observation_id":"e1c6f685-7263-48b0-81f1-238cb89da82d","resolution":{"observed_at":"2026-08-06T17:47:42.866265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-06T17:47:42.225102Z","title":"Transfusion: Pre- dict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.225102Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:20bfe6ba5f3465455874078591bfb8154ab0b6834ac69d2eadfd7417fbfaf80d","observation_id":"b6b1bb84-aaa4-4ff0-8c76-80cfd7e16f45","resolution":{"observed_at":"2026-08-06T17:47:42.225102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00303","last_updated":"2022-07-13T05:09:51Z","snapshot_observed_at":"2026-08-13T15:52:44.364167Z","submitted_at":"2022-04-30T16:42:13Z","title":"Composition-aware Graphic Layout GAN for Visual-textual Presentation Designs","version":3},"cited_work":{"arxiv_id":"2205.00303","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.00303","snapshot_observed_at":"2026-08-06T17:47:42.322406Z","title":"Composition-aware Graphic Layout GAN for Visual-textual Presentation Designs","venue":"cs.CV","work_id":"0e52baf7-cbd6-405b-8721-497c3d55d06f","year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.235544Z"},"links":{"cited_paper":"/paper/2205.00303","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:5f8e30de4381bdff7a67471d24bea42640c376621fad90316879971086d064f1","observation_id":"e5371ea6-71c1-47f7-8e12-ec26bd8019f9","resolution":{"observed_at":"2026-08-06T17:47:42.329176Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T17:47:42.242811Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.242811Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:0eac22780faa4b5172abf27b771ddb9f2186a800d9258e5581d8b837a519522e","observation_id":"887eddcf-7498-4b2e-932c-14868959cb8b","resolution":{"observed_at":"2026-08-06T17:47:42.242811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2507.09910."}