{"as_of":"2026-08-14T10:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba8ab61929797f1e83b41b50f3fc734daad4cde6b36911567597c0a0af2971a4","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:45:41.356187Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T19:02:01.962726Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T19:02:48.647832Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"cited_work":{"arxiv_id":"2412.07589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07589","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffsensei: Bridging multi- modal llms and diffusion models for customized manga gen- eration","venue":null,"work_id":"5e16e527-2709-4d84-8ff6-6d92068026ef","year":2024},"citing_paper":{"arxiv_id":"2509.04123","last_updated":"2026-04-11T07:57:17Z","snapshot_observed_at":"2026-07-06T22:23:59.676849Z","submitted_at":"2025-09-04T11:37:06Z","title":"TaleDiffusion: Multi-Character Story Generation with Dialogue Rendering","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-18T19:02:01.962726Z"},"links":{"cited_paper":"/paper/2412.07589","citing_paper":"/paper/2509.04123"},"observation_digest":"sha256:0bb80a22702584188a38acee5329045ac57c37b606a35708277b86562e5466c5","observation_id":"314501bf-3cad-4343-9640-d7315b222c17","resolution":{"observed_at":"2026-05-18T19:02:48.651255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.07589/citation-record","integrity":"/paper/2412.07589/integrity","json":"/paper/2412.07589/citation-record.json","paper":"/paper/2412.07589"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:42.151863Z","title":"manga109","venue":null,"work_id":"6cf4e4d6-6fca-416c-a7fd-99c32721569e","year":2020},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.105552Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:76f1edddc7fe14f441e7bf4e81a878708770362aa907c72882213ca0679ba77b","observation_id":"773722b5-c8ca-4726-ba22-04aad92fefdd","resolution":{"observed_at":"2026-08-11T18:45:42.156162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08261","last_updated":"2025-03-13T15:09:10Z","snapshot_observed_at":"2026-08-13T19:07:58.782859Z","submitted_at":"2024-10-10T17:59:17Z","title":"Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08261","snapshot_observed_at":"2026-08-11T18:45:41.110816Z","title":"Meissonic: Revitalizing masked generative trans- formers for efficient high-resolution text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.110816Z"},"links":{"cited_paper":"/paper/2410.08261","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:3df74dc8a21e6d32e2c27f643d6098453704f74b23f348723d4e7acc1b6055c0","observation_id":"09dc404a-c473-4ed9-8251-311940ecfcf0","resolution":{"observed_at":"2026-08-11T18:45:41.110816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.120749Z","title":"Anydoor: Zero-shot object-level im- age customization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.120749Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:aecfc5ac6992049c5d7dc29e470f9b4cce2e1a3fdae68ae895f5b9b78ad593b0","observation_id":"0ecc44a4-dd73-40a4-ad60-580dee0df27f","resolution":{"observed_at":"2026-08-11T18:45:41.120749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01388","last_updated":"2025-05-30T13:55:44Z","snapshot_observed_at":"2026-08-12T23:51:30.138669Z","submitted_at":"2024-06-03T14:51:24Z","title":"AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01388","snapshot_observed_at":"2026-08-11T18:45:41.125747Z","title":"Au- tostudio: Crafting consistent subjects in multi-turn interac- tive image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.125747Z"},"links":{"cited_paper":"/paper/2406.01388","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:f1d239cc49b3a5865cd6473e88c65143ec4ae1657bcbd11011833f62d55f13bc","observation_id":"8953e0ff-0aab-419f-81af-be3b77de731a","resolution":{"observed_at":"2026-08-11T18:45:41.125747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.130770Z","title":"Guiding instruction-based im- age editing via multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.130770Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:b16a1061d49b641c3bd4a127955b2058e7e378cdd64751f9c7cceae705f292b4","observation_id":"042f6b93-1a6c-4514-9dd0-6cd8b9e32425","resolution":{"observed_at":"2026-08-11T18:45:41.130770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-11T18:45:41.135530Z","title":"An image is worth one word: Personalizing text-to- image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.135530Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:1ddd2c508a4eb7fa5e28a0eac1be6234a286a73598c09ac1c30bdb5ee3bed144","observation_id":"b0559dba-793b-46ec-a997-0335231e905b","resolution":{"observed_at":"2026-08-11T18:45:41.135530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-11T18:45:41.140601Z","title":"Seed-x: Mul- timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.140601Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:3246836ef50ae78fbf506c98ab11d9203a8700e03bc2189f80d9624e5c781bff","observation_id":"38aecb32-e63b-4caa-b7f0-98e31cb6a19e","resolution":{"observed_at":"2026-08-11T18:45:41.140601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:42.119437Z","title":"Mix-of-show: Decentralized low- rank adaptation for multi-concept customization of diffusion models","venue":null,"work_id":"296e59cf-487a-4aeb-91c2-fee8bec93977","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.145801Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:665873254f6f11861dc61a40b6ed13ad60a1f1ef4891696dec5f0c7b3860d963","observation_id":"cf510d77-bf79-4660-93eb-1e9ae3fb968c","resolution":{"observed_at":"2026-08-11T18:45:42.124010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:42.105041Z","title":"Imagine this! scripts to composi- tions to videos","venue":null,"work_id":"2add5e29-a886-4694-9308-622f290cf4e4","year":2018},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.150811Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:2ecb9b8572f45cfe37ea65c113f1fea9674580c0c7f21396ae9f40fcf065c5b0","observation_id":"c7a1a330-130f-4241-9a1b-c1dababf9763","resolution":{"observed_at":"2026-08-11T18:45:42.109739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00551","last_updated":"2023-12-31T17:41:48Z","snapshot_observed_at":"2026-08-13T04:50:44.096784Z","submitted_at":"2023-12-31T17:41:48Z","title":"A Generalist FaceX via Learning Unified Facial Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00551","snapshot_observed_at":"2026-08-11T18:45:41.155966Z","title":"A generalist facex via learning unified facial representation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.155966Z"},"links":{"cited_paper":"/paper/2401.00551","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:1ba4e42a47f81f7c0575d5c6e458e09215c096c40122a15f69453485e15133f3","observation_id":"72a46c8e-03a5-4cd9-8422-c2d781dc0039","resolution":{"observed_at":"2026-08-11T18:45:41.155966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:42.090204Z","title":"Face adapter for pre-trained diffusion models with fine- grained id and attribute control","venue":null,"work_id":"c1aebfa5-c779-49af-8aeb-a144afeb8b38","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.160934Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:7d23907664f7cb90f95b729603121eb69ccd67f3979be7e599c0493418c545ec","observation_id":"feb4980f-38fe-4a9b-ac37-eb21b2ccd753","resolution":{"observed_at":"2026-08-11T18:45:42.095272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:42.075445Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"fb3df96e-f211-47d2-bf04-ef705a2a08c5","year":2017},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.165972Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:23d064da64537d615aee0b6c7c09622546896d81e687fee8f6fc6d0d44511195","observation_id":"f94fc723-4a74-4a31-9bc2-ac07888183fa","resolution":{"observed_at":"2026-08-11T18:45:42.080150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T18:45:41.170571Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.170571Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:9d2b1c6fe3ab584a3f99cd3c9c89c7c15ca0b96c342265fa1f0e70be6c47a068","observation_id":"d10fdce0-62ed-4181-8e76-f5e41b69593d","resolution":{"observed_at":"2026-08-11T18:45:41.170571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:42.060786Z","title":"Visual storytelling","venue":null,"work_id":"a06307de-6027-497f-82a7-39f0be1657e7","year":2016},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.175482Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:7e0cab5bb81cfc03cc423536ec7f164543fad68dfb3c375e6dc58a9f49207eb2","observation_id":"0f0143e9-d1b0-4d58-a821-9066f587e2af","resolution":{"observed_at":"2026-08-11T18:45:42.065506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:42.045781Z","title":"Smartedit: Exploring com- plex instruction-based image editing with multimodal large language models","venue":null,"work_id":"664945b7-f00e-4dff-a044-2f8349d87479","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.180002Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:0e5a0c4bc597070a96e8bb1f0a613b9f561abfa366053c600fdf238a1661a7c6","observation_id":"7d4b624a-9cfe-408b-a36d-770db086e425","resolution":{"observed_at":"2026-08-11T18:45:42.050567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:42.030177Z","title":"Announcing black forest labs, 2024","venue":null,"work_id":"2f615d63-3402-4f80-9f62-f107980cd704","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.184441Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:0465f2a37f45695c824f07b6b7ae952bf258b8114add8e14d18238ac5a37cfa7","observation_id":"9a93f684-3463-4ac4-95ca-4bd167c28f57","resolution":{"observed_at":"2026-08-11T18:45:42.035948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:42.015078Z","title":"Storygan: A sequential conditional gan for story visu- alization","venue":null,"work_id":"63348560-56a0-405d-b31d-594b3a580354","year":2019},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.188857Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:a100a7922633ff4170a49ebc7db894e5835b301e9e8eeb8435863b9a846aee4f","observation_id":"39662e98-5410-4bf7-b631-0ab6ebcc86b0","resolution":{"observed_at":"2026-08-11T18:45:42.019867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.998536Z","title":"Photomaker: Customizing re- alistic human photos via stacked id embedding","venue":null,"work_id":"d5a1c9a5-a1bd-45fb-b94f-390ea45af9d2","year":null},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.193235Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:0a689ee25d108392974ec866194f0f0fb6dabb8c0e5197c95197361801f51120","observation_id":"c8efdead-3656-42f0-9ac9-2cc6803d7672","resolution":{"observed_at":"2026-08-11T18:45:42.003796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.982954Z","title":"Sketch2manga: Shaded manga screening from sketch with diffusion models","venue":null,"work_id":"8a59620e-b7d8-429e-b9bf-7de673def9d8","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.198232Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:a1e575815942657ff149a9fe7e843bb6473739df664db2107b59c02d1fdf4c0d","observation_id":"7066cf9e-6c22-441e-92b3-b37107bb6332","resolution":{"observed_at":"2026-08-11T18:45:41.987661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.967862Z","title":"Intelligent grimm-open-ended vi- sual storytelling via latent diffusion models","venue":null,"work_id":"b34e880b-24a8-4f66-880d-8e0520970f33","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.202694Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:b9d579ab635f5bb9f1acfa34636bcf81dcf41d49ee7b17abfdfc5f8123992bbe","observation_id":"15a55421-9903-453f-bb84-5e59c5d9ed69","resolution":{"observed_at":"2026-08-11T18:45:41.973143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T18:45:41.207732Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.207732Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:fc2399b0de0cf9d2b435a776a6858af44eb493b8ea3b87266714c3456a65063f","observation_id":"de84f89a-25ed-420e-81e1-07403cf16c70","resolution":{"observed_at":"2026-08-11T18:45:41.207732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T18:45:41.213276Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.213276Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:ad3579a43890cd67a6229be39febde180e72421debc8ac72dcd1a20aa347fec7","observation_id":"2eaab4a8-7e68-48d6-b17c-2dad4fcebee8","resolution":{"observed_at":"2026-08-11T18:45:41.213276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T18:45:41.218197Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.218197Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:c2a91ba86b5e04512db291c40379e731d0b516719b79ef3f7e4ef7031ea8ebcf","observation_id":"35842c52-c4c3-432c-80dc-2d57d42fc901","resolution":{"observed_at":"2026-08-11T18:45:41.218197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.952470Z","title":"Synthesizing coherent story with auto-regressive la- tent diffusion models","venue":null,"work_id":"189890d6-636e-4757-aedf-d1ce3a72af2b","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.222919Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:1e8d9dff1ae1f8f8dbddc781a57ee725922542e0621d011331ad96d6feebbe80","observation_id":"f33af489-9f6f-42dd-bc1f-65dc11ff6177","resolution":{"observed_at":"2026-08-11T18:45:41.957447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T18:45:41.227442Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.227442Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:bf1532b965894c269b91e08eca74c90c2004bb102c8c0fef9cfe25ffbe54166f","observation_id":"1b265ddb-ea1b-460c-b55b-5a034c51b40b","resolution":{"observed_at":"2026-08-11T18:45:41.227442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.937147Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"6a0b61b4-b124-4932-b00e-7f4d367e2aec","year":2021},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.232390Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:042be508a2c00a6b7ff2919c7f42bd9e6dd3289d4ca8bd95737b0ca1b5c831b3","observation_id":"1785eb3b-9cd8-42e8-a303-d67ae6bbcd3e","resolution":{"observed_at":"2026-08-11T18:45:41.942102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.237857Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.237857Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:bcd6e792d84a7330d5650da8be5ad770b35b5186fc25d0a8c048f6473ed19fcc","observation_id":"1d37f950-01e3-4ac5-9791-5e375e91f9ef","resolution":{"observed_at":"2026-08-11T18:45:41.237857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.242483Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.242483Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:74113440ed1eff56fff913916c9f926b756c46314266c24c7036dce23c18750d","observation_id":"f6f91206-ea74-47db-b11a-34011e0303a9","resolution":{"observed_at":"2026-08-11T18:45:41.242483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.902538Z","title":"The manga whis- perer: Automatically generating transcriptions for comics","venue":null,"work_id":"2f6b9bc9-503e-41e4-b7ab-13c3692eb677","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.247185Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:2ba245ee63ffa01f33c548d0aedcde9915251d232878da95e9097aab909f9ff7","observation_id":"05520532-f666-4d4d-be16-9cfc745ae795","resolution":{"observed_at":"2026-08-11T18:45:41.907651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00298","last_updated":"2024-08-01T05:47:04Z","snapshot_observed_at":"2026-08-12T23:10:31.927803Z","submitted_at":"2024-08-01T05:47:04Z","title":"Tails Tell Tales: Chapter-Wide Manga Transcriptions with Character Names","version":1},"cited_work":{"arxiv_id":"2408.00298","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.00298","snapshot_observed_at":"2026-08-11T18:45:41.520636Z","title":"Tails Tell Tales: Chapter-Wide Manga Transcriptions with Character Names","venue":"cs.CV","work_id":"1beb2980-2691-4ceb-b3a4-b7adc03d0397","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.251697Z"},"links":{"cited_paper":"/paper/2408.00298","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:92bf9a7e8b1cde045b53140d65f37e558b2f0b2d3f2d6379a5b28d0514b423fa","observation_id":"15b4a452-d8c3-4081-87aa-316d192f256d","resolution":{"observed_at":"2026-08-11T18:45:41.527477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23280","last_updated":"2025-04-05T14:15:09Z","snapshot_observed_at":"2026-08-12T22:11:31.427527Z","submitted_at":"2024-10-30T17:57:21Z","title":"DreamRelation: Bridging Customization and Relation Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23280","snapshot_observed_at":"2026-08-11T18:45:41.256153Z","title":"Rela- tionbooth: Towards relation-aware customized object gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.256153Z"},"links":{"cited_paper":"/paper/2410.23280","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:260b00f82c7a30b64c88cfe7b22a44200ec85d13da7432e00b64ddc64ed08a10","observation_id":"a3503d35-712f-441d-a6c9-951752f1bc66","resolution":{"observed_at":"2026-08-11T18:45:41.256153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.887673Z","title":"Mangagan: Unpaired photo-to-manga transla- tion based on the methodology of manga drawing","venue":null,"work_id":"11beb78a-d4bb-4e94-802e-fd3fe9e1728f","year":null},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.260946Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:94500874a0ea7c264948441c38bfa74ab63a30927efc764aa9ed9f8bfa5ba04a","observation_id":"c43dd1c0-6ff5-482c-9357-deaf35d1d481","resolution":{"observed_at":"2026-08-11T18:45:41.892212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.869874Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":"f6c09226-41f7-44fc-85b3-0245d619190b","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.266358Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:568322a37e847c68e8bef6e0841b7fd6a5568837e44844d96226de3ca7af3f3c","observation_id":"893ebc0a-2a88-43d1-a486-d9272179f7bc","resolution":{"observed_at":"2026-08-11T18:45:41.874894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09502","last_updated":"2025-01-08T10:11:44Z","snapshot_observed_at":"2026-08-12T22:44:52.388244Z","submitted_at":"2024-09-14T18:26:26Z","title":"One missing piece in Vision and Language: A Survey on Comics Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09502","snapshot_observed_at":"2026-08-11T18:45:41.271087Z","title":"One missing piece in vision and language: A survey on comics understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.271087Z"},"links":{"cited_paper":"/paper/2409.09502","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:a4d8bb4575b85bb3a6561297a0629aef565a005847a38b253fe8227120f99c3d","observation_id":"da4e0ec0-b27f-46d1-bdb1-3655d2984f80","resolution":{"observed_at":"2026-08-11T18:45:41.271087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-06T23:08:20.817133Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-11T18:45:41.276182Z","title":"Instantid: Zero-shot identity-preserving gener- ation in seconds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.276182Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:fe6917d305714e158c28c5646c423320090cc7f0f1c30b2abfee9e72c0e2296a","observation_id":"10d5035c-fe53-4954-89b2-29dd1b12630d","resolution":{"observed_at":"2026-08-11T18:45:41.276182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11243","last_updated":"2023-11-19T06:07:37Z","snapshot_observed_at":"2026-08-13T05:22:30.574677Z","submitted_at":"2023-11-19T06:07:37Z","title":"AutoStory: Generating Diverse Storytelling Images with Minimal Human Effort","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11243","snapshot_observed_at":"2026-08-11T18:45:41.281026Z","title":"Autostory: Generating di- verse storytelling images with minimal human effort","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.281026Z"},"links":{"cited_paper":"/paper/2311.11243","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:4ff196a823faf6aadff05d7e90d131938d543d0f66ef1c20ed85e2bc00dd393a","observation_id":"5167e3a6-5333-48d8-8d9d-aead243697cf","resolution":{"observed_at":"2026-08-11T18:45:41.281026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.853850Z","title":"Instancediffusion: Instance-level control for image generation","venue":null,"work_id":"bb8db083-c2c7-453f-91ac-c31facddc51c","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.285595Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:30cb88f351e9b80f137042fb6dc107dcd2f545975df0aa3109dd15651ebbb9f5","observation_id":"2412e76d-bd1c-4386-aa83-b8d0a1456698","resolution":{"observed_at":"2026-08-11T18:45:41.859815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07209","last_updated":"2025-03-04T06:21:26Z","snapshot_observed_at":"2026-08-12T23:45:36.650177Z","submitted_at":"2024-06-11T12:32:53Z","title":"MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07209","snapshot_observed_at":"2026-08-11T18:45:41.290187Z","title":"Ms-diffusion: Multi-subject zero-shot im- age personalization with layout guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.290187Z"},"links":{"cited_paper":"/paper/2406.07209","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:c0fb30bbcfd6be00224da3a6d2c4d2f3797a4606d07b80e1a8c2a1cfc3a92ede","observation_id":"5c9e2ff2-4851-4628-98ba-d9049b3e2f36","resolution":{"observed_at":"2026-08-11T18:45:41.290187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T18:45:41.294864Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.294864Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:be2a188c231da314e68f8eb085f4ff88c5b4a53c9bce30f5bf7fcdf9c0a6fd6d","observation_id":"e2195d38-288a-4ffb-b1a5-44f7985bcd0d","resolution":{"observed_at":"2026-08-11T18:45:41.294864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.838624Z","title":"Genartist: Multimodal llm as an agent for unified image gen- eration and editing","venue":null,"work_id":"cb29d416-a45a-4d8e-8014-443efb41f4c1","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.299529Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:377a2a58e30bc6f3ced4c321cc385e405652f3b212ec22ea1e017047ff5ea777","observation_id":"3f451203-056f-48d8-bef4-90808f168a5c","resolution":{"observed_at":"2026-08-11T18:45:41.843972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.823648Z","title":"Towards language-driven video inpainting via multimodal large language models","venue":null,"work_id":"69fa9054-e8b9-4262-9425-580c8e1320e9","year":null},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.304207Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:8ebc14bb44aa1d48064a73340a8798f22ed8b8eb4d3817bb7d4d22ca9ec2bb5a","observation_id":"0e21964f-f30e-4a25-863e-e03236d8a4b3","resolution":{"observed_at":"2026-08-11T18:45:41.828426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.808649Z","title":"Towards open vocabulary learning: A survey","venue":null,"work_id":"d24161cd-300d-4774-8bb7-089c3d798060","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.308953Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:5d1f0d70d4dbcbfc288345237b4735101c983e1478d97cfc5e97fca463abe1ab","observation_id":"a8541bb7-9eed-493e-8155-c920cba572a3","resolution":{"observed_at":"2026-08-11T18:45:41.813274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.792277Z","title":"Mo- tionbooth: Motion-aware customized text-to-video genera- tion","venue":null,"work_id":"b52cc405-0006-40ee-be90-e0377220e455","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.314153Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:c0e2a355617ee4e9e0f01b9df453751a860c61d3ad13a2e79ca2439c1a543eb3","observation_id":"d7b7c7f3-b8c7-43a0-b7ca-6dcce347f284","resolution":{"observed_at":"2026-08-11T18:45:41.797095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.777479Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":"b663dc17-7052-4583-ad5f-c7f7f3a3f3e1","year":2023},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.318761Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:c0ad94522d47be95c306cca2e70ee3abbad8acd4dcbe1f96311b6f13ed194fc8","observation_id":"1ac71443-3422-45bb-a9c5-afb609291f86","resolution":{"observed_at":"2026-08-11T18:45:41.782276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-14T05:39:12.719595Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-11T18:45:41.323022Z","title":"Seed-story: Multimodal long story generation with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.323022Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:d0198f13f63b3ebcf0a5da9c15de0b98126265806e23d9814fae6737cbff8584","observation_id":"5c8e3fd8-4ab9-4867-a02e-6da472943178","resolution":{"observed_at":"2026-08-11T18:45:41.323022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-11T18:45:41.327685Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.327685Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:9494007c041437ebfb56ead80cda318396de1ae9cff13c65ef6f9e760850b3cf","observation_id":"772b6d5b-2d2e-4c8c-8ea1-2fe7bc3032b1","resolution":{"observed_at":"2026-08-11T18:45:41.327685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.762037Z","title":"Ai-driven background generation for manga illustrations: A deep generative model approach","venue":null,"work_id":"2b9fc363-88d6-4ba0-ab61-27b634b7a93a","year":null},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.332599Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:3b905535082a9d0c85d14a0539c4550de14f06b3a00e01e3834456abcef80482","observation_id":"441f541f-b9f5-411c-9415-c93aa10e5888","resolution":{"observed_at":"2026-08-11T18:45:41.766703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.746646Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"13339118-11f1-45a4-85bb-4689b1d87628","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.337047Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:eceb54dff807b55cf7c7ce6b25953ec3dce0f6183bca8746fff721b8798311dd","observation_id":"5900f635-7cb0-4b9c-aa86-02c66ccd6e0a","resolution":{"observed_at":"2026-08-11T18:45:41.751701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.730928Z","title":"Generating manga from illustrations via mimicking manga creation workflow","venue":null,"work_id":"77c134ca-d662-4051-9f10-d190ab6f44da","year":2021},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.341911Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:d043d88d79b0b2a88a384e3253630b4b0125491bb176955a9913bb8159c348be","observation_id":"2738b748-fe71-429f-9f5a-1418b1e90656","resolution":{"observed_at":"2026-08-11T18:45:41.736194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.346403Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.346403Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:d9370fb5715df49eb675f99bb225c5547a1fd0c69e6ef9d601e0c0683adde23b","observation_id":"307b0686-c2b0-469e-9d30-85228e859f9c","resolution":{"observed_at":"2026-08-11T18:45:41.346403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.705459Z","title":"Cus- tomization assistant for text-to-image generation","venue":null,"work_id":"b4bec8a5-8401-4be9-ad04-c05c1e870129","year":null},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.351553Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:d4fa4b8e98f5f1943ac9e2bc2caceedf08bb4d8105e1b273600feda9ddba4b83","observation_id":"43d6116f-c0e3-4478-8e46-862bc698980c","resolution":{"observed_at":"2026-08-11T18:45:41.710555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:45:41.689754Z","title":"page results.pdf","venue":null,"work_id":"df0b937a-1893-46f3-8feb-6c3024feb9d8","year":2024},"citing_paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T18:45:41.356187Z"},"links":{"citing_paper":"/paper/2412.07589"},"observation_digest":"sha256:9472490f28f09253df859998047a126053d26515e56ae0daff1b7d451dde055a","observation_id":"76b7bd0c-20ef-416e-bf54-2321f1e90161","resolution":{"observed_at":"2026-08-11T18:45:41.694419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.07589","last_updated":"2025-03-13T06:23:03Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T10:12:24.398983Z","submitted_at":"2024-12-10T15:24:12Z","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2412.07589."}