{"as_of":"2026-08-19T07:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83026c62351e880d8067fad9d2b0fe4703b6cde4b8eea6f3c1a52ec00eba8480","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:32:15.454530Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T19:51:31.657802Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T19:53:11.597613Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2509.04446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04446","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Plot’n polish: Zero-shot story visualiza- tion and disentangled editing with text-to-image diffusion models","venue":null,"work_id":"48ef9816-3c45-4fc3-bc8a-83dd29dd63c7","year":2025},"citing_paper":{"arxiv_id":"2604.03448","last_updated":"2026-04-03T20:45:19Z","snapshot_observed_at":"2026-08-15T12:58:42.006720Z","submitted_at":"2026-04-03T20:45:19Z","title":"ExpressEdit: Fast Editing of Stylized Facial Expressions with Diffusion Models in Photoshop","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T19:51:31.657802Z"},"links":{"cited_paper":"/paper/2509.04446","citing_paper":"/paper/2604.03448"},"observation_digest":"sha256:ed9e5c84021f5d8970f97f7b71629eabb67b2fca35e84f6f86758b83f200cdac","observation_id":"f7a7c12c-febf-4eba-9be0-d0a904557c90","resolution":{"observed_at":"2026-05-13T19:53:11.599109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.04446/citation-record","integrity":"/paper/2509.04446/integrity","json":"/paper/2509.04446/citation-record.json","paper":"/paper/2509.04446"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T16:32:15.245097Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.245097Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:0c765854b91e8e021da5f09f5aeea936034eb6203eaf17cc6b5604f1da3b6082","observation_id":"ec10e816-9bec-4557-833f-bc87b516bc56","resolution":{"observed_at":"2026-08-15T16:32:15.245097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02820","last_updated":"2024-06-04T23:39:08Z","snapshot_observed_at":"2026-08-16T13:46:05.530538Z","submitted_at":"2024-06-04T23:39:08Z","title":"ORACLE: Leveraging Mutual Information for Consistent Character Generation with LoRAs in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02820","snapshot_observed_at":"2026-08-15T16:32:15.250967Z","title":"Oracle: Leveraging mutual information for consistent character generation with loras in diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.250967Z"},"links":{"cited_paper":"/paper/2406.02820","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:fd5a5c830b7066bc082183666047b3914f4087741c7da6e67274a02c0650dbe9","observation_id":"75cfc74d-c150-493a-8165-c7ef7faf0426","resolution":{"observed_at":"2026-08-15T16:32:15.250967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02779","last_updated":"2023-04-30T17:43:11Z","snapshot_observed_at":"2026-08-16T16:54:58.377348Z","submitted_at":"2022-06-06T17:58:04Z","title":"Blended Latent Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02779","snapshot_observed_at":"2026-08-15T16:32:15.255493Z","title":"Blended latent diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.255493Z"},"links":{"cited_paper":"/paper/2206.02779","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:5315329ed547e5e12c3a56c2bcc6da90e38113867eb0b6ef82bc765b91f273f0","observation_id":"e99ba86b-632f-454a-9b4a-2a9cb832e62a","resolution":{"observed_at":"2026-08-15T16:32:15.255493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10093","last_updated":"2024-06-05T14:34:30Z","snapshot_observed_at":"2026-08-16T14:42:35.347831Z","submitted_at":"2023-11-16T18:59:51Z","title":"The Chosen One: Consistent Characters in Text-to-Image Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10093","snapshot_observed_at":"2026-08-15T16:32:15.259614Z","title":"The chosen one: Consistent characters in text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.259614Z"},"links":{"cited_paper":"/paper/2311.10093","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:f20456c8cd69eca3cb38412dad4098ec08372636e0dfbb878281f35234a17510","observation_id":"20b114b9-1580-4fe2-9611-e43ddc54dd4e","resolution":{"observed_at":"2026-08-15T16:32:15.259614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12247","last_updated":"2023-11-02T18:17:01Z","snapshot_observed_at":"2026-08-18T23:33:24.578156Z","submitted_at":"2023-01-28T16:43:07Z","title":"SEGA: Instructing Text-to-Image Models using Semantic Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12247","snapshot_observed_at":"2026-08-15T16:32:15.264293Z","title":"Sega: Instructing diffusion using semantic dimensions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.264293Z"},"links":{"cited_paper":"/paper/2301.12247","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:d9eebe6936b99a859c81a8aaa72c55a40dc63569b5b6339882267121191ea878","observation_id":"f56c5461-407e-4037-9d84-c9e1b26ee601","resolution":{"observed_at":"2026-08-15T16:32:15.264293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:16.090342Z","title":"Ledits++: Limitless image editing using text- to-image models","venue":null,"work_id":"e6bdd677-59cc-4054-98c1-80b011af9607","year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.268891Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:b4468cae67f6fe98199d36c951fb242751693ddb312307041ffd3b3956e4c78b","observation_id":"567bd695-be3f-485a-92bc-78e9891a4310","resolution":{"observed_at":"2026-08-15T16:32:16.095550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-16T16:15:18.101197Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-08-15T16:32:15.273719Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.273719Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:c339a0262ed2038478e0ccebdd6a2fed10688d9ee3e555f806827408cab26064","observation_id":"4bdf3bb4-eb11-4b9a-a585-9812b8da4bd2","resolution":{"observed_at":"2026-08-15T16:32:15.273719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.279215Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.279215Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:ff14f33204acf7c5f0c98457c6a91332ef820cc65718ff98df96c8f04c9643fa","observation_id":"05f043fc-a80d-404a-820f-de9b06d98443","resolution":{"observed_at":"2026-08-15T16:32:15.279215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01388","last_updated":"2025-05-30T13:55:44Z","snapshot_observed_at":"2026-08-16T13:46:42.642014Z","submitted_at":"2024-06-03T14:51:24Z","title":"AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01388","snapshot_observed_at":"2026-08-15T16:32:15.284324Z","title":"Au- tostudio: Crafting consistent subjects in multi-turn interac- tive image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.284324Z"},"links":{"cited_paper":"/paper/2406.01388","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:af1303b8fa1f2b7c9edd54156997cd5fb6794ce03b56affd655c4e4e9744947d","observation_id":"a08540ac-7be7-4f99-a965-535f544bbce4","resolution":{"observed_at":"2026-08-15T16:32:15.284324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18919","last_updated":"2025-05-30T13:52:39Z","snapshot_observed_at":"2026-08-16T13:56:52.444233Z","submitted_at":"2024-04-29T17:58:14Z","title":"TheaterGen: Character Management with LLM for Consistent Multi-turn Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18919","snapshot_observed_at":"2026-08-15T16:32:15.289174Z","title":"Theatergen: Character management with llm for consistent multi-turn image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.289174Z"},"links":{"cited_paper":"/paper/2404.18919","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:b9f77543ef592d8ca80d00474903e6e268e4cafc5b7d1538d244b575d14a3df3","observation_id":"72e2eba5-85a0-4c0e-9dac-c3c9333c742d","resolution":{"observed_at":"2026-08-15T16:32:15.289174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:16.061016Z","title":"Yolo-world: Real-time open- vocabulary object detection","venue":null,"work_id":"416e8094-c124-4cc1-b694-d30bef099477","year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.294108Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:533e1a09a5d09b646e5ead61e8503d7656672d70968b450d4a630465e7daaf59","observation_id":"023ed9d8-31c2-431f-afb8-441390605b70","resolution":{"observed_at":"2026-08-15T16:32:16.065920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.299028Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.299028Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:f83ed78c4931c55af8228cdeec3e30ce00a2f9d8ac8b88888fa89d325700ed8b","observation_id":"abd3b556-d7d3-4824-b760-16f7c879e7c2","resolution":{"observed_at":"2026-08-15T16:32:15.299028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-15T03:17:05.670808Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-15T16:32:15.303626Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.303626Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:051d17dcdca3ddaed6784f061388f0543f005443e02c23049fa8ed910d49a34e","observation_id":"cdfca3c4-af59-468a-aff9-9057c7e60484","resolution":{"observed_at":"2026-08-15T16:32:15.303626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18247","last_updated":"2023-05-30T08:54:42Z","snapshot_observed_at":"2026-08-18T19:00:56.528721Z","submitted_at":"2023-05-29T17:11:39Z","title":"TaleCrafter: Interactive Story Visualization with Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18247","snapshot_observed_at":"2026-08-15T16:32:15.310852Z","title":"Talecrafter: Interactive story visualization with multiple characters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.310852Z"},"links":{"cited_paper":"/paper/2305.18247","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:f150af33eb8e985996187e9d12eca74563bfb96b53e122cb2f3edb53a59b71e8","observation_id":"1e24d965-133d-4d7d-b415-3e2ceb5a864b","resolution":{"observed_at":"2026-08-15T16:32:15.310852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.316405Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.316405Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:57979856b2b1df0d28ded366e29cad5d535bf7a8146b69e4c415fe0157150aa7","observation_id":"7f1d5e92-0182-4b6c-bc51-96102be9b408","resolution":{"observed_at":"2026-08-15T16:32:15.316405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.322765Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.322765Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:7b8b867e8594b57cb2d556161d6dcf5fdbe6b2af4153594594e09b15e22fc08f","observation_id":"3740d32d-9f22-4d50-a3b2-f79a0eaa0f06","resolution":{"observed_at":"2026-08-15T16:32:15.322765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-15T16:32:15.328415Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.328415Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:072152bce3c094cd497286fe7c4a5d02f6f70335dcdc741dae61d1f53ce8a0a6","observation_id":"91c1462f-b309-44bf-880a-6e537600a9b3","resolution":{"observed_at":"2026-08-15T16:32:15.328415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:16.014399Z","title":"Zero-shot generation of coherent storybook from plain text story using diffusion models, 2023","venue":null,"work_id":"04fd0332-f3d8-4cec-89c9-0aef4bb804be","year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.334093Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:528c26a85c3c5245fb3f7ca49b6c7d4c156d1ecc74caddc56193e6fb93a8587e","observation_id":"5ae3d5ec-1f06-4366-be0e-93eb42d6e43f","resolution":{"observed_at":"2026-08-15T16:32:16.018633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:16.000344Z","title":"Rehg, and Pinar Yanardag","venue":null,"work_id":"ed9c5486-8125-4151-9636-e406570c0dba","year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.338889Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:eb92df4d278d5fabdcdeeb4f4a407eecb119091df8c3765020f35b8f89fd96f5","observation_id":"65fdaa25-bca4-4476-ae2b-64723c054408","resolution":{"observed_at":"2026-08-15T16:32:16.004941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.987459Z","title":null,"venue":null,"work_id":"e7f954f4-23e3-47c7-a6d8-f0b813665a84","year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.345203Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:d2fd2a9e8a2b5b245c584ee054ae7e7d7e2c0c063f810dd464367fbaf20d8623","observation_id":"104fb183-4600-42f1-a24a-38400b5e14fc","resolution":{"observed_at":"2026-08-15T16:32:15.991864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.974744Z","title":"Intelligent grimm - open- ended visual storytelling via latent diffusion models","venue":null,"work_id":"f63014ff-1eb4-4e41-ac62-7ba49e5a263a","year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.349572Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:ef22c99816459f48eb8186f159ecc681b1a22eedab6ea6bd1b1843d18c479466","observation_id":"c35c054c-e6b4-4508-80a6-aaacac436d56","resolution":{"observed_at":"2026-08-15T16:32:15.979050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01714","last_updated":"2023-01-17T17:08:51Z","snapshot_observed_at":"2026-08-16T16:55:27.102617Z","submitted_at":"2022-06-03T17:47:04Z","title":"Compositional Visual Generation with Composable Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01714","snapshot_observed_at":"2026-08-15T16:32:15.354327Z","title":"Compositional visual genera- tion with composable diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.354327Z"},"links":{"cited_paper":"/paper/2206.01714","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:fd9dab40610d301b344930701de525b719a0eb42ff8addb07019b33339f2fc2b","observation_id":"0bec2a1c-7fba-4523-ae6b-a34d0af0ccfd","resolution":{"observed_at":"2026-08-15T16:32:15.354327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.959131Z","title":"One-prompt-one-story: Free-lunch consistent text-to-image generation using a single prompt,","venue":null,"work_id":"7e92821a-9518-4e18-8ef5-8f7d24790e30","year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.360081Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:2d471355a5dd9e730dc9f3c78f98136f73b76f4e2d4172711ce3ec6e28912da9","observation_id":"dfc7d8d8-0c02-4956-bdc2-44da5466c05a","resolution":{"observed_at":"2026-08-15T16:32:15.964746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.364085Z","title":"Storydall-e: Adapting pretrained text-to-image transformers for story continuation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.364085Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:c817c97d1da929be7a693aa6afb9f3898e4826a813f06af6da119a97c92d801d","observation_id":"0d48eccd-937b-49a4-99b4-a75eac916e2a","resolution":{"observed_at":"2026-08-15T16:32:15.364085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.368858Z","title":"Synthesizing coherent story with auto-regressive la- tent diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.368858Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:c05fe18be26dad72d01dc8c815f5ffb7dd71f05f33f74d9018ce30e2afe1dba9","observation_id":"a20ec3eb-bb09-4089-ac12-fece52d407bc","resolution":{"observed_at":"2026-08-15T16:32:15.368858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.924090Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":"9abf7059-9a73-4c79-958a-f88690b8463b","year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.372979Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:a59157530567c43660341d807d1cd35f2734580b340f8c574ed0f7ae4b2f39e9","observation_id":"6fd444aa-4d76-48ed-bafa-c32787b56865","resolution":{"observed_at":"2026-08-15T16:32:15.928794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.376979Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.376979Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:3b3a92c5e07488a21b63279f2ca314c9f70ff1857abc14b165a7cbcff06bc6b0","observation_id":"7f431f05-1ad7-48e9-b8a1-deeba02e6abb","resolution":{"observed_at":"2026-08-15T16:32:15.376979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.380905Z","title":"Make-a-story: Visual memory conditioned consistent story generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.380905Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:9e4d34199038f3edf12ff785664e4d17321f2e6b38ce48da99229891dae837c0","observation_id":"af38eb90-2aa1-4dc0-86ee-1560d61d0040","resolution":{"observed_at":"2026-08-15T16:32:15.380905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.385321Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.385321Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:fdc67065585eeb5f91a4824440a9ba7bb1e12474ee8ee64c52762b5723592276","observation_id":"d06b27e6-3103-4909-a357-87d18bb466b5","resolution":{"observed_at":"2026-08-15T16:32:15.385321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.388970Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.388970Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:637f2f386f5989fef4f9676b92a8f213ea3144834286527029d85f115d7fadb0","observation_id":"8772e8a5-3c82-4e16-abba-4c9bacd3e796","resolution":{"observed_at":"2026-08-15T16:32:15.388970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05979","last_updated":"2024-04-09T03:22:36Z","snapshot_observed_at":"2026-08-16T14:02:32.904988Z","submitted_at":"2024-04-09T03:22:36Z","title":"StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and Completion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05979","snapshot_observed_at":"2026-08-15T16:32:15.393267Z","title":"Storyimager: A unified and efficient frame- work for coherent story visualization and completion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.393267Z"},"links":{"cited_paper":"/paper/2404.05979","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:85841cc74794cdb461a9b9b6e7f66370840787f2d6faf0a1224d7b251620af61","observation_id":"31cb85f4-7843-4490-8a8c-8b02bffac400","resolution":{"observed_at":"2026-08-15T16:32:15.393267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.864223Z","title":"Training-free con- sistent text-to-image generation, 2024","venue":null,"work_id":"56b38b35-3279-4429-a0ef-f55ec38417b8","year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.397679Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:3af748934a6d854192da73f89d039f08c354b5d16b88ab7d4fe82211d36313b2","observation_id":"47cd6ce4-141e-45a4-a9d4-5c3bd58edf33","resolution":{"observed_at":"2026-08-15T16:32:15.868777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.850530Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"2e5a666d-4efc-431d-820a-102b6dfe3af8","year":1921},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.401911Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:b991fd8f1224e96c497e149aee284d525a279b795b2c26c9570e3f1bb887c721","observation_id":"ebdea003-d86f-4b7d-982f-f65ec5672f68","resolution":{"observed_at":"2026-08-15T16:32:15.855287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.835704Z","title":"Unitune: Text-driven image editing by fine tuning a diffusion model on a single image","venue":null,"work_id":"5647b0bb-9e05-4975-b34d-8ddb065e7aa1","year":null},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.406601Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:82b9941653f96af30dbb2bba943f76ba1a1d792bb4265cd7e1ac3cc95fc5edc8","observation_id":"466afb1c-8997-48ae-a3fa-d403378039d2","resolution":{"observed_at":"2026-08-15T16:32:15.841121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11243","last_updated":"2023-11-19T06:07:37Z","snapshot_observed_at":"2026-08-17T08:13:48.431165Z","submitted_at":"2023-11-19T06:07:37Z","title":"AutoStory: Generating Diverse Storytelling Images with Minimal Human Effort","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11243","snapshot_observed_at":"2026-08-15T16:32:15.411330Z","title":"Autostory: Generating di- verse storytelling images with minimal human effort","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.411330Z"},"links":{"cited_paper":"/paper/2311.11243","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:eb648a46e4f2b5e5c0c4aa91985addc9e55815ae797329681f2ffed1bbf4ba88","observation_id":"fb5c0268-3b07-4b19-9a57-ad596bd543a4","resolution":{"observed_at":"2026-08-15T16:32:15.411330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.818300Z","title":"Nerfiller: Completing scenes via generative 3d inpainting, 2023","venue":null,"work_id":"0878e912-81eb-40fd-a64d-d9e5b6ff0a4b","year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.416686Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:73e4d1439b8754cedab0413b7ab7dadb3ab9c1e82d65391033b073eef76ef097","observation_id":"7f7efe33-3ce6-4ada-84d5-a809d3f62ccd","resolution":{"observed_at":"2026-08-15T16:32:15.824288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.790428Z","title":"Efficientsam: Leveraged masked image pre- training for efficient segment anything, 2023","venue":null,"work_id":"4bad4fb4-f1e3-4b84-b3f5-e20fab0e8a8e","year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.422393Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:e82678f8b823b8de4481e1752da8315f04bec88931c950869e9722c4a319aa66","observation_id":"5a27e0b5-1a4f-48d1-b6e2-71a169312b34","resolution":{"observed_at":"2026-08-15T16:32:15.799095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-16T13:35:00.531280Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-15T16:32:15.429255Z","title":"Seed-story: Multimodal long story generation with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.429255Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:c858df27601bc88783ca20a45461cd5de874477f9903f08326329774f181c675","observation_id":"d6ca206d-e27c-4a3d-9ecc-e3e62a9f4729","resolution":{"observed_at":"2026-08-15T16:32:15.429255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.774316Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":"cad9181b-917d-475f-ac8c-f1de87fc0f59","year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.433717Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:654e3a71820ee63b674b9b9a78f88d017d2a04dbce39e196e40346b05b985d50","observation_id":"f74521c4-473b-44d3-a342-98a6c9f39be7","resolution":{"observed_at":"2026-08-15T16:32:15.780780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.438012Z","title":"Adding conditional control to text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.438012Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:b4249db395633e5a6d0e4b42b9c73b88bd4f17d053b5288c10cc37af502197cb","observation_id":"49114b78-55e0-410e-9fca-66092e9fe2fe","resolution":{"observed_at":"2026-08-15T16:32:15.438012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.442490Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.442490Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:4487f92d1449c597ce7aba9d41a03007c2e9a84e350bbfc43d9c60a5a529dd80","observation_id":"bd67c397-40f9-4619-b1ae-87ea982011ac","resolution":{"observed_at":"2026-08-15T16:32:15.442490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.446611Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.446611Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:bff2a850993ec2309a439228cfabcd191cda55abfc14623a7a950452f65e62bd","observation_id":"e37a885a-6bc3-474c-b000-8133b8e551e3","resolution":{"observed_at":"2026-08-15T16:32:15.446611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01434","last_updated":"2024-05-02T16:25:16Z","snapshot_observed_at":"2026-08-16T13:55:54.505498Z","submitted_at":"2024-05-02T16:25:16Z","title":"StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01434","snapshot_observed_at":"2026-08-15T16:32:15.450281Z","title":"Storydiffusion: Consistent self- attention for long-range image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.450281Z"},"links":{"cited_paper":"/paper/2405.01434","citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:0b7b54816812e401a92c89f492d5a04b521f2d6ce1ef8124fcdd871033aae365","observation_id":"450a8d1f-0422-441c-9e18-783561a3fae1","resolution":{"observed_at":"2026-08-15T16:32:15.450281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:15.734595Z","title":"Main Characters","venue":null,"work_id":"1d964d1c-9c55-426e-9ef4-9affbf75446f","year":2000},"citing_paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:15.454530Z"},"links":{"citing_paper":"/paper/2509.04446"},"observation_digest":"sha256:37b10714ef26284ba606142c4ff5999c81e80c751e669dd68fdf52664baefffd","observation_id":"38b223ef-d41a-4ad1-9634-bdaa3dc64c06","resolution":{"observed_at":"2026-08-15T16:32:15.739911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.04446","last_updated":"2025-09-04T17:59:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T20:52:51.140144Z","submitted_at":"2025-09-04T17:59:34Z","title":"Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2509.04446."}