{"as_of":"2026-08-11T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:155a1ed7ee512661fcc3679d7a4373cccbd20260e3211c3495d65df17df84ca8","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:53:51.323441Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:47:00.650209Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T05:49:40.853023Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13554","snapshot_observed_at":"2026-08-06T10:47:00.650209Z","title":"One-prompt-one-story: Free-lunch consistent text-to-image generation using a single prompt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-10T20:01:42.574045Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.650209Z"},"links":{"cited_paper":"/paper/2501.13554","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:fbaaa80379b9d26bc5e6b75f7caecf6ba5302af99fba353c5f63b636ff32fd99","observation_id":"f27955d2-1ff9-4e2d-a38a-b1021b68719d","resolution":{"observed_at":"2026-08-06T10:47:00.650209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"cited_work":{"arxiv_id":"2501.13554","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13554","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One-prompt-one-story: Free-lunch consistent text-to-image generation using a single prompt","venue":null,"work_id":"06f465ae-2888-4267-90f4-d071f55a1849","year":2025},"citing_paper":{"arxiv_id":"2605.11927","last_updated":"2026-05-12T10:39:45Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T10:39:45Z","title":"RealDiffusion: Physics-informed Attention for Multi-character Storybook Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T06:24:23.155286Z"},"links":{"cited_paper":"/paper/2501.13554","citing_paper":"/paper/2605.11927"},"observation_digest":"sha256:9beee2e52dc8c6f79bc7ae90d65fddba94b20af0ea03fd965edc9f66fa2f9d2e","observation_id":"48ed00b0-51ee-4e4c-b896-f05bc8aee780","resolution":{"observed_at":"2026-05-13T06:27:24.743033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"cited_work":{"arxiv_id":"2501.13554","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13554","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One-prompt-one-story: Free-lunch consistent text-to-image generation using a single prompt","venue":null,"work_id":"06f465ae-2888-4267-90f4-d071f55a1849","year":2025},"citing_paper":{"arxiv_id":"2605.20777","last_updated":"2026-05-20T06:17:53Z","snapshot_observed_at":"2026-08-02T16:39:20.562271Z","submitted_at":"2026-05-20T06:17:53Z","title":"AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:49.309008Z"},"links":{"cited_paper":"/paper/2501.13554","citing_paper":"/paper/2605.20777"},"observation_digest":"sha256:b735496a02747d6eebb55958e32d1eeb81bb4231dae8520c471d5ab4642cae87","observation_id":"d6ed79e4-23c9-4958-959c-4195115b0b7d","resolution":{"observed_at":"2026-05-21T05:49:40.854764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.13554/citation-record","integrity":"/paper/2501.13554/integrity","json":"/paper/2501.13554/citation-record.json","paper":"/paper/2501.13554"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02820","last_updated":"2024-06-04T23:39:08Z","snapshot_observed_at":"2026-07-06T18:25:35.827334Z","submitted_at":"2024-06-04T23:39:08Z","title":"ORACLE: Leveraging Mutual Information for Consistent Character Generation with LoRAs in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02820","snapshot_observed_at":"2026-08-10T15:53:51.176731Z","title":"Oracle: Leveraging mutual information for consistent char- acter generation with loras in diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.176731Z"},"links":{"cited_paper":"/paper/2406.02820","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:25dded2f67e7b1adaf54873615a89d6b9822bdc387d5ded4232a5754b45eedd9","observation_id":"fc6845f7-13fa-47c1-833c-8c34af16ca03","resolution":{"observed_at":"2026-08-10T15:53:51.176731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10093","last_updated":"2024-06-05T14:34:30Z","snapshot_observed_at":"2026-07-06T16:48:44.861171Z","submitted_at":"2023-11-16T18:59:51Z","title":"The Chosen One: Consistent Characters in Text-to-Image Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10093","snapshot_observed_at":"2026-08-10T15:53:51.185569Z","title":"The chosen one: Consistent characters in text-to-image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.185569Z"},"links":{"cited_paper":"/paper/2311.10093","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:8ac5b27a43885592bc51c71395571abf85b003946432c83718733eef95f57a79","observation_id":"774f84a8-2dd6-4cc4-bfbc-9751485ca223","resolution":{"observed_at":"2026-08-10T15:53:51.185569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.878747Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":"8de23a13-0bbb-4200-8068-4bec740fc31b","year":2023},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.194119Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:7fca0dbaa44e36d85134df940847dbf40ccbc8e45d09bf49872b5b37b35f58f8","observation_id":"62845794-e79d-43b7-9299-2825ae08110f","resolution":{"observed_at":"2026-08-10T15:53:51.881835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.681658Z","title":"Jaemin Cho, Yushi Hu, Roopal Garg, Peter Anderson, Ranjay Krishna, Jason Baldridge, Mohit Bansal, Jordi Pont-Tuset, and Su Wang","venue":null,"work_id":"071dd188-44e4-47b0-ba17-f64383d04944","year":2023},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.197985Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:ac12239a63a901b3f198a7453d144fda936e79415962e133b9aaa3553d8984b4","observation_id":"cfdab819-25e2-4db6-91fe-952ad50bdb00","resolution":{"observed_at":"2026-08-10T15:53:51.686028Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11337","last_updated":"2025-01-30T15:13:01Z","snapshot_observed_at":"2026-08-10T16:29:07.406411Z","submitted_at":"2022-11-21T10:37:56Z","title":"DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11337","snapshot_observed_at":"2026-08-10T15:53:51.201883Z","title":"Dreamartist: Towards controllable one-shot text-to-image generation via contrastive prompt-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.201883Z"},"links":{"cited_paper":"/paper/2211.11337","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:6000d1112bd8d677c83742d983dfb18b46e76cb0b176c3b3f922dab6101b21d9","observation_id":"322cb7eb-be7e-4086-9064-b4f68de41345","resolution":{"observed_at":"2026-08-10T15:53:51.201883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12228","last_updated":"2023-03-05T15:48:51Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T18:46:41Z","title":"Encoder-based Domain Tuning for Fast Personalization of Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12228","snapshot_observed_at":"2026-08-10T15:53:51.210081Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.210081Z"},"links":{"cited_paper":"/paper/2302.12228","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:d7d0f37b20cd61b14345c152b534a179ccac768a1ba2031f38594e2e6931078a","observation_id":"efe65192-8c09-4e25-83df-02e20e086d17","resolution":{"observed_at":"2026-08-10T15:53:51.210081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08767","last_updated":"2023-04-19T14:23:52Z","snapshot_observed_at":"2026-08-10T05:01:13.967291Z","submitted_at":"2023-03-15T17:07:45Z","title":"Highly Personalized Text Embedding for Image Manipulation by Stable Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08767","snapshot_observed_at":"2026-08-10T15:53:51.214030Z","title":"Inhwa Han, Serin Yang, Taesung Kwon, and Jong Chul Ye","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.214030Z"},"links":{"cited_paper":"/paper/2303.08767","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:4795a39ce7684dfcb4e06eb553ef93a282c0a10aa270336230236b543a338551","observation_id":"7fc6894b-3c21-4283-bbe2-d1f6c0b2cf52","resolution":{"observed_at":"2026-08-10T15:53:51.214030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.868937Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":"0656a788-b419-4b67-a69c-e360b442c608","year":2021},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.218453Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:56a8985d8109bbf3a5b1e8f0033e7d36ee9c3f591d031316f14947c8acf532c9","observation_id":"7e19a3e2-b09a-48d1-9fc2-a021c6b72357","resolution":{"observed_at":"2026-08-10T15:53:51.872265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01244","last_updated":"2024-05-25T12:17:29Z","snapshot_observed_at":"2026-08-10T06:04:30.032752Z","submitted_at":"2024-03-02T16:11:23Z","title":"Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01244","snapshot_observed_at":"2026-08-10T15:53:51.222171Z","title":"Mitigating catastrophic forgetting in large language models with self-synthesized rehearsal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.222171Z"},"links":{"cited_paper":"/paper/2403.01244","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:6ea954e9590214bd304ef94920766fc13a6305a1ebe783559f332d603c4d5eee","observation_id":"059333a3-d376-476d-90e3-99b011060588","resolution":{"observed_at":"2026-08-10T15:53:51.222171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.859005Z","title":"Get what you want, not what you don’t: Image content suppression for text-to-image diffusion models","venue":null,"work_id":"b1390468-8701-48b5-b63c-b85591bffb38","year":2025},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.225891Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:b7d865b029ad74dfeea0da3f0f3365391eda34abd0f91941200f870ef9ba8d8e","observation_id":"cdb36812-5f19-48fa-ad18-bea97a6f2362","resolution":{"observed_at":"2026-08-10T15:53:51.862338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17898","last_updated":"2024-11-05T16:31:24Z","snapshot_observed_at":"2026-07-06T16:54:33.882767Z","submitted_at":"2023-11-29T18:51:46Z","title":"Contextual Knowledge Pursuit for Faithful Visual Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17898","snapshot_observed_at":"2026-08-10T15:53:51.233075Z","title":"Knowledge pursuit prompting for zero-shot multimodal synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.233075Z"},"links":{"cited_paper":"/paper/2311.17898","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:f9f228102ae46751c3c70313a6b7a3a3a5fa2ec46b93dbc59bf2706f78fe11f7","observation_id":"b8ba096e-6e7f-4b90-8542-7b6f17b551d9","resolution":{"observed_at":"2026-08-10T15:53:51.233075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.848065Z","title":"Improving generation and evaluation of vi- sual stories via semantic consistency","venue":null,"work_id":"52764448-e76b-48f0-9a72-776f02816723","year":2021},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.236409Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:9b3f66a0fec4e44fffdb0f4546e172b150281f85ab75d5764f5ba48b0b89edd1","observation_id":"8cad5956-31ef-4db3-97a9-c96186e46b8c","resolution":{"observed_at":"2026-08-10T15:53:51.851669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-10T15:53:51.239510Z","title":"Sdxl: improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.239510Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:aa9f1540817ffea21a1e0f1e550a05e794fc5d8b4b6b1f7091b684e29144db06","observation_id":"1a80d23c-85cf-4a52-a098-e8179312d231","resolution":{"observed_at":"2026-08-10T15:53:51.239510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-10T15:53:51.242860Z","title":"Hierarchical text- conditional image generation with clip latents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.242860Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:6cb4a57a5e230e94cd28e16807b3ca2653269ef822684fc17db539bb28f448f9","observation_id":"361c453d-749f-488e-bb3f-67ed401ec487","resolution":{"observed_at":"2026-08-10T15:53:51.242860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.837445Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"61e234d4-6ea4-4f3c-bccc-6db4134d4e46","year":2025},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.246420Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:2903dc0311b8d041592be103c01389d6089ddbc5ff6e634dce8d5ac84fcb38d0","observation_id":"da41d3ce-90a0-4159-a932-be96dfcea1a3","resolution":{"observed_at":"2026-08-10T15:53:51.841258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-10T15:53:51.249543Z","title":"Photorealistic text- to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.249543Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:c47f4327e2d10122c3f331932cfb9bab4eb484b391821d6516124a099d7bc48c","observation_id":"1a2a8e1a-6dfc-4530-b405-bb5f6cff3f6d","resolution":{"observed_at":"2026-08-10T15:53:51.249543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03411","last_updated":"2023-04-06T23:26:38Z","snapshot_observed_at":"2026-08-10T13:12:20.170774Z","submitted_at":"2023-04-06T23:26:38Z","title":"InstantBooth: Personalized Text-to-Image Generation without Test-Time Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03411","snapshot_observed_at":"2026-08-10T15:53:51.252934Z","title":"Instantbooth: Personalized text-to-image generation without test-time finetuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.252934Z"},"links":{"cited_paper":"/paper/2304.03411","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:37dbab7c4b534871ffe6c7a061973a852eb9ae77e6cff4f62442024d4903ebb5","observation_id":"5f9d90cc-b744-493f-83b4-bb81bddbf676","resolution":{"observed_at":"2026-08-10T15:53:51.252934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05979","last_updated":"2024-04-09T03:22:36Z","snapshot_observed_at":"2026-08-04T11:23:08.829283Z","submitted_at":"2024-04-09T03:22:36Z","title":"StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and Completion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05979","snapshot_observed_at":"2026-08-10T15:53:51.256174Z","title":"Storyimager: A uni- fied and efficient framework for coherent story visualization and completion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.256174Z"},"links":{"cited_paper":"/paper/2404.05979","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:7abc24277761282183d689a5dd0a9454e362dcabd42c12c5426a9b57b6aaac4d","observation_id":"6bf6a840-afe4-4a59-97d3-37fb6d9cd267","resolution":{"observed_at":"2026-08-10T15:53:51.256174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03286","last_updated":"2024-05-30T11:42:15Z","snapshot_observed_at":"2026-08-07T08:05:58.570795Z","submitted_at":"2024-02-05T18:42:34Z","title":"Training-Free Consistent Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03286","snapshot_observed_at":"2026-08-10T15:53:51.259500Z","title":"Training-free consistent text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.259500Z"},"links":{"cited_paper":"/paper/2402.03286","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:d5c91025725c01af635599eb69d2c04ca647dd32191fbaf22af9c419cfab01eb","observation_id":"bfebf185-0118-439e-a94e-79f687a40a51","resolution":{"observed_at":"2026-08-10T15:53:51.259500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10899","last_updated":"2023-12-18T03:09:05Z","snapshot_observed_at":"2026-07-06T17:04:21.955226Z","submitted_at":"2023-12-18T03:09:05Z","title":"MagicScroll: Nontypical Aspect-Ratio Image Generation for Visual Storytelling via Multi-Layered Semantic-Aware Denoising","version":1},"cited_work":{"arxiv_id":"2312.10899","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.10899","snapshot_observed_at":"2026-08-10T15:53:51.473117Z","title":"MagicScroll: Nontypical Aspect-Ratio Image Generation for Visual Storytelling via Multi-Layered Semantic-Aware Denoising","venue":"cs.CV","work_id":"c180703a-f2e5-4559-a92e-130a6a9c70fc","year":2023},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.267076Z"},"links":{"cited_paper":"/paper/2312.10899","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:6615f727f43582d5472610eaba9e6af97a2c3ce2eae64e47f23bb915443973a8","observation_id":"446b7499-3aeb-4d20-a9ee-c5cede2c0e59","resolution":{"observed_at":"2026-08-10T15:53:51.477793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15677","last_updated":"2024-04-27T14:24:15Z","snapshot_observed_at":"2026-07-06T18:04:50.648027Z","submitted_at":"2024-04-24T06:15:31Z","title":"CharacterFactory: Sampling Consistent Characters with GANs for Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15677","snapshot_observed_at":"2026-08-10T15:53:51.270878Z","title":"Char- acterfactory: Sampling consistent characters with gans for diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.270878Z"},"links":{"cited_paper":"/paper/2404.15677","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:00dd05364f305f3f3207f4669be134931f2a84744d9e4a5f28927e2e36b886ed","observation_id":"0944f42b-7558-4a0c-affc-f07ec2f9673d","resolution":{"observed_at":"2026-08-10T15:53:51.270878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-07T03:46:04.809939Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-10T15:53:51.274934Z","title":"Hu Ye, Jun Zhang, Sibo Liu, Xiao Han, and Wei Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.274934Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:ce7fbfe734a340130c62986bff5792ef9b85ce722cb56abf700460658a9ffc4e","observation_id":"a0e16d60-5f0d-4563-b1fa-a0d19c91b1f6","resolution":{"observed_at":"2026-08-10T15:53:51.274934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01434","last_updated":"2024-05-02T16:25:16Z","snapshot_observed_at":"2026-07-06T18:08:52.053005Z","submitted_at":"2024-05-02T16:25:16Z","title":"StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01434","snapshot_observed_at":"2026-08-10T15:53:51.278768Z","title":"Storydiffu- sion: Consistent self-attention for long-range image and video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.278768Z"},"links":{"cited_paper":"/paper/2405.01434","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:0bef0763d36b3f914102a3915934614921a2486909959fa7c25f897e3041854a","observation_id":"02b608d5-d45c-4f54-92db-9998115d9ae9","resolution":{"observed_at":"2026-08-10T15:53:51.278768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.824489Z","title":null,"venue":null,"work_id":"a1421201-71bf-4c87-8c97-901ba78ec586","year":2025},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.282763Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:149fe9c1f0331fe8fc3d1ec24ec02290e61bb1a341097d48b7435991f9c2b8c7","observation_id":"62f77ced-b7d6-4faf-a975-00f68fddc8a2","resolution":{"observed_at":"2026-08-10T15:53:51.828947Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.802922Z","title":null,"venue":null,"work_id":"80bbf36f-0777-4b6f-83c9-e5f9bb4e9ca7","year":2024},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.289898Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:5e8e1236fe96d2d9c171a2efcef57dd4478d02a3cf914abf0f67644be433416e","observation_id":"fa214e74-5bbd-414b-80e7-e29343f6def1","resolution":{"observed_at":"2026-08-10T15:53:51.806425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.792557Z","title":"All generated images based on SDXL are produced at a resolution of 1024 × 1024 using a Quadro RTX 3090 GPU with 24GB VRAM","venue":null,"work_id":"216f15b2-5bfe-46c5-a020-cfe43f5add49","year":2024},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.293859Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:e8be6919cd5f0534fa422e3903f3ca7f0da3ec2055e04df45406f457a308c492","observation_id":"31606e8c-772d-46b5-93e4-1f140d45aeaa","resolution":{"observed_at":"2026-08-10T15:53:51.796042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.782288Z","title":"• The official implementation of PhotoMaker (Li et al., 2023b) at https://github.com/ TencentARC/PhotoMaker","venue":null,"work_id":"0e957073-603b-45ef-b3bc-67e0b489ef78","year":2025},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.298775Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:198944050f4ce44721f8c6776f3c252b6fb7e4830aacf6bafa6254df728818fd","observation_id":"5c9d997e-80d5-4ba4-9395-a9f21c4cf8ee","resolution":{"observed_at":"2026-08-10T15:53:51.785745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.771620Z","title":"a photo of a beautiful girl walking on the street","venue":null,"work_id":"8a1ca745-c23a-46b8-9706-b3d1c2a4c40f","year":2024},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.302735Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:0f12a47129664725f1074cdd0f33fe4a845a3345a0bb8563645fa68dbf80c7ad","observation_id":"e629ec19-c21d-4926-b56c-bcc00892c1c3","resolution":{"observed_at":"2026-08-10T15:53:51.775029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.761190Z","title":"Specifically, we kept the cEOT part of the text embedding unchanged during the SVR process and used this text embedding to generate images","venue":null,"work_id":"2f0087b5-6145-4e9b-aa0f-236c9c10a996","year":2025},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.307270Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:541db304d2775b1d18715408dcf2a99d0eeee59726c02067c6a968e432c26de5","observation_id":"1bae477a-d43b-4cf5-b031-7a0445939a17","resolution":{"observed_at":"2026-08-10T15:53:51.764726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.748804Z","title":"By using different seeds, our method 1Prompt1Story can generate images with diverse backgrounds while maintaining a consistent identity","venue":null,"work_id":"52bd8ae7-9a26-4c6b-a3ab-3e7b1ee8c2f2","year":2025},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.311301Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:a1dd88ff7cd50ef64e474148c0b6e078bf104f59b44af458aeee38c6668231be","observation_id":"c2c758b9-a864-49f7-923e-61a71a4c7dfe","resolution":{"observed_at":"2026-08-10T15:53:51.752923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.736968Z","title":"By defining multiple subjects in the identity prompt, our method generates images featuring multiple characters, each maintaining good identity consistency","venue":null,"work_id":"a065853c-02be-4ca9-9afb-74fab62302a9","year":2025},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.315302Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:0e4588d6bc344bb52cf239f0fbf9b6b5fe3062686c4bcd1b91bad94d93ee7da5","observation_id":"3ec1f21a-d65e-4aea-9fb2-4915e464c7c4","resolution":{"observed_at":"2026-08-10T15:53:51.741387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3350.8044","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.417633Z","title":null,"venue":null,"work_id":"c945d3ae-74b0-43b4-bd0c-587b6003afc8","year":2025},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.319559Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:b66d8c766475e457cb4210ad7c65e8362a4bee59cfa41cc12b00c47ea2bc91c4","observation_id":"f1cbaca9-08eb-44e4-b985-f92789cf204e","resolution":{"observed_at":"2026-08-10T15:53:51.424373Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.724782Z","title":"sliding window","venue":null,"work_id":"e2a9ab16-bf03-4894-a11e-89677aa19ae3","year":2025},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.323441Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:a5fdf916a7e4042d2abaac4a819634a086c0be45be91d6d1c67f4d7714c5a173","observation_id":"ee085a30-49fb-4f2e-9fc2-eb337b83f5f7","resolution":{"observed_at":"2026-08-10T15:53:51.728874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09522","last_updated":"2023-07-15T15:48:48Z","snapshot_observed_at":"2026-08-09T14:49:44.209943Z","submitted_at":"2023-03-16T17:38:15Z","title":"P+: Extended Textual Conditioning in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09522","snapshot_observed_at":"2026-08-10T15:53:51.262950Z","title":"Andrey V oynov, Qinghao Chu, Daniel Cohen-Or, and Kfir Aberman","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.262950Z"},"links":{"cited_paper":"/paper/2303.09522","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:243fe37845762fec1fa6171d967c70e07f21790ab02fc53ce366bea708912e6a","observation_id":"3abae216-a666-4222-aa09-61a486479c4f","resolution":{"observed_at":"2026-08-10T15:53:51.262950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04461","last_updated":"2023-12-07T17:32:29Z","snapshot_observed_at":"2026-08-10T10:44:02.590050Z","submitted_at":"2023-12-07T17:32:29Z","title":"PhotoMaker: Customizing Realistic Human Photos via Stacked ID Embedding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04461","snapshot_observed_at":"2026-08-10T15:53:51.229741Z","title":"Pho- tomaker: Customizing realistic human photos via stacked id embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.229741Z"},"links":{"cited_paper":"/paper/2312.04461","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:e64cb4f4dc287f20136876057c5991e592f59c73f3f5f6431615543377a41309","observation_id":"f0094f7c-6ef1-456d-977a-f58c9f1c4436","resolution":{"observed_at":"2026-08-10T15:53:51.229741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.813446Z","title":"We separately update the text embeddings produced by each encoder","venue":null,"work_id":"ee99c3ae-48d7-426f-84e0-d3c94593dda0","year":2023},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.286338Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:013978ae027f1731477ba2b854a6bff739b2f184a1104befe9be96e68aa3fe87","observation_id":"f64a7736-b697-4800-a38b-c7e9363e4e34","resolution":{"observed_at":"2026-08-10T15:53:51.817590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-10T15:53:51.205906Z","title":"Dreamsim: Learning new dimensions of human visual similarity using synthetic data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.205906Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:85e829ca39e5951fecc94611ef1a57ee7c819fdcffff28ebac580509f7ac395b","observation_id":"19e9b0cf-c3da-4cfc-be31-e70b9e6e208e","resolution":{"observed_at":"2026-08-10T15:53:51.205906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01388","last_updated":"2025-05-30T13:55:44Z","snapshot_observed_at":"2026-08-09T12:50:22.425177Z","submitted_at":"2024-06-03T14:51:24Z","title":"AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01388","snapshot_observed_at":"2026-08-10T15:53:51.189938Z","title":"Autostudio: Crafting consistent subjects in multi-turn interactive image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.189938Z"},"links":{"cited_paper":"/paper/2406.01388","citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:be8d449ef40cbbdb19b1b2fbdccbb9abd7ed2f67271b5d61afbc7f29cb0ee026","observation_id":"8723eb07-4343-4d08-995e-03afdc83cc98","resolution":{"observed_at":"2026-08-10T15:53:51.189938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:53:51.888270Z","title":"Cross- image attention for zero-shot appearance transfer","venue":null,"work_id":"efd10c07-e7e2-4389-ad87-731ea40acbb7","year":2024},"citing_paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T15:53:51.181415Z"},"links":{"citing_paper":"/paper/2501.13554"},"observation_digest":"sha256:ede2bafd6e8c7089922651527d2ff03b57731794de957ec136f6f3fb83253b6e","observation_id":"0be53bb5-1be4-4466-a220-d9de6c7099c8","resolution":{"observed_at":"2026-08-10T15:53:51.891430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.13554","last_updated":"2025-02-05T10:32:22Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T19:48:31.626039Z","submitted_at":"2025-01-23T10:57:22Z","title":"One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":3,"verified_fuzzy":14},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2501.13554."}