{"as_of":"2026-08-15T21:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a7c82c9b467577fd8f71a838008bd84f5ef54debc2c234d9a27517108045697","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:56:07.941714Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:20:03.542467Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T15:20:04.115181Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2501.03490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.03490","snapshot_observed_at":"2026-08-10T15:20:04.115181Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","venue":"cs.CV","work_id":"e61761ce-efa0-4048-94b0-ffdc94620f57","year":2025},"citing_paper":{"arxiv_id":"2501.14316","last_updated":"2025-08-28T05:41:16Z","snapshot_observed_at":"2026-08-11T17:54:33.794441Z","submitted_at":"2025-01-24T08:21:35Z","title":"T-Stars-Poster: A Framework for Product-Centric Advertising Image Design","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:20:03.542467Z"},"links":{"cited_paper":"/paper/2501.03490","citing_paper":"/paper/2501.14316"},"observation_digest":"sha256:60d824c1bec67474d701f8d43b6e12a7af9f8d31fbb98f46e8febeec51f1e3aa","observation_id":"a5415215-b39f-43aa-938a-8eaf33183f90","resolution":{"observed_at":"2026-08-10T15:20:04.119093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.03490/citation-record","integrity":"/paper/2501.03490/integrity","json":"/paper/2501.03490/citation-record.json","paper":"/paper/2501.03490"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.633575Z","title":"Multi- concept customization of text-to-image diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.633575Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:e2458b286c79d516bcbce8b4c190adc5379c8df2493edb3e9f404be2c7d6d8c2","observation_id":"7de209d1-609b-4dea-8356-51dfb5a66030","resolution":{"observed_at":"2026-08-10T21:56:07.633575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.639905Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject- driven generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.639905Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:da3fa8c55a7eff74366a6520b658e8291994e858182bc3de2ba0e35d9c7d7d2a","observation_id":"17f929f1-9a58-4e8c-919c-54d824721f9b","resolution":{"observed_at":"2026-08-10T21:56:07.639905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.829422Z","title":"Paint by example: Exemplar-based image editing with diffusion models,","venue":null,"work_id":"42e56929-87a2-4df4-8176-e686ccd0d8d1","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.647037Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:914803731f481a9fddb17cb3f9ea5c7c99438556fe28d42da3ca6f79b0e0bcbf","observation_id":"4387ae30-3531-4969-b106-557b6c313235","resolution":{"observed_at":"2026-08-10T21:56:08.834475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-10T21:56:07.653001Z","title":"An image is worth one word: Person- alizing text-to-image generation using textual inversion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.653001Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:90cbfb2fe4287f7cf269cb1a7178b7047466e5b75e54a94cd7bc3a2963a6aa19","observation_id":"c24f6e30-f154-4fa9-815c-80f08f3ac860","resolution":{"observed_at":"2026-08-10T21:56:07.653001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.812953Z","title":"Blip-diffusion: Pre-trained subject representa- tion for controllable text-to-image generation and editing,","venue":null,"work_id":"d9b31faf-f15b-4163-866a-767c5102fd6a","year":2024},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.659724Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:18d0d05c51c2ee296b9f59946ed5dbb60117c95750538e48fd67b5d55c986658","observation_id":"b19cc6d9-f0fa-47b9-9a9b-8e490ee4cdcc","resolution":{"observed_at":"2026-08-10T21:56:08.818245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09481","last_updated":"2024-05-08T03:21:34Z","snapshot_observed_at":"2026-08-13T10:53:07.664749Z","submitted_at":"2023-07-18T17:59:02Z","title":"AnyDoor: Zero-shot Object-level Image Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09481","snapshot_observed_at":"2026-08-10T21:56:07.670882Z","title":"Anydoor: Zero-shot object-level image customization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.670882Z"},"links":{"cited_paper":"/paper/2307.09481","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:1443da2f4ceaa8e5182672499da2be850ffc308348147e65982b9cea84fd88b3","observation_id":"02e3a208-db6f-49db-b564-890f63a8da68","resolution":{"observed_at":"2026-08-10T21:56:07.670882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.797923Z","title":"Compositional gan: Learning image-conditional binary composition,","venue":null,"work_id":"c8464a5b-e509-4f2c-8b40-f303a93ddd28","year":2020},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.676004Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:0acbaaec262815013c8a6cf10586eb9c23ce60aab331925509dd6898ae563146","observation_id":"507af8f7-d69f-4830-a34f-99ca62ea1037","resolution":{"observed_at":"2026-08-10T21:56:08.802754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.783029Z","title":"Painterly image har- monization using diffusion model,","venue":null,"work_id":"2d81bff7-0c45-4a0a-ac7a-9b6f488412b2","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.681275Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:888a8f4c4721afb78af555989eb4edb2e6c07f7338c7f34da83f82a7f43e8503","observation_id":"31f2056f-333a-4559-b1d9-94febbf47efc","resolution":{"observed_at":"2026-08-10T21:56:08.787864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.767569Z","title":"Learning object placement via dual-path graph completion,","venue":null,"work_id":"2eaa7d1e-73cd-41e3-873c-913a94353c16","year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.686719Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:f9cf70fc755039d2f51e11d066f924ba962c768637f7d82d0946a4601e97a669","observation_id":"e9c2d73b-59dc-447a-bd3a-e9a942e89f9f","resolution":{"observed_at":"2026-08-10T21:56:08.772525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.691768Z","title":"Bridging composite and real: towards end-to-end deep image matting,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.691768Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:fc2c9f537d213b39cb87e52bb955454e1ae237ef5e8c380d631f48af7469fdf9","observation_id":"a716b768-b8b4-497f-b3b1-b66efba431bf","resolution":{"observed_at":"2026-08-10T21:56:07.691768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.04499","last_updated":"2019-09-10T14:05:28Z","snapshot_observed_at":"2026-08-15T19:16:49.887888Z","submitted_at":"2019-09-10T14:05:28Z","title":"Countering Language Drift via Visual Grounding","version":1},"cited_work":{"arxiv_id":"1909.04499","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.04499","snapshot_observed_at":"2026-08-10T21:56:08.123335Z","title":"Countering Language Drift via Visual Grounding","venue":"cs.CL","work_id":"ab1e486a-9605-45f2-b3c1-28a3300c3526","year":2019},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.696770Z"},"links":{"cited_paper":"/paper/1909.04499","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:5c8188e2aa24b4468fc85d7b63962f80d4a7cc9f99bc2408fdca553ac4653bac","observation_id":"14e339c8-fa07-4b9d-95c9-130deb36e274","resolution":{"observed_at":"2026-08-10T21:56:08.130646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.742111Z","title":"Countering language drift with seeded iterated learning,","venue":null,"work_id":"601cd473-306f-440b-8d7c-2034d72231d3","year":2020},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.703288Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:375698098a475738c6ae81529e5b778c0c7e2f29d7de5a9b378221550f089501","observation_id":"6bbe005a-19ee-4fa3-b5cf-41c9e2f9ebca","resolution":{"observed_at":"2026-08-10T21:56:08.747215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.708296Z","title":"Adding conditional control to text-to-image diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.708296Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:656dff921687530345c14347ab4963cb89343a93fa88c5343f8a0eb08e997656","observation_id":"6b7ac6d6-1010-4df4-8417-42e1691559c8","resolution":{"observed_at":"2026-08-10T21:56:07.708296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.713063Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.713063Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:ccdb3efb1d7f1640f9273fb2b8191416d3adbdd9d88bb4f8a604d9e7e501cfc9","observation_id":"49a87905-e020-45a4-95c1-eaaaeabf27af","resolution":{"observed_at":"2026-08-10T21:56:07.713063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.705989Z","title":"Mat: Mask- aware transformer for large hole image inpainting,","venue":null,"work_id":"76fb8588-b16e-4ef8-8ce9-bd541cbd84e3","year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.717859Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:9e7ae6831867475fcac8f7f41cda8c629e0a74bef78c629237be2ad9743fb9bb","observation_id":"524e131e-d475-4a08-9941-c64bb2cb9132","resolution":{"observed_at":"2026-08-10T21:56:08.711245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.722923Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.722923Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:e52d8970ec6bca67947a6a29c8e79cbfb044d1b8dcaf25d9cdf6b01a44d64a38","observation_id":"6a5755f2-b5bb-480f-9df7-0db61c97e652","resolution":{"observed_at":"2026-08-10T21:56:07.722923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.679911Z","title":"Imagen editor and editbench: Advancing and evaluating text-guided image inpainting,","venue":null,"work_id":"4a311f6a-8f5a-4a57-b398-1495cef8a5dd","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.728756Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:f100b6a96c7f6d43d7c878a3b34073c2903c943e1bea6a3bc0c091bd2e82c7d0","observation_id":"23e6db53-1882-4dd0-8c6b-0ad0e9bc7514","resolution":{"observed_at":"2026-08-10T21:56:08.685209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.662993Z","title":"Layoutdm: Transformer-based diffusion model for layout generation,","venue":null,"work_id":"84b33be9-133a-4f9d-9461-093e7fc30392","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.733907Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:4a57a33e8b2857d6e857f4db915ddd81ed2d148c1b573d4b0d34961c7fdbbef7","observation_id":"fb86e0dd-974f-4589-b552-715c91a6dc6b","resolution":{"observed_at":"2026-08-10T21:56:08.668750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.738683Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.738683Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:79e81a2d627fb405029a0283c8ff548b419496b920c6c8674cff4f7a777d2696","observation_id":"471c75c9-50e5-4e5d-b815-fddb435862b1","resolution":{"observed_at":"2026-08-10T21:56:07.738683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.636762Z","title":"Gligen: Open-set grounded text-to-image generation,","venue":null,"work_id":"b1564f09-4344-4479-8a0c-a0d91526723d","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.743823Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:202cc1f51f27985b4dba69d38e1d5233b0ac8a09b70800b51fc897e0a27199c1","observation_id":"d74b7532-9572-4ece-b580-a854ffbf74b2","resolution":{"observed_at":"2026-08-10T21:56:08.641753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.748652Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.748652Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:d4fa931d1a441047f5078923821a02d3dda8ef862d6fd1320885d2503d9c718c","observation_id":"c8449c7b-b116-465d-aff1-a46eb26e1587","resolution":{"observed_at":"2026-08-10T21:56:07.748652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.610664Z","title":"Denoising diffusion probabilistic mod- els,","venue":null,"work_id":"0acfcb62-df22-468c-ac30-6b03b655eaff","year":2020},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.753403Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:31a70e65386fe7a0b94d4cd96d1833307a82eb7d35076de823d23473df561d08","observation_id":"905618ed-fd07-4b0f-9c79-11b8bae24e9b","resolution":{"observed_at":"2026-08-10T21:56:08.615458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.758124Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.758124Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:36d67b2e5f9da4afaaecf22bf31ab688adf4aaa7e0b3c29a1bf271c33166c22e","observation_id":"6a8f896d-01df-451a-9e26-ab41a15bb839","resolution":{"observed_at":"2026-08-10T21:56:07.758124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-10T21:56:07.762979Z","title":"Score-based generative modeling through stochastic differ- ential equations,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.762979Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:9b25f33d33a37e2633d33e5fa9cbf9f755b64a567785267a1e81ae76abbc7f3e","observation_id":"a737daf2-7c0a-48f6-80c9-01f69e097b18","resolution":{"observed_at":"2026-08-10T21:56:07.762979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.767836Z","title":"Improved denoising diffusion probabilis- tic models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.767836Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:bae45f75348d99db90be708cb43646279cb95d83f6501e6a8f4d084cf54c50c1","observation_id":"20281740-7012-456b-8864-f5d92f1b7f75","resolution":{"observed_at":"2026-08-10T21:56:07.767836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.772378Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.772378Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:9dc70f1765860a8a9bc56678792b9b28b27f6a102fd266faa18970329b555f00","observation_id":"672f60f6-c064-46de-87e7-581021e4b8c0","resolution":{"observed_at":"2026-08-10T21:56:07.772378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.565153Z","title":"Fastdiff: A fast conditional diffusion model for high-quality speech synthesis,","venue":null,"work_id":"4dfaa6d2-406c-471d-9189-1236144342eb","year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.777676Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:6ffa9b92c721684747afdabcedb876306ba13fd04abd95d6f3eb7ff05155e1f0","observation_id":"f6e23de4-71ab-4a87-906f-b47e5a5a0789","resolution":{"observed_at":"2026-08-10T21:56:08.570135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03374","last_updated":"2024-02-27T02:45:34Z","snapshot_observed_at":"2026-08-13T11:48:46.737918Z","submitted_at":"2023-05-05T09:08:25Z","title":"DisenBooth: Identity-Preserving Disentangled Tuning for Subject-Driven Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03374","snapshot_observed_at":"2026-08-10T21:56:07.783337Z","title":"Disenbooth: Disentangled parameter-efficient tuning for subject-driven text-to-image generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.783337Z"},"links":{"cited_paper":"/paper/2305.03374","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:3a6a3c00a5cfda6b6ff64cb34bd29505e7862dc4a7dc783c8d24195b8eeb2d0e","observation_id":"db43b03c-ce0f-4eca-be57-513feed80894","resolution":{"observed_at":"2026-08-10T21:56:07.783337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03411","last_updated":"2023-04-06T23:26:38Z","snapshot_observed_at":"2026-08-15T02:33:47.682205Z","submitted_at":"2023-04-06T23:26:38Z","title":"InstantBooth: Personalized Text-to-Image Generation without Test-Time Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03411","snapshot_observed_at":"2026-08-10T21:56:07.788000Z","title":"Instantbooth: Personalized text-to-image generation without test-time finetuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.788000Z"},"links":{"cited_paper":"/paper/2304.03411","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:3f0f6a63cce0601d32b99488dc9695cc2be3cac4894d295e24b604a53d16c308","observation_id":"41ca1734-141f-45b7-b44b-5363ace9288b","resolution":{"observed_at":"2026-08-10T21:56:07.788000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13848","last_updated":"2023-08-18T17:12:13Z","snapshot_observed_at":"2026-08-14T13:38:46.864104Z","submitted_at":"2023-02-27T14:49:53Z","title":"ELITE: Encoding Visual Concepts into Textual Embeddings for Customized Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13848","snapshot_observed_at":"2026-08-10T21:56:07.792817Z","title":"Elite: Encoding visual concepts into textual embeddings for customized text-to-image generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.792817Z"},"links":{"cited_paper":"/paper/2302.13848","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:227921367127d65711d5b5ff447ccac2d536f4ba4f021168621931e36d47c779","observation_id":"eb7becec-6434-4168-85d5-f61ee20bd04b","resolution":{"observed_at":"2026-08-10T21:56:07.792817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05125","last_updated":"2023-03-09T09:16:04Z","snapshot_observed_at":"2026-08-13T12:28:32.854815Z","submitted_at":"2023-03-09T09:16:04Z","title":"Cones: Concept Neurons in Diffusion Models for Customized Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05125","snapshot_observed_at":"2026-08-10T21:56:07.797790Z","title":"Cones: Concept neurons in diffusion models for customized generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.797790Z"},"links":{"cited_paper":"/paper/2303.05125","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:336b47f6ba63c7c275df19972d46935868ea9d1b6c1a04a04be36b36d3dfb59f","observation_id":"5a540e45-d1b3-413c-9718-35f3a44da445","resolution":{"observed_at":"2026-08-10T21:56:07.797790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09522","last_updated":"2023-07-15T15:48:48Z","snapshot_observed_at":"2026-08-15T14:46:43.126675Z","submitted_at":"2023-03-16T17:38:15Z","title":"P+: Extended Textual Conditioning in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09522","snapshot_observed_at":"2026-08-10T21:56:07.802479Z","title":"p+: Ex- tended textual conditioning in text-to-image generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.802479Z"},"links":{"cited_paper":"/paper/2303.09522","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:d0993acbae527774c4e41ed1fcc59929ec1ca76e4217eda3ff5ddd12c87e11eb","observation_id":"a51f0e7c-536f-4ed4-a3a7-7291ad6b6244","resolution":{"observed_at":"2026-08-10T21:56:07.802479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.548984Z","title":"Subject-driven text-to-image generation via apprenticeship learning,","venue":null,"work_id":"4b31a275-2288-4434-84dd-2426ade0fb53","year":2024},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.807275Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:830ff01f42644b48746d512ace3c428d39fc97d1ee34999015dbbb0cc2063b69","observation_id":"1833d590-8ba1-46f7-92d1-83b871da6358","resolution":{"observed_at":"2026-08-10T21:56:08.554918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.533481Z","title":"A neural space- time representation for text-to-image personalization,","venue":null,"work_id":"4752ccd3-f157-4af7-af9a-4c280ed90be3","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.811927Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:c0d3ecd1b7b6db0274ccce22398f3e61fe15a1678a0c0907c817a2ddf482ae08","observation_id":"71147ebd-8197-4cb5-9d3e-b100c5583cb2","resolution":{"observed_at":"2026-08-10T21:56:08.538573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.517033Z","title":"T2i- adapter: Learning adapters to dig out more controllable ability for text- to-image diffusion models,","venue":null,"work_id":"1cd1e9fe-ce8c-49c6-9c1c-995afa36306b","year":2024},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.816846Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:d359e202c65735b7f28f9b064556297199db183278a8a0df386e20a3e2a6d7e0","observation_id":"1e34b9bd-3109-4a0d-b227-425b753ac173","resolution":{"observed_at":"2026-08-10T21:56:08.522570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.501229Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models,","venue":null,"work_id":"73d2ac1f-dae9-49f7-89a0-2fb2dabf5335","year":2024},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.821350Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:90c844b349ec0a8067d6c4b2e03eb5716433d1c7559be13509dc6adbfe992960","observation_id":"dc75e2ed-f764-4084-ab1b-c571dc250eb8","resolution":{"observed_at":"2026-08-10T21:56:08.506195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.485517Z","title":"Layoutvae: Stochastic scene layout generation from a label set,","venue":null,"work_id":"77018a81-6e15-4cba-a922-44bbc3a3f67a","year":2019},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.826603Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:7b2c0f5fa13c1c188dd8233e018da1cce3cc5d5e42e2639a8aa0f945356be0eb","observation_id":"d3029fa8-af2b-4838-8d09-dba17ef4600b","resolution":{"observed_at":"2026-08-10T21:56:08.491179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.06767","last_updated":"2019-01-21T02:14:14Z","snapshot_observed_at":"2026-08-14T17:28:23.981389Z","submitted_at":"2019-01-21T02:14:14Z","title":"LayoutGAN: Generating Graphic Layouts with Wireframe Discriminators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.06767","snapshot_observed_at":"2026-08-10T21:56:07.831159Z","title":"Layoutgan: Gen- erating graphic layouts with wireframe discriminators,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.831159Z"},"links":{"cited_paper":"/paper/1901.06767","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:e86d78f1f623ca3256ca5862f4e7cdb8af7bead0f1fe9ea69eb8f0bdcdf9f20f","observation_id":"b636b276-a809-49de-976f-2b4c7705f923","resolution":{"observed_at":"2026-08-10T21:56:07.831159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.468167Z","title":"Attribute- conditioned layout gan for automatic graphic design,","venue":null,"work_id":"b5d03422-485d-4acb-91a5-8033fbbab722","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.836278Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:a54a8527df30907931e9fbc2cbaa03dd936daa0e542ce6d673564aa38e0a30db","observation_id":"620910f7-8767-4737-b0f4-79365c0e6527","resolution":{"observed_at":"2026-08-10T21:56:08.473776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.451874Z","title":"Variational transformer networks for layout generation,","venue":null,"work_id":"ea7b6416-1aa7-4f05-82c1-934f9199281c","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.840938Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:965a60c8324ff4116f5cd02d9920732eb313ec142ab0f13a864250de22cceb1b","observation_id":"d03f73e1-2851-4f39-b61c-994f95d1b94d","resolution":{"observed_at":"2026-08-10T21:56:08.456686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.436063Z","title":"Layouttransformer: Layout generation and completion with self-attention,","venue":null,"work_id":"e76fcf87-c237-43af-9d61-049193cb2810","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.845606Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:f605a62006733d8a44debd4c6090a6e0448a19489b9b7b6f3cbca10da8c114e7","observation_id":"6a4d4e75-637d-4994-ab81-dd329740c68a","resolution":{"observed_at":"2026-08-10T21:56:08.440962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.420026Z","title":"Layout-bridging text-to-image synthesis,","venue":null,"work_id":"8c4e035f-740f-4b7b-9b58-04dc23c56c17","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.850454Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:c5139a6126e56a7bb91024ba007cfe77bdf7bf976e976eadbfa2b283f19a0212","observation_id":"165e288f-8e9b-4b86-a062-cb046cb86663","resolution":{"observed_at":"2026-08-10T21:56:08.424957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.403400Z","title":"Background layout generation and object knowledge transfer for text-to-image generation,","venue":null,"work_id":"0eab275a-dcac-44f5-a639-c5f81912346c","year":2022},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.855108Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:e59cc2d18ceb6bf3755a3dfe2e38731a55e094fcb870b0058d19274c3d775f9f","observation_id":"d7401883-f39f-4c1e-8a5e-96734e564948","resolution":{"observed_at":"2026-08-10T21:56:08.409209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.387113Z","title":"Layoutllm-t2i: Eliciting layout guidance from llm for text-to-image generation,","venue":null,"work_id":"df16056a-656a-4327-a2ac-83b6f94aa1dd","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.859843Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:3d6003120cc7203dd0b5c91a9a32dfccacc6a20361674ddab78be46459e3f1ef","observation_id":"9931f9fa-61af-4d87-9f9f-0c0eb979fc16","resolution":{"observed_at":"2026-08-10T21:56:08.392739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13655","last_updated":"2024-03-04T18:43:49Z","snapshot_observed_at":"2026-08-14T02:27:06.690299Z","submitted_at":"2023-05-23T03:59:06Z","title":"LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13655","snapshot_observed_at":"2026-08-10T21:56:07.864387Z","title":"Llm-grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.864387Z"},"links":{"cited_paper":"/paper/2305.13655","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:20d4895d5a609c965f6b0113e706f1bae0fb02030ad2e9caede99a3d4866a5e2","observation_id":"7b6340ee-ecbf-40c5-b81c-4478cc4287a4","resolution":{"observed_at":"2026-08-10T21:56:07.864387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.869369Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.869369Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:38be0e3a4c8ceb12dab018ba0418a2119e55e16ecdaee60357b0ac63ec917bf0","observation_id":"7d003791-b3c1-4253-8fc9-da2fe2edb2c4","resolution":{"observed_at":"2026-08-10T21:56:07.869369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.874882Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.874882Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:f13a982329ccf4d2df923f0afa42505cc9d694b3a181e2f96cfe7c65f4389eb1","observation_id":"d207fd25-3c02-4a19-9887-ae07a066bc18","resolution":{"observed_at":"2026-08-10T21:56:07.874882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T21:56:07.879344Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.879344Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:8a5a5729bee2f9ea27e9653658436e35bab1d1074ab49bb0fff2fa6b425449f6","observation_id":"4d82856c-e9c8-40d2-966f-a40923bc4b75","resolution":{"observed_at":"2026-08-10T21:56:07.879344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.349719Z","title":"On the spectral bias of neural networks,","venue":null,"work_id":"bc444745-d0ed-4006-9320-6ccef0c20622","year":2019},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.884222Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:15032a81926dd7a155c835ffecb7f85276b6a8085e60c44d4a190872e8912a51","observation_id":"8dbcf914-8753-4682-a2b0-ce60a0760c9c","resolution":{"observed_at":"2026-08-10T21:56:08.355260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.888735Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.888735Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:a4bbe47e9533e80f78e355560142520c3b5e9d478a4b38318e419953c4e39f7f","observation_id":"9bdfc08e-75d4-4bc9-a085-296e04b46105","resolution":{"observed_at":"2026-08-10T21:56:07.888735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.893247Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.893247Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:9e7e7f04f3dd2a5724c215df3673136633cd5a265541e30b1a05ce65469a84c1","observation_id":"b87feada-dda5-4334-897c-874fa388a333","resolution":{"observed_at":"2026-08-10T21:56:07.893247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.314112Z","title":"Image synthesis from layout with locality-aware mask adaption,","venue":null,"work_id":"ab8f337b-eccd-4bac-bd33-ec3b6ed6f381","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.897901Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:329a6967e51c3c249161ee6e6acc0d77616191fb417ff4ab16b7395ca86bf1c0","observation_id":"7f0254a8-e094-4942-9f6a-be9de7508741","resolution":{"observed_at":"2026-08-10T21:56:08.319659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.298638Z","title":"Constrained graphic layout generation via latent optimization,","venue":null,"work_id":"6ead44e1-ca23-406f-9afc-e10d6a998b46","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.902493Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:9c3303c7d9290cb8cf6eda443db32ef692f6c6777990c5c4e1bcbc7a0fcf1cca","observation_id":"9882da85-2b29-4e33-9a35-433e3a9e9514","resolution":{"observed_at":"2026-08-10T21:56:08.303614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:07.907166Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.907166Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:254e907e22206c7ca446859f39eafc7e11befb7b8cddf4de2417bb167bbc8a4d","observation_id":"78a56dc3-82e0-4f81-8ad1-d06fe206d62b","resolution":{"observed_at":"2026-08-10T21:56:07.907166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-10T21:56:07.911944Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.911944Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:0bc1a5fce58108941a98cdea847b26a1d34177f640af88f46abf11f645a16b08","observation_id":"95fd7851-cac3-46ab-bf80-72079237903b","resolution":{"observed_at":"2026-08-10T21:56:07.911944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.270070Z","title":"Dataset diffusion: Diffusion-based synthetic data generation for pixel-level semantic seg- mentation,","venue":null,"work_id":"8c4c8c7b-00ca-43d0-83e1-71321766352d","year":2024},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.917040Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:fc53ee596a55c8b1c73814e5e71147492f2ee6c65b66f92cd2f31843f5cae73b","observation_id":"42f614d4-7af6-476e-9d88-e9015524d7e0","resolution":{"observed_at":"2026-08-10T21:56:08.275701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.252792Z","title":"Image synthesis from reconfigurable layout and style,","venue":null,"work_id":"cb2d7e9c-3de3-4616-b51c-b231d5b74044","year":2019},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.922661Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:a3c212e39d014f294c7f55d771d1419a3889b428d1e089bb9943fa900fc89003","observation_id":"448d14bc-e049-4efd-a55e-890bde848c11","resolution":{"observed_at":"2026-08-10T21:56:08.258206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.236866Z","title":"Learning layout and style reconfigurable gans for controllable image synthesis,","venue":null,"work_id":"9408b9c2-2a49-41f9-80c3-6ced0ff660df","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.927361Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:bae1e8897614e31e1a4cc5387ea091adc5d336263fe8eb386e57550ae16b1beb","observation_id":"676c68f8-2e66-44e4-81ae-687cb1b368f7","resolution":{"observed_at":"2026-08-10T21:56:08.241887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.221281Z","title":"Object- centric image generation from layouts,","venue":null,"work_id":"e305e6fc-9649-4a4b-af7c-7c2f0b63815d","year":2021},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.932105Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:0f4a7e93d01f32676ec07ee132c592e7cb852bf38e1b3ab8cdcecfdce72b40f3","observation_id":"7c4f1469-648c-4298-9120-8c4cf455e1d9","resolution":{"observed_at":"2026-08-10T21:56:08.226246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.205504Z","title":"Layoutdiffusion: Controllable diffusion model for layout-to-image generation,","venue":null,"work_id":"0a60e6d6-2e40-46f3-95fa-a2f1bc2f4e67","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.936977Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:554d97951a55ddbd80251b014c32197fc43b5bfcaa8fd9edc0dccdf9287391d6","observation_id":"f93553b9-a59e-4f37-b703-6609b187936a","resolution":{"observed_at":"2026-08-10T21:56:08.210383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:08.190018Z","title":"Drag your gan: Interactive point-based manipulation on the generative image manifold,","venue":null,"work_id":"85b5c393-5cb8-4116-a1e6-2b4df9037701","year":2023},"citing_paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:07.941714Z"},"links":{"citing_paper":"/paper/2501.03490"},"observation_digest":"sha256:a5efe650eedc143c99dec656d29bd03f2352acf9d0019cda008941dedb5999c8","observation_id":"1e0a897d-406a-4e01-956f-840b489f5178","resolution":{"observed_at":"2026-08-10T21:56:08.195108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.03490","last_updated":"2025-01-07T03:18:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T17:54:21.076775Z","submitted_at":"2025-01-07T03:18:15Z","title":"SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 1 inbound Pith citation observation for arXiv:2501.03490."}