{"as_of":"2026-08-21T04:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:db36df460e51daeb264486c8a9078bbad7e0b452521074c2d08479a77bc7f830","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:30:48.007551Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.12173/citation-record","integrity":"/paper/2501.12173/integrity","json":"/paper/2501.12173/citation-record.json","paper":"/paper/2501.12173"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.682120Z","title":"Spatext: Spatio-textual representation for con- trollable image generation","venue":null,"work_id":"5d6d4e21-9e21-47f0-9c77-37e86d402277","year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.768865Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:7c950110a681a1f3fa4ddf70b6765929a77d4e54fb98e066b0d95ed36128aa2f","observation_id":"d490b31e-3d0d-4c43-b68c-25bcb4026d10","resolution":{"observed_at":"2026-08-10T17:30:48.686884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08113","last_updated":"2023-02-16T06:28:29Z","snapshot_observed_at":"2026-08-19T19:26:15.320752Z","submitted_at":"2023-02-16T06:28:29Z","title":"MultiDiffusion: Fusing Diffusion Paths for Controlled Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08113","snapshot_observed_at":"2026-08-10T17:30:47.773975Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.773975Z"},"links":{"cited_paper":"/paper/2302.08113","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:44854f091fc297d8ce0a2af8e82d61ffca984a23756b26a281666f311599ec27","observation_id":"df8c0798-d017-47ee-be16-10ae77b31b18","resolution":{"observed_at":"2026-08-10T17:30:47.773975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.669598Z","title":"Sutherland, Michael Arbel, and Arthur Gretton","venue":null,"work_id":"1dc0dee5-de66-4cd9-871f-564b973274ad","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.778737Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:70fde3a429c89c99dc4589c53c861576f13fc4214f87929edaaa347adac41a7b","observation_id":"ba481bdf-bd9b-4bab-8d27-4b19380350ed","resolution":{"observed_at":"2026-08-10T17:30:48.673792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-20T07:25:13.985346Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-08-10T17:30:47.782994Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.782994Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:154746ecc5f1bbf145195a1544316d9ad93ad9d5e633691c50957202b4b0829f","observation_id":"e15659c6-0fe5-466e-a797-2181377d1e4c","resolution":{"observed_at":"2026-08-10T17:30:47.782994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05793","last_updated":"2023-09-11T19:59:43Z","snapshot_observed_at":"2026-08-19T02:01:37.842274Z","submitted_at":"2023-09-11T19:59:43Z","title":"PhotoVerse: Tuning-Free Image Customization with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05793","snapshot_observed_at":"2026-08-10T17:30:47.787809Z","title":"Photoverse: Tuning-free image customization with text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.787809Z"},"links":{"cited_paper":"/paper/2309.05793","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:581dc0d337b062e8cce4fafa6c97f2a2f52d2886f618dda3dedec20f5cf9d065","observation_id":"a7e13581-a7e8-4a81-a5d6-46a2e4255ddd","resolution":{"observed_at":"2026-08-10T17:30:47.787809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.792688Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.792688Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:7c37a5f13892ffc6802ad85abdd4af0c8949575d8b31cbc54868e836fcfe2183","observation_id":"b51779b0-dd86-4f76-8c11-dd7cd6fe8f80","resolution":{"observed_at":"2026-08-10T17:30:47.792688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09481","last_updated":"2024-05-08T03:21:34Z","snapshot_observed_at":"2026-08-16T15:15:13.894611Z","submitted_at":"2023-07-18T17:59:02Z","title":"AnyDoor: Zero-shot Object-level Image Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09481","snapshot_observed_at":"2026-08-10T17:30:47.798320Z","title":"Anydoor: Zero-shot object-level im- age customization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.798320Z"},"links":{"cited_paper":"/paper/2307.09481","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:417318a982b2c1695fa358fcbd6cad9a93d701ee74892153ef04c4d65845c38e","observation_id":"64544040-90d9-42c6-b024-18658ba570df","resolution":{"observed_at":"2026-08-10T17:30:47.798320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08908","last_updated":"2023-02-16T14:20:25Z","snapshot_observed_at":"2026-08-20T00:48:42.428917Z","submitted_at":"2023-02-16T14:20:25Z","title":"LayoutDiffuse: Adapting Foundational Diffusion Models for Layout-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08908","snapshot_observed_at":"2026-08-10T17:30:47.802873Z","title":"Layoutdiffuse: Adapting foundational dif- fusion models for layout-to-image generation.arXiv preprint arXiv:2302.08908, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.802873Z"},"links":{"cited_paper":"/paper/2302.08908","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:00ec22e0877dd2a1f14d0ad0b0ee67486b8e050743e9492486f28f1aca5a1a51","observation_id":"84e5c1ab-d65e-4699-993f-ed758ebd7b9d","resolution":{"observed_at":"2026-08-10T17:30:47.802873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04907","last_updated":"2022-10-06T10:00:48Z","snapshot_observed_at":"2026-08-20T18:03:09.672303Z","submitted_at":"2022-03-09T17:38:03Z","title":"KPE: Keypoint Pose Encoding for Transformer-based Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04907","snapshot_observed_at":"2026-08-10T17:30:47.807837Z","title":"Pose guided multi-person image generation from text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.807837Z"},"links":{"cited_paper":"/paper/2203.04907","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:a4280491143507b3d93a7639b8dce9d105d5926b90a773da2a0ff83b1b4aecec","observation_id":"74322a34-e077-4956-a9bb-5c5d8e95b8ae","resolution":{"observed_at":"2026-08-10T17:30:47.807837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.649126Z","title":"Viton-hd: High-resolution virtual try-on via misalignment-aware normalization","venue":null,"work_id":"f5dcbe59-cc55-4f3d-aa71-a0cc4bf28bfa","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.812542Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:848a01dbf9259f223ac3149ca7ae7effbd85ce16b81a372bc7335149d3ad6e2a","observation_id":"7463dbd3-605e-4864-920a-c7f8f865d4b9","resolution":{"observed_at":"2026-08-10T17:30:48.653415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.636567Z","title":"Measures of the amount of ecologic association between species","venue":null,"work_id":"6afd80ef-a25a-45c6-8e40-b6963a1628d0","year":1945},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.816586Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:6b280b1008b73a66baf8d3ee70b0bcb54a8b3a8bba9dc0731bab54db054f8058","observation_id":"a75b5cc1-77df-4446-a201-24c77098d514","resolution":{"observed_at":"2026-08-10T17:30:48.641094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.623555Z","title":"Stylegan-human: A data-centric odyssey of human genera- tion","venue":null,"work_id":"8ef75a8c-fa1d-486a-abed-47f24eb35267","year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.820786Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:e6fdad0acf609e9b2f4c2dc6f43fd02a10549435a1b5a3d51f93213c8773e48e","observation_id":"f4ce4cb4-362e-4645-b07b-e210759a69ec","resolution":{"observed_at":"2026-08-10T17:30:48.628108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-20T10:39:03.872570Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-10T17:30:47.825923Z","title":"An image is worth one word: Personalizing text-to- image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.825923Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:032a0e617add097819dbb9035b4f99e3e0e2cc63446106661b635137c283066d","observation_id":"c72b606b-1c4d-4089-bd16-dd1af06003e9","resolution":{"observed_at":"2026-08-10T17:30:47.825923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.610945Z","title":"A versatile benchmark for de- tection, pose estimation, segmentation and re-identification of clothing images","venue":null,"work_id":"f5e08bfa-b1e2-474a-94a9-fa9167887e93","year":2019},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.830402Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:7d60911bf4d9b6fbe273522b22bd8b408b49ea839efba02637683cb529654d71","observation_id":"ba458290-f62a-4d56-9c3a-441c41d42976","resolution":{"observed_at":"2026-08-10T17:30:48.615396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.597253Z","title":"Context- aware layout to image generation with enhanced object ap- pearance","venue":null,"work_id":"444c8d03-7cfe-4036-a35b-bac92a210066","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.835299Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:f5e7370583e3a3346bd022bb9475f6f0c40db4453ca56d8852f86ea136a944bf","observation_id":"6536aca5-b052-495a-9982-daf7022e9f41","resolution":{"observed_at":"2026-08-10T17:30:48.602017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.839765Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.839765Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:7eb4de52bdc67943c63fdefb72b2111d697257e6f78aa23b9bd26d9f54f390d3","observation_id":"75ae43e7-c555-42b4-af0a-fe35d4fb7642","resolution":{"observed_at":"2026-08-10T17:30:47.839765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-18T00:01:15.410179Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T17:30:47.844735Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.844735Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:3cc3189f9a59fb59b41dac6e8efd0d61a5432621f77fcd0d2d56ea793bb7e357","observation_id":"e0be945d-b4ad-488d-954a-f4da9bd4ba9b","resolution":{"observed_at":"2026-08-10T17:30:47.844735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T17:30:47.849204Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.849204Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:fe718b24c45b479f6ec3dfc16aa8b01d75c12509a5cf6e89d192d4b0c955bc14","observation_id":"66cc599d-d0ce-48dd-bff7-158d4bc5a32d","resolution":{"observed_at":"2026-08-10T17:30:47.849204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.575568Z","title":"´Etude comparative de la distribution florale dans une portion des alpes et des jura","venue":null,"work_id":"b10c4d2e-73c9-4632-a308-7d06745358d2","year":1901},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.854040Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:59d353257d830c0cd0814f4d5db65d016772c98aa52faf8d62508fdee0b2f50e","observation_id":"d177a0fb-e45b-4063-aacc-13e6ea135bf0","resolution":{"observed_at":"2026-08-10T17:30:48.580058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.562943Z","title":"Text2human: Text-driven controllable human image generation","venue":null,"work_id":"4e22a2ff-aee9-436d-8e44-13a359b564ae","year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.858407Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:37163436595b7e0e2b7fe9bf5593b6156b5f3af2f2348633ba36ea28ef5db9ee","observation_id":"ee5ccada-a3ec-471c-9e24-3d1f12f62f34","resolution":{"observed_at":"2026-08-10T17:30:48.567316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.550749Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":"2fa3b56d-caa7-4651-941a-7d2a2ba1cfa4","year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.862430Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:5fb0fe8b9112afde41dece859d599f105a4d5b5ffdc6dd2d1119c3322ad192f3","observation_id":"fd99474c-d18a-49c5-8832-fbd29d4872e3","resolution":{"observed_at":"2026-08-10T17:30:48.554819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-10T17:30:47.866740Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.866740Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:5b64558608b9edae4ff32aa860e35dfbe5f69775be2b1235b2e8329f722a75f3","observation_id":"e86d74a4-fa59-48f2-adf9-23d908bed295","resolution":{"observed_at":"2026-08-10T17:30:47.866740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-10T17:30:47.871094Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.871094Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:c84e6cda4cb9657f39230cd56e69b2adb731c4feee109d581feca21ea53b7b46","observation_id":"c50343be-f86d-46d3-9e95-fb61a07c58c5","resolution":{"observed_at":"2026-08-10T17:30:47.871094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.875119Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":null,"year":1931},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.875119Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:bd29833c65dd8dc47a87ec5f5074e37ed7cd651069be6de3f0284d7478669a26","observation_id":"9a33e0e4-b2cd-445b-ad39-14aa23fdc43c","resolution":{"observed_at":"2026-08-10T17:30:47.875119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.879911Z","title":"Self- correction for human parsing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.879911Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:acfb547eee6d2ed83c0818ce81ff3c94e50d19f933c3a6224088ec238062a447","observation_id":"b658aa63-f2b8-4934-8adc-0ad7dbfcf72c","resolution":{"observed_at":"2026-08-10T17:30:47.879911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.522669Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"5434aaa9-e243-40e9-8205-c3ae77710393","year":null},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.883877Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:b3487b7a3809272a5cd81a35486f50657f51210d4ef813aa68a06016226e28be","observation_id":"94595758-8b25-4f86-8660-f8c8f87ae733","resolution":{"observed_at":"2026-08-10T17:30:48.527010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.510113Z","title":"Image synthesis from layout with locality- aware mask adaption","venue":null,"work_id":"84bb0ac6-365a-499a-8ac5-ebb3a269c4db","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.889188Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:53d409816c3e1e2dca73da3a69c3c2ff3f4abd519664b29c7b8b3c77924ab579","observation_id":"71814155-4120-4460-bfe9-62f5873f8a01","resolution":{"observed_at":"2026-08-10T17:30:48.514255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-08-19T16:02:58.628969Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-10T17:30:47.894131Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.894131Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:8e82d86bc4955d14aa537c1e05203da742be2959ba4aabb5427a7068e9ac1b93","observation_id":"d292a7d4-5b9c-433c-ab03-2970a6ca3eb8","resolution":{"observed_at":"2026-08-10T17:30:47.894131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.496838Z","title":"Dress code: High- resolution multi-category virtual try-on, 2022","venue":null,"work_id":"70d74a45-79d0-4265-a994-3032d68a5c12","year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.901085Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:d5f9a905a1a2bdffd0adf52f583d4aedddec76285ecde64fd57afa1101186afc","observation_id":"1438a259-7aa5-4b42-8dcb-6d800e6bf84b","resolution":{"observed_at":"2026-08-10T17:30:48.501571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05195","last_updated":"2024-04-09T22:14:37Z","snapshot_observed_at":"2026-08-17T19:31:39.405541Z","submitted_at":"2024-02-07T19:07:10Z","title":"$\\lambda$-ECLIPSE: Multi-Concept Personalized Text-to-Image Diffusion Models by Leveraging CLIP Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05195","snapshot_observed_at":"2026-08-10T17:30:47.906551Z","title":"λ-eclipse: Multi-concept personalized text-to-image diffusion models by leveraging clip latent space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.906551Z"},"links":{"cited_paper":"/paper/2402.05195","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:78b8bfd281c44285d65809e232c8002f6c552572ec60267167d28ce454e9f921","observation_id":"f07dde4c-a53b-47c4-832f-dc8412757e0f","resolution":{"observed_at":"2026-08-10T17:30:47.906551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.911049Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.911049Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:c855d3aa423a1c81bfeceffc2249a9bfd604e77c2f2b0b724dc8957633b2ed9d","observation_id":"6c705960-f287-4452-90e0-032760beeb40","resolution":{"observed_at":"2026-08-10T17:30:47.911049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.475784Z","title":"High-resolution image syn- thesis with latent diffusion models, 2021","venue":null,"work_id":"da972f27-4a2e-42f7-a2f1-d43915d8eff7","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.915124Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:1b898a5cc702d870d7080d56293aef069a3c77a8fa2858c60b190b633d31fca7","observation_id":"50d1761e-a282-46e0-bc46-e26e004913e6","resolution":{"observed_at":"2026-08-10T17:30:48.479983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.918826Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.918826Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:61af05b1396cab397a77d74e32e4955bcdb369256527bf86d1fff92fe56f4369","observation_id":"f680884f-6307-44e3-80dc-cb74615c614b","resolution":{"observed_at":"2026-08-10T17:30:47.918826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.454503Z","title":"Humangan: A generative model of hu- man images","venue":null,"work_id":"3378a3f0-e9c2-4d62-963f-bb79313150c9","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.924213Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:c82f5a059c40d60300cfed7ac7ba87f99a60d746c56fdcbae1a186aea3f64751","observation_id":"30885056-b095-4de1-8e94-778a40c7062f","resolution":{"observed_at":"2026-08-10T17:30:48.459736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.928078Z","title":"pytorch-fid: FID Score for PyTorch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.928078Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:e000c624d033d8729b815f21252bd46049b83bb821be71e14e281f9ab7c95ac0","observation_id":"f95a8c05-5756-442a-8ad7-55e739b573ce","resolution":{"observed_at":"2026-08-10T17:30:47.928078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.434081Z","title":"In- stantbooth: Personalized text-to-image generation without test-time finetuning","venue":null,"work_id":"c269ac71-1a23-40e0-aec4-d7853f085e8d","year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.932515Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:41dd0ab058449d7e5a56d7060005e34b6ba822d5557ab3039ca607bff07d4fa8","observation_id":"1f523453-f07d-4eea-bfd7-c5e5ae280c68","resolution":{"observed_at":"2026-08-10T17:30:48.438335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.421119Z","title":"Image synthesis from reconfig- urable layout and style","venue":null,"work_id":"d19f607e-708d-457e-951f-0d3efb3267e0","year":2019},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.936451Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:9315be324655ccdffc731aed8824923652ee35a990a147bb039fafc8e5fda56e","observation_id":"cc25dca7-73fc-4be4-82c6-f8d7fcdf2ad4","resolution":{"observed_at":"2026-08-10T17:30:48.425427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.407946Z","title":"Object-centric image genera- tion from layouts","venue":null,"work_id":"b9f09336-b747-4d0f-8b53-9779103338d2","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.940545Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:7c2f5b17f58feffad6a4936913da0cf33af43b9e91b59e45ce8c4d02de6d51d6","observation_id":"df2be0fc-bf8b-4631-9efb-cdf5184e4130","resolution":{"observed_at":"2026-08-10T17:30:48.412497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.394374Z","title":"Interactive image synthesis with panoptic layout generation","venue":null,"work_id":"c3532ad9-a7f8-4fd2-9103-27bb04fe193c","year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.944723Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:617afba4e6c41670d1c5d1ec7bc29a739a3a2a2c3265d2f786705df6817bec45","observation_id":"236f6967-d908-4754-a255-3195ece747eb","resolution":{"observed_at":"2026-08-10T17:30:48.398448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-16T06:18:35.139211Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-10T17:30:47.949730Z","title":"Instantid: Zero-shot identity-preserving generation in seconds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.949730Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:250b5675b0411d74c847c8c88390f96b3b074e5bc5bb13fb590971984e7fdc60","observation_id":"99752318-c0cb-4658-902b-360198564b6e","resolution":{"observed_at":"2026-08-10T17:30:47.949730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.381296Z","title":"Instancediffusion: Instance-level control for image generation, 2024","venue":null,"work_id":"bfac5067-35f3-4f4d-91f2-aa78d6f06c90","year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.954162Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:7593ca12ce529989d5b9cfc9019b6846e24aefd0e8193fc559ae6becade7cca1","observation_id":"485acd33-d9bb-4334-87ce-05158caaa609","resolution":{"observed_at":"2026-08-10T17:30:48.385731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.368005Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"d4624018-8838-48f0-9b66-99afa1349ebe","year":2004},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.958179Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:6004226f7a72152b9f643664382552a613cb8c1099e6d83f97b887b68fbd3424","observation_id":"a2f20f46-d721-4072-aa23-3776efa3ea22","resolution":{"observed_at":"2026-08-10T17:30:48.372765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13848","last_updated":"2023-08-18T17:12:13Z","snapshot_observed_at":"2026-08-16T15:52:24.593165Z","submitted_at":"2023-02-27T14:49:53Z","title":"ELITE: Encoding Visual Concepts into Textual Embeddings for Customized Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13848","snapshot_observed_at":"2026-08-10T17:30:47.961855Z","title":"Elite: Encoding visual con- cepts into textual embeddings for customized text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.961855Z"},"links":{"cited_paper":"/paper/2302.13848","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:4998ea00901bf3357d208bbdba5d13e13272adb22ea8cd1db3247ef49e1bd01d","observation_id":"43066a6f-3058-4fa9-8fab-dc8d4c3bc853","resolution":{"observed_at":"2026-08-10T17:30:47.961855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.355082Z","title":"Fastcomposer: Tuning-free multi- subject image generation with localized attention","venue":null,"work_id":"20230ddb-6322-42d0-8f8d-e3d497485ac3","year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.966274Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:966e11e87fcfedfb59717b9db4a8f5aab6edee8b483cf6d3445ae9e06ab2561e","observation_id":"414dc079-dcff-402a-b380-7eb015485c60","resolution":{"observed_at":"2026-08-10T17:30:48.359668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08872","last_updated":"2023-11-27T08:42:07Z","snapshot_observed_at":"2026-08-16T14:52:27.856619Z","submitted_at":"2023-10-13T05:48:42Z","title":"R&B: Region and Boundary Aware Zero-shot Grounded Text-to-image Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08872","snapshot_observed_at":"2026-08-10T17:30:47.970015Z","title":"R&b: Region and boundary aware zero- shot grounded text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.970015Z"},"links":{"cited_paper":"/paper/2310.08872","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:83335ba0cc2870b731b41bd63bc8e2e9f7e48ae7b6137e1f78b973ea9e738c19","observation_id":"04342a8f-1d53-4922-b7e2-4683bc520249","resolution":{"observed_at":"2026-08-10T17:30:47.970015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.342198Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":"b57cf92b-ec6a-4e39-ba56-16d181d6dfbf","year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.974418Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:c6604673ccbc7996780dc74cd5a87d23ba13699ca96b5c084cb82d0d5db30435","observation_id":"46f84a73-4883-4025-8cd0-92a06168b2fc","resolution":{"observed_at":"2026-08-10T17:30:48.346658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.978379Z","title":"Reco: Region-controlled text-to-image genera- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.978379Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:dc60a290dd45829cb0dae4323a5fc37e95f3d5b5c525ce9e1b257fc477e22ce1","observation_id":"78a9c7b3-b863-49bf-9550-172e70599253","resolution":{"observed_at":"2026-08-10T17:30:47.978379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-10T17:30:47.982276Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.982276Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:4cc8ffecec70334b17114033881a63618cb3f56d179245e873da046128c60ded","observation_id":"038fce44-f971-4687-a31e-755c0091c412","resolution":{"observed_at":"2026-08-10T17:30:47.982276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.321594Z","title":"Customnet: Zero-shot object customization with variable-viewpoints in text-to-image dif- fusion models, 2023","venue":null,"work_id":"42b93d8b-5a75-43ab-bb85-0df75332ac2d","year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.986643Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:1074f44d4e0d960254f9a5b6d7f9cb610b9d14a6ec4e7c16162899d914f2df1a","observation_id":"e5f886bb-68c3-462f-b0e4-f26e54b30344","resolution":{"observed_at":"2026-08-10T17:30:48.326113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06235","last_updated":"2022-11-11T14:30:34Z","snapshot_observed_at":"2026-08-19T11:16:53.584306Z","submitted_at":"2022-11-11T14:30:34Z","title":"HumanDiffusion: a Coarse-to-Fine Alignment Diffusion Framework for Controllable Text-Driven Person Image Generation","version":1},"cited_work":{"arxiv_id":"2211.06235","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.06235","snapshot_observed_at":"2026-08-10T17:30:48.042332Z","title":"HumanDiffusion: a Coarse-to-Fine Alignment Diffusion Framework for Controllable Text-Driven Person Image Generation","venue":"cs.CV","work_id":"f93a2ede-79be-47e0-8bb1-8096e61f510c","year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.991487Z"},"links":{"cited_paper":"/paper/2211.06235","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:60f000e5491a87836b36ab21631094ae7a6e3f76371fbd046abd3a78c995bf55","observation_id":"ba63e5ea-e2e2-4041-96e5-31f3b0664d9b","resolution":{"observed_at":"2026-08-10T17:30:48.049415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.995603Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.995603Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:fb6fd27892740fee898aa62cdb5e78a21203110429c42679e585eedb6b65ca3d","observation_id":"784dc3f6-544e-41cb-874d-bae8c2f5aef7","resolution":{"observed_at":"2026-08-10T17:30:47.995603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.301560Z","title":"Layoutdiffusion: Controllable diffu- sion model for layout-to-image generation","venue":null,"work_id":"52546b01-faf4-490d-b8f5-0c7965bcbccd","year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.999705Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:b400f85e3ad2107f86b289547c00fb1560b005df2de225375d3cdf6b33887b4f","observation_id":"544697bd-b9d8-430b-a76c-8fa90abb9735","resolution":{"observed_at":"2026-08-10T17:30:48.305842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.288505Z","title":"clip-score: CLIP Score for Py- Torch","venue":null,"work_id":"f299700a-66b2-4f70-9f1a-2888d8e7ad15","year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:48.003474Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:53e93c8a01065674c081f8a7ff4c422f94b01c2a8382e6a15144ad6ba4475981","observation_id":"70dcb08b-9447-4c06-9930-be3b2f0b5f9b","resolution":{"observed_at":"2026-08-10T17:30:48.292780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.275737Z","title":"Migc: Multi-instance generation controller for text-to-image synthesis, 2024","venue":null,"work_id":"d6dadbd3-0d30-48d1-99c6-814a3e843cf2","year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:48.007551Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:f06f77c731130823e5eaa85358882e4ebce365ad5903386b21ec5c1f875b8317","observation_id":"f573d113-9743-4574-a9d8-2b343db30785","resolution":{"observed_at":"2026-08-10T17:30:48.280060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T05:07:35.029556Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2501.12173."}