{"as_of":"2026-08-09T21:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c5dd61d143bc74b82e9974f8ea3f77ca5eebea8d12ae43df4b804a4a681698d","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:05:16.256044Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:35:15.341406Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T23:35:15.923842Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"cited_work":{"arxiv_id":"2502.05165","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05165","snapshot_observed_at":"2026-08-06T23:35:15.923842Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","venue":"cs.CV","work_id":"e100e446-5882-429e-a483-5cee9bde0bb6","year":2025},"citing_paper":{"arxiv_id":"2506.17450","last_updated":"2025-06-26T02:46:40Z","snapshot_observed_at":"2026-08-08T05:18:07.096875Z","submitted_at":"2025-06-20T19:38:34Z","title":"BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:15.341406Z"},"links":{"cited_paper":"/paper/2502.05165","citing_paper":"/paper/2506.17450"},"observation_digest":"sha256:42b1e8ef0784cf83f7dad1c29212c8c21205d887e639c3a06b43de89533aa2e6","observation_id":"58b4d835-8f33-4c81-bfa6-ae638a5cc0b7","resolution":{"observed_at":"2026-08-06T23:35:15.948136Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05165/citation-record","integrity":"/paper/2502.05165/integrity","json":"/paper/2502.05165/citation-record.json","paper":"/paper/2502.05165"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:17.156060Z","title":"Cross-image attention for zero- shot appearance transfer","venue":null,"work_id":"a02c0648-0e3a-461f-be24-c4f188157d1d","year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.003397Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:3d5b5e83222e359880b798e9b59088f38c2890e59228b73e3dc2c329a6c48211","observation_id":"a09b5255-306e-4e4f-874b-fa53aa34b126","resolution":{"observed_at":"2026-08-08T20:05:17.161126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.009424Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.009424Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:15be98e872bc759f4a3c7bed6dd8fd0ef4587f207bb3dae24db1e1795cda46ae","observation_id":"9b0ac045-08d8-484c-90f3-58f2e18265de","resolution":{"observed_at":"2026-08-08T20:05:16.009424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:17.130107Z","title":"Vip- llava: Making large multimodal models understand arbitrary visual prompts","venue":null,"work_id":"e60b576a-396b-4c7d-9d74-c25fbb9a5db7","year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.014215Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:6e2948d7bf41c26e4aefa6b8e4f848344a2789f1375e01b2497f374d901981bc","observation_id":"e1305d9a-3c8c-4819-b371-1232a3b83acc","resolution":{"observed_at":"2026-08-08T20:05:17.134681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:17.114740Z","title":"Masactrl: Tuning-free mu- tual self-attention control for consistent image synthesis and editing","venue":null,"work_id":"f606fed9-ef6c-4d32-946e-d27e9e92cba9","year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.018799Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:3b1bc93c82aedf32fbb4d6ef19aa4827d0827ead0b10497bc87d6ecf3ae02f24","observation_id":"e06f5dcb-2bfb-4d6e-95c5-b1b6f20e0033","resolution":{"observed_at":"2026-08-08T20:05:17.119564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14491","last_updated":"2022-11-22T02:09:38Z","snapshot_observed_at":"2026-08-03T22:24:49.500281Z","submitted_at":"2022-09-29T00:57:28Z","title":"Re-Imagen: Retrieval-Augmented Text-to-Image Generator","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14491","snapshot_observed_at":"2026-08-08T20:05:16.023288Z","title":"Re-imagen: Retrieval-augmented text-to-image gen- erator","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.023288Z"},"links":{"cited_paper":"/paper/2209.14491","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:ac827b1101d0877bae465d0b75f215109dc556d89fafe628df631b124e7a0aee","observation_id":"0b29a90d-0dba-41e3-8e3e-9d8987dc54ce","resolution":{"observed_at":"2026-08-08T20:05:16.023288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:17.098964Z","title":"Subject-driven text-to-image generation via apprenticeship learning","venue":null,"work_id":"44537ba0-d47d-456a-9f82-fe374cd7d766","year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.028321Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:4bcd9974ae4f20aae30216391f2ccb9563894810c36361482203215f60998da3","observation_id":"fc45db59-27d1-4316-8531-c3c37be8189a","resolution":{"observed_at":"2026-08-08T20:05:17.103540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09481","last_updated":"2024-05-08T03:21:34Z","snapshot_observed_at":"2026-08-09T10:44:37.868390Z","submitted_at":"2023-07-18T17:59:02Z","title":"AnyDoor: Zero-shot Object-level Image Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09481","snapshot_observed_at":"2026-08-08T20:05:16.032810Z","title":"Anydoor: Zero-shot object-level im- age customization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.032810Z"},"links":{"cited_paper":"/paper/2307.09481","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:6d9f3feac01ee9cd81051efcc36c2d492f6b4836a45698448f0b6f06e4d03a28","observation_id":"e9684e9a-4df2-466f-bb84-2292e57918ea","resolution":{"observed_at":"2026-08-08T20:05:16.032810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16990","last_updated":"2024-03-25T17:52:07Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:52:07Z","title":"Be Yourself: Bounded Attention for Multi-Subject Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16990","snapshot_observed_at":"2026-08-08T20:05:16.038213Z","title":"Be yourself: Bounded attention for multi-subject text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.038213Z"},"links":{"cited_paper":"/paper/2403.16990","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:f7496fbe08d9d4e563c3aaba9c54786a60af9e40c7899073a40f92188677b47d","observation_id":"c81b1664-3105-45b1-a436-1affe30cc0f3","resolution":{"observed_at":"2026-08-08T20:05:16.038213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-08T20:05:16.042916Z","title":"Dreamllm: Synergistic multimodal com- prehension and creation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.042916Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:6a705501573123793b59f829eafd732318ff0e15639de245695d04b790d072bb","observation_id":"1d1a345a-e7fb-47e4-a468-6d2ca1e9b7ac","resolution":{"observed_at":"2026-08-08T20:05:16.042916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-08T20:05:16.047459Z","title":"Palm- e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.047459Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:b9a7bff752ac93a3df650986cfc8466479472ab6c32099d6c4d48bda062a2b66","observation_id":"dd0abeb5-e9a7-4178-94c4-1f5c602025b3","resolution":{"observed_at":"2026-08-08T20:05:16.047459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:17.082377Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"ea7b1ff5-17e0-4f99-b0fe-7f41601c9720","year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.051903Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:c8d8d020a9887005cc758f8dea23638745a29f7e85f5798a5fd390ccdfb62a6b","observation_id":"837e58cb-59c3-4b1b-889b-a222bf3bd5a2","resolution":{"observed_at":"2026-08-08T20:05:17.087545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-08T20:05:16.056096Z","title":"An image is worth one word: Personalizing text-to- image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.056096Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:e0bb5a6cc74d30792813f4f3f9aeabab4515a9ee5f882aa42c95d5b7c44e6da2","observation_id":"341e031a-cf5f-497a-9792-6bcec4aacf70","resolution":{"observed_at":"2026-08-08T20:05:16.056096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-08T20:05:16.060539Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.060539Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:f02c324dd9caf969bc741bd607e9a1c4799c0ce7836df323639386c23fee43c4","observation_id":"2aa2c571-9ff0-4ef6-92f2-19c13569d0d1","resolution":{"observed_at":"2026-08-08T20:05:16.060539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:17.066465Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":"af132672-964a-4caf-9b60-ffed5f930d04","year":2021},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.064651Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:1411e3bbce4a637f581dc715a2dd5772b175537aeed19c732956e5e6cf9fa494","observation_id":"27d371a3-5e0a-4a91-93c2-0ed07b72e59f","resolution":{"observed_at":"2026-08-08T20:05:17.071654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02642","last_updated":"2023-04-05T17:59:32Z","snapshot_observed_at":"2026-08-09T08:32:51.929847Z","submitted_at":"2023-04-05T17:59:32Z","title":"Taming Encoder for Zero Fine-tuning Image Customization with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02642","snapshot_observed_at":"2026-08-08T20:05:16.068679Z","title":"Taming encoder for zero fine-tuning image customization with text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.068679Z"},"links":{"cited_paper":"/paper/2304.02642","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:0db4bcbea216be7aaacf27a289d3f9b23fce1e97f06aa8613871af4db6e3ada8","observation_id":"05e0f83e-8f4a-4001-8fd9-3a8c887f304c","resolution":{"observed_at":"2026-08-08T20:05:16.068679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:17.051148Z","title":"Rendering synthetic objects into legacy photographs","venue":null,"work_id":"aa3b41d9-b257-40eb-b0da-3c55372c0a53","year":2011},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.073123Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:b38df49db1f3c1a1a8cb30398b80227a9d617454c9fcfd33a3ed9ea3972a95ed","observation_id":"5c2e602d-e6af-4798-b16f-8c8a4187f114","resolution":{"observed_at":"2026-08-08T20:05:17.055767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:17.036022Z","title":"3d object manipulation in a single photograph using stock 3d models","venue":null,"work_id":"1918ef44-7cf3-4523-b16c-e306a64a36e4","year":2014},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.077249Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:a088c142d5512cde983959dce91325934028fc0580c827e278db7af87c5ae259","observation_id":"a365751e-6298-45bf-abae-01df37cb318c","resolution":{"observed_at":"2026-08-08T20:05:17.040988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.081647Z","title":"Gen- erating images with multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.081647Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:104270cf9bbd79b3af8fa5b0f85b97a72f8092789bfe53795e780fefe3c43500","observation_id":"fc442340-45ae-4eaf-aa15-629daae51b1b","resolution":{"observed_at":"2026-08-08T20:05:16.081647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:17.011024Z","title":"Open images v5 text annotation and yet another mask text spotter","venue":null,"work_id":"01092645-319c-469a-aa28-a2988b04672a","year":2021},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.086200Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:82b7017a1fbfeb6ab6f8aebb51f0ee4e762dc1634b2477c151944087102baaf5","observation_id":"67e4255b-c2fd-400f-a0da-e82010b9a3b4","resolution":{"observed_at":"2026-08-08T20:05:17.016080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.995523Z","title":"Putting people in their place: Affordance-aware hu- man insertion into scenes","venue":null,"work_id":"c6a6ba82-4a0a-4c14-a6b3-6b241d763a23","year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.090712Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:cd3b5d8871685abf098d27ac380bed1b3cd126da9d3bed76beee41a15661e27e","observation_id":"bb5a39c4-c7a1-4822-925e-b6c12b0d0de9","resolution":{"observed_at":"2026-08-08T20:05:17.000101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.980321Z","title":"Photo clip art","venue":null,"work_id":"2dfd71ee-f5ac-4f74-affb-c92645714def","year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.095184Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:cfb1018ad20afa6a644aba38ae79e3a9943e9671b42d29dbb11234cb9ed14279","observation_id":"5c546ea4-3ffb-4918-a06e-95704f0b3072","resolution":{"observed_at":"2026-08-08T20:05:16.984562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.965558Z","title":"Blip-diffusion: Pre- trained subject representation for controllable text-to-image generation and editing","venue":null,"work_id":"757213d3-5919-40bc-85d6-4a3d8677a6eb","year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.099723Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:d442a4a3cd6b80cddb219ecefe49f8a0349a9561d7626232d9b6244ec51d9b74","observation_id":"fb1d63c8-216a-4531-bc3c-b1b7af3a797f","resolution":{"observed_at":"2026-08-08T20:05:16.970266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13388","last_updated":"2024-06-06T13:25:09Z","snapshot_observed_at":"2026-07-06T17:19:52.125879Z","submitted_at":"2024-01-24T11:36:44Z","title":"UNIMO-G: Unified Image Generation through Multimodal Conditional Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13388","snapshot_observed_at":"2026-08-08T20:05:16.103942Z","title":"Unimo- g: Unified image generation through multimodal conditional diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.103942Z"},"links":{"cited_paper":"/paper/2401.13388","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:3634432df16cbc3cdd386f2c5bbb50b60ea7c38df848e8102a85e4ca0998cf6a","observation_id":"ba07cc92-e700-4c65-b17c-d117e8ad268a","resolution":{"observed_at":"2026-08-08T20:05:16.103942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.950845Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"564e18f2-02e4-4470-a20e-48b86f364c00","year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.108408Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:e60e21ee238e9ff4ea23696f37a26423348654077a3dd453f91154cdd9ab0e33","observation_id":"44f52a1d-a541-41f1-b616-4545299ffd2e","resolution":{"observed_at":"2026-08-08T20:05:16.955457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-08T20:05:16.112663Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.112663Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:c048064eb670b25dae9482bd6504ab00a286ca5d22833a3486867b314e6fd406","observation_id":"27ca87c1-5ba6-48a3-a799-d75cc0711370","resolution":{"observed_at":"2026-08-08T20:05:16.112663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.936295Z","title":"Tf-icon: Diffusion-based training-free cross-domain image composi- tion","venue":null,"work_id":"89ee31db-300b-4f32-888d-dcb10885807e","year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.117452Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:c13a4d1e681fc23b2d21a0eb034fc22600606e34625b1bc1acadce578c152f16","observation_id":"304baa49-21d6-44ff-9d49-97752c29c1cd","resolution":{"observed_at":"2026-08-08T20:05:16.940940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-08T20:05:16.121656Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.121656Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:fdae7f225d30f5e816b90c73d63fcfa077f62813958c857ddbe5e511c00dbd35","observation_id":"55d4a265-1e4a-4841-a59c-7c2027df956a","resolution":{"observed_at":"2026-08-08T20:05:16.121656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-08T20:05:16.125929Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.125929Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:8ec37991bc38fd7960c6f88345e055f7bb79112dabaf4f72d7482b64933e0f6f","observation_id":"7ee35b5d-4d11-4b72-8216-e62c5eb15e9c","resolution":{"observed_at":"2026-08-08T20:05:16.125929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.920230Z","title":"https://pixabay.com/, 2024","venue":null,"work_id":"42e13cc7-700a-4d08-a34b-a6f8edf295f5","year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.130241Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:00a88440401543baf99f20acf584d95467de7f3ba5be234ae56ff2bda1d2e8ae","observation_id":"05aa7bc1-d977-40cc-874c-3723d47fdd57","resolution":{"observed_at":"2026-08-08T20:05:16.925460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-08T20:05:16.134464Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.134464Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:c13697db7b70b367ff22e10407002eecf2701985c8a059cf90b1c3a13c67e7e6","observation_id":"2f083b3d-2002-4b00-b2e3-be4473e9468f","resolution":{"observed_at":"2026-08-08T20:05:16.134464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05776","last_updated":"2023-04-02T22:01:17Z","snapshot_observed_at":"2026-07-31T08:06:57.921225Z","submitted_at":"2022-11-10T18:58:22Z","title":"High-Quality Entity Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05776","snapshot_observed_at":"2026-08-08T20:05:16.138710Z","title":"Fine-grained entity segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.138710Z"},"links":{"cited_paper":"/paper/2211.05776","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:0fe1d8e5c1760697b25c7644dec0007448ec0cc144a6be3d3012221554a6de43","observation_id":"04b7e7bd-be0f-4737-a9bc-320e07c1cee5","resolution":{"observed_at":"2026-08-08T20:05:16.138710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.143110Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.143110Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:dd5dac4783ec2a0d2093f5670d936ac3ca52ddf2f5816c8f82c26a1b989ee0b9","observation_id":"ddc5b5da-451c-4048-8daa-bb80f0dc28b5","resolution":{"observed_at":"2026-08-08T20:05:16.143110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.147319Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.147319Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:64738e0fb4e85c67966400efe9d786cca0774b3d5385dbdb37598653b423a974","observation_id":"fbf8423c-7629-4a99-b439-08159bd32e96","resolution":{"observed_at":"2026-08-08T20:05:16.147319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.882812Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"6ed1957a-bb6b-437e-a41a-a231040979cb","year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.151779Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:4723a49d69b0a28589b17ea64cc66d454465e57b5709850923433da989a787b9","observation_id":"bf7d524c-438c-4870-87c3-c5bf63b1fdfb","resolution":{"observed_at":"2026-08-08T20:05:16.888041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13795","last_updated":"2024-01-24T20:25:48Z","snapshot_observed_at":"2026-07-06T17:20:07.930031Z","submitted_at":"2024-01-24T20:25:48Z","title":"Diffuse to Choose: Enriching Image Conditioned Inpainting in Latent Diffusion Models for Virtual Try-All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13795","snapshot_observed_at":"2026-08-08T20:05:16.156007Z","title":"Diffuse to choose: Enriching image conditioned inpainting in latent diffusion models for virtual try-all","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.156007Z"},"links":{"cited_paper":"/paper/2401.13795","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:1d64bb43b2ab55a879197734644d9aef7bb9645bc23b4c049b850c008d40d24e","observation_id":"d800c370-6ce3-41b4-8b68-a767ed7aaa08","resolution":{"observed_at":"2026-08-08T20:05:16.156007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.865993Z","title":"Video visual relation detection","venue":null,"work_id":"d5e38bac-371a-49a6-a292-17682d5895a5","year":2017},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.160475Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:af173884d607a6c398555b2793bdc7669b81f6375c61abe749d3ac79309296b9","observation_id":"355e135b-1342-4b10-aede-3384f133622d","resolution":{"observed_at":"2026-08-08T20:05:16.871595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.850979Z","title":"Annotating objects and relations in user- generated videos","venue":null,"work_id":"3aadb238-ade2-41cb-9496-dc18a919f349","year":2019},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.164892Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:ee82599ca26b2c6f95da3943a16e419a3b29245239c02cd2f6099fc29b12ad4a","observation_id":"28cf2d92-51e0-480e-8eff-dd3d8276fdd4","resolution":{"observed_at":"2026-08-08T20:05:16.856146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03411","last_updated":"2023-04-06T23:26:38Z","snapshot_observed_at":"2026-08-06T20:00:57.668299Z","submitted_at":"2023-04-06T23:26:38Z","title":"InstantBooth: Personalized Text-to-Image Generation without Test-Time Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03411","snapshot_observed_at":"2026-08-08T20:05:16.169140Z","title":"Instant- booth: Personalized text-to-image generation without test- time finetuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.169140Z"},"links":{"cited_paper":"/paper/2304.03411","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:e96ae021d932bdad2c5c1f14b3fcce605062036a5f0dc9fb3eaf14cb57d0df02","observation_id":"3304e5c2-fee3-44c9-bbde-0da93e303fdb","resolution":{"observed_at":"2026-08-08T20:05:16.169140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00932","last_updated":"2022-12-05T05:11:31Z","snapshot_observed_at":"2026-08-09T11:52:06.969111Z","submitted_at":"2022-12-02T02:15:13Z","title":"ObjectStitch: Generative Object Compositing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00932","snapshot_observed_at":"2026-08-08T20:05:16.173596Z","title":"Ob- jectstitch: Generative object compositing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.173596Z"},"links":{"cited_paper":"/paper/2212.00932","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:85a43d2289bc1f918f69e2f04b7cfae8b125602ee9d92faa273ae0ce202fb84b","observation_id":"69b55bb5-e0e3-454d-85c4-d8487227bf77","resolution":{"observed_at":"2026-08-08T20:05:16.173596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.835591Z","title":"Imprint: Generative object compositing by learning identity-preserving representation","venue":null,"work_id":"52176c31-3183-4630-ac97-ebd72b0ae424","year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.177752Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:d337984c90a6f066072433a1a7ec5fc197c7b4adde8be3529e04078c94668942","observation_id":"607a3426-bca4-4f7d-ad04-7fcc67d41958","resolution":{"observed_at":"2026-08-08T20:05:16.840319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-08T20:05:16.182015Z","title":"Generative pretraining in multi- modality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.182015Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:c43f8829b347dd9634b13d106cee582c6fc96277c650ba3cf5c4a6bffd116527","observation_id":"483e5ba2-0012-4a11-8aa4-8364c98eb43b","resolution":{"observed_at":"2026-08-08T20:05:16.182015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.820666Z","title":"Generative multimodal mod- els are in-context learners","venue":null,"work_id":"9a8c0ce6-0783-4bdf-86d4-1973cd7c81bb","year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.186695Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:be99545dbf4c732ec184d4c7715afabc3a390e40fe05c32dd6309c259eb6b8f9","observation_id":"d5d21661-b75f-462b-bbde-c39f0e36d0be","resolution":{"observed_at":"2026-08-08T20:05:16.825417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04559","last_updated":"2024-09-11T11:05:56Z","snapshot_observed_at":"2026-07-30T16:35:31.547244Z","submitted_at":"2024-09-06T18:42:30Z","title":"Thinking Outside the BBox: Unconstrained Generative Object Compositing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04559","snapshot_observed_at":"2026-08-08T20:05:16.190538Z","title":"Thinking outside the bbox: Un- constrained generative object compositing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.190538Z"},"links":{"cited_paper":"/paper/2409.04559","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:173e854fb6df9a4c1ed21c1329b8476210a389e80cae920faeb1e3c5adaa58ae","observation_id":"58db0e90-c271-4b15-aec1-08024664cc3f","resolution":{"observed_at":"2026-08-08T20:05:16.190538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-08T20:05:16.194518Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.194518Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:b894c4523a1b514e884ea35fbd346d60140d32dcc4c8313a7fa0a8c40feb05fa","observation_id":"762dcc6a-bb1d-4db7-9f9b-e93c91d3ba83","resolution":{"observed_at":"2026-08-08T20:05:16.194518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.198714Z","title":"Elite: Encoding visual con- cepts into textual embeddings for customized text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.198714Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:ffa79d45a706c33b051bd0faa63f2ab1423105797d0a8951d7affb861fd2eeb2","observation_id":"c1e141ef-52ce-4b42-be37-33b9a6a7d42b","resolution":{"observed_at":"2026-08-08T20:05:16.198714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.795109Z","title":"Fastcomposer: Tuning-free multi- subject image generation with localized attention","venue":null,"work_id":"68296bf4-519a-4ec0-aa06-a26f38371c97","year":2024},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.202729Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:6a39a173edd9ce4e690d94b8a5d8d8dda2e87d6706f5145f14c9f1772c80a587","observation_id":"dbae3f95-8114-431e-bcab-e2b2cf83b116","resolution":{"observed_at":"2026-08-08T20:05:16.799738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08520","last_updated":"2025-03-16T04:31:33Z","snapshot_observed_at":"2026-08-09T13:30:27.380022Z","submitted_at":"2024-09-13T03:40:58Z","title":"GroundingBooth: Grounding Text-to-Image Customization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08520","snapshot_observed_at":"2026-08-08T20:05:16.206770Z","title":"Groundingbooth: Grounding text- to-image customization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.206770Z"},"links":{"cited_paper":"/paper/2409.08520","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:fc001f7c3c8e48e6cceadd032ad5aad01527dadd8a9b55b86fd7286c9a782c60","observation_id":"2f9f0806-d127-4b70-bb66-5b3301e8a885","resolution":{"observed_at":"2026-08-08T20:05:16.206770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.211720Z","title":"Paint by example: Exemplar-based image editing with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.211720Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:8a4ce97ee8cd7906066c47fbcc5962af7c6b9de7ab352746441468d9f6ed5cfe","observation_id":"b051d4b7-f7c2-40d4-9b8d-aab3aaf5e34e","resolution":{"observed_at":"2026-08-08T20:05:16.211720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19784","last_updated":"2023-12-07T15:22:07Z","snapshot_observed_at":"2026-07-06T16:40:39.567420Z","submitted_at":"2023-10-30T17:50:14Z","title":"CustomNet: Zero-shot Object Customization with Variable-Viewpoints in Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19784","snapshot_observed_at":"2026-08-08T20:05:16.216485Z","title":"Customnet: Zero-shot object customization with variable-viewpoints in text-to-image dif- fusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.216485Z"},"links":{"cited_paper":"/paper/2310.19784","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:4ca258d41831c09fcbc01bacb21ba082f89857b0c128253102e0b89ea2164438","observation_id":"f61748aa-6e5d-4c4e-b0bb-5bedaee888c9","resolution":{"observed_at":"2026-08-08T20:05:16.216485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10040","last_updated":"2023-08-19T14:56:44Z","snapshot_observed_at":"2026-07-06T16:08:00.845026Z","submitted_at":"2023-08-19T14:56:44Z","title":"ControlCom: Controllable Image Composition using Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10040","snapshot_observed_at":"2026-08-08T20:05:16.220898Z","title":"Controlcom: Controllable image composition using diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.220898Z"},"links":{"cited_paper":"/paper/2308.10040","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:e4479e63fabdad19d383585837c3a0596536a3ba615a176929136e53c4fa23b6","observation_id":"f381e241-b1f2-44ae-bfa9-92faa49e1e97","resolution":{"observed_at":"2026-08-08T20:05:16.220898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12342","last_updated":"2024-03-26T04:17:42Z","snapshot_observed_at":"2026-08-03T21:45:04.167541Z","submitted_at":"2023-11-21T04:28:12Z","title":"LoCo: Locally Constrained Training-Free Layout-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12342","snapshot_observed_at":"2026-08-08T20:05:16.225176Z","title":"Loco: Locally constrained training-free layout-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.225176Z"},"links":{"cited_paper":"/paper/2311.12342","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:74c5a69f762fb2bf9de55594df7084b4c20ec130475061c2a783042183c33418","observation_id":"caa0283f-05fd-4101-ad25-87b5b5c818df","resolution":{"observed_at":"2026-08-08T20:05:16.225176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.769497Z","title":"Can you provide a grammatically correct one-line caption for the relation <object A> <relation> <object B> in the image?","venue":null,"work_id":"1c28b558-8286-4d4e-a1a7-f89e298e660a","year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.229501Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:931addbe536f42b6734b485a55c2feb93bf537abc7c3d118bcebb79d75e2d6a2","observation_id":"1a560b2d-248f-499f-a8f0-9d9bf0d2d100","resolution":{"observed_at":"2026-08-08T20:05:16.774028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.753149Z","title":"Figure 4","venue":null,"work_id":"3ffa19d9-9924-4995-82f3-af1d3edbc999","year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.234124Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:9eb3fc44c72fc5764f66920a5d9594028a1fd2bb189d187a3b36a66256c0f229","observation_id":"8a454c94-da25-417d-9c2f-aa9ef7a0911a","resolution":{"observed_at":"2026-08-08T20:05:16.758388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.736345Z","title":"used to extract them","venue":null,"work_id":"34a4a191-b71e-43a9-b46f-7d8c90494302","year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.238462Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:dd1240b2dfe2e4909c89bebde98e88f70046e1797d1bc1f0231a75d5634cd16c","observation_id":"6594bd52-d1fc-4891-8733-bd6287635ded","resolution":{"observed_at":"2026-08-08T20:05:16.740942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.720894Z","title":"Background images are sourced from Pixabay [29], while objects are from Pixabay [29], MultiBench [23], and DreamBooth [34]","venue":null,"work_id":"2932fc10-ee84-4ce4-a941-cd883477bcc5","year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.242546Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:5b292c0a7d29d356042c6aed62cf196a3c62454d447d2d726791c915da15427d","observation_id":"e4a496a8-e693-4bfe-919b-41542389de35","resolution":{"observed_at":"2026-08-08T20:05:16.725567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.706158Z","title":"Further details on user studies can be found in Section 3.3","venue":null,"work_id":"09e35218-6093-41eb-9637-fe5334e60cec","year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.246690Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:32e6952ecc6c3bde19186be9e506c7af7e8ad73ec80b1d3a1b1d5da485399df0","observation_id":"6a58adb2-d0ad-42c8-ad3e-6fb483ece5b6","resolution":{"observed_at":"2026-08-08T20:05:16.710737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.688795Z","title":"Without multi-view data ( i.e., video data, manually collected data), the model struggles to prop- erly repose and combine objects to align with the textual description","venue":null,"work_id":"2422bdb9-f382-430f-ac28-90a2305f6fcb","year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.251155Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:23826c8deb4045eed7f8a483409e5cbdb4e03cdd7a6acb81edeb37d0903f7598","observation_id":"8cbbc66a-c750-4349-91f2-6ecbaa65528c","resolution":{"observed_at":"2026-08-08T20:05:16.694958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:05:16.671798Z","title":null,"venue":null,"work_id":"6f288714-7f81-4d9d-ae4d-f311b7078237","year":null},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.256044Z"},"links":{"citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:9549a7c1f7ad52ebb5367b2c288902942252135a9c88a13a9144e09f6cc2682e","observation_id":"6d49043d-648e-4ee1-a8ae-04f25ddf9c8c","resolution":{"observed_at":"2026-08-08T20:05:16.677728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2502.05165."}