{"as_of":"2026-08-18T11:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe668056daa6a3d965ff7f31bf1ef6d46d97fd00182c0cb548d8d2922152f28b","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:32:37.842627Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.01104/citation-record","integrity":"/paper/2505.01104/integrity","json":"/paper/2505.01104/citation-record.json","paper":"/paper/2505.01104"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.237337Z","title":"A-star: Test-time attention segregation and retention for text- to-image synthesis","venue":null,"work_id":"dce266bb-bbfe-4e5f-9f8e-078683ae14d0","year":null},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.706662Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:8a0bf7fa6eb31fe993c5d37a8a327807ebabf6d2db313c464708d68a70ce7bbc","observation_id":"8940cc4c-a0d3-4fdb-b82b-557647e0941a","resolution":{"observed_at":"2026-08-16T04:32:38.241280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.225258Z","title":"Spatext: Spatio-textual representation for con- trollable image generation","venue":null,"work_id":"de4e5ae3-595a-41a9-9d7f-1215ee7a2619","year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.711004Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:eefab98041e51e1982f4e7d98ae6f4a60ea40108fd002dc4805b3066f8ebc815","observation_id":"40f90421-1480-41d0-9504-1c7d6e5060ac","resolution":{"observed_at":"2026-08-16T04:32:38.229245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00238","last_updated":"2025-04-16T21:59:00Z","snapshot_observed_at":"2026-08-16T13:03:57.804900Z","submitted_at":"2024-10-31T22:24:47Z","title":"Understanding the Limits of Vision Language Models Through the Lens of the Binding Problem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00238","snapshot_observed_at":"2026-08-16T04:32:37.714812Z","title":"Understanding the limits of vision language mod- els through the lens of the binding problem","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.714812Z"},"links":{"cited_paper":"/paper/2411.00238","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:48d8a28c3a5f577744be78c9b1132c2e2e60ec361791408c6111c4723693e982","observation_id":"e0b7dfa2-60d5-4e53-a0ce-66d4141327e5","resolution":{"observed_at":"2026-08-16T04:32:37.714812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.214147Z","title":"Attend-and-excite: Attention-based semantic guid- ance for text-to-image diffusion models","venue":null,"work_id":"c7de665c-5acc-4c6e-994c-a976cb7bb0e0","year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.719179Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:87348f93084f888bc0214c37c4ab8961148179f7606736e9c2866d4e8e3d5cf1","observation_id":"d832ea00-2b9a-40b3-bde5-3b59a0b73948","resolution":{"observed_at":"2026-08-16T04:32:38.218008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.203129Z","title":"Schwing, Alexan- der Kirillov, and Rohit Girdhar","venue":null,"work_id":"a8882a8b-8afa-4e8f-8a47-fbfdb368fb30","year":2022},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.722873Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:3910fcc42ffeeb9b6e4bb6cadc69cc6bd8091e67de378453812e6acc59ce0d23","observation_id":"e8d53753-aff8-4545-a0f2-ca88086d14b7","resolution":{"observed_at":"2026-08-16T04:32:38.207142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.191700Z","title":"Aspects of the Theory of Syntax","venue":null,"work_id":"83d50ca6-5ca2-454c-954a-7e1c6e846824","year":2014},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.726658Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:74ad52dc1d080d94836bd79cf4a6f07eefc3c481afac6632d743640cb02cb5ac","observation_id":"483d8d9b-178f-4a4d-91b9-4447ffee0951","resolution":{"observed_at":"2026-08-16T04:32:38.195479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16990","last_updated":"2024-03-25T17:52:07Z","snapshot_observed_at":"2026-08-18T09:12:30.383828Z","submitted_at":"2024-03-25T17:52:07Z","title":"Be Yourself: Bounded Attention for Multi-Subject Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16990","snapshot_observed_at":"2026-08-16T04:32:37.730423Z","title":"Be yourself: Bounded attention for multi-subject text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.730423Z"},"links":{"cited_paper":"/paper/2403.16990","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:82575463751b22cd79f1ee0944ec520613814dd151187cfb27de86928e2f0a47","observation_id":"c9bb5b28-0d28-45dc-97ee-b863c4ba3028","resolution":{"observed_at":"2026-08-16T04:32:37.730423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.179845Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":"c7c5a3fa-89d8-4750-8f38-ecdc6cb42761","year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.734752Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:58df6ef6cd99c44c1e4c1f647d8e93e03a2545817b3d827b03d4d75f6202857e","observation_id":"78d82129-7784-4850-8598-c8833d7669c2","resolution":{"observed_at":"2026-08-16T04:32:38.183999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-16T16:09:43.175330Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-16T04:32:37.738628Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.738628Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:67b40b20ebbf2d570d9c50f111a9012c4da4fd373adf7bd32513b4ae2b10669c","observation_id":"ce26b3e5-917a-49be-9563-a3ed55ade6c9","resolution":{"observed_at":"2026-08-16T04:32:37.738628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.742553Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.742553Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:ace2323e19521da2f7305b193a845e1e1e7d0cf9bea214df5113fe1af1b71f9c","observation_id":"fb3419f3-042e-46b5-88bb-7ed76213febd","resolution":{"observed_at":"2026-08-16T04:32:37.742553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-16T04:32:37.746049Z","title":"An image is worth one word: Personalizing text-to-image genera- tion using textual inversion.arXiv preprint arXiv:2208.01618,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.746049Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:9fbb21d7a28cfcbaccb65e15eca2c08c61474f2c99fdc652142550b29fdcba17","observation_id":"2217b315-d14f-4d4e-9673-840da372ba0e","resolution":{"observed_at":"2026-08-16T04:32:37.746049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.160491Z","title":"Encoder-based domain tuning for fast personalization of text-to-image models","venue":null,"work_id":"27121cee-94da-4bec-ada5-54636def020f","year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.750541Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:cb3b40078b88de2f9e45a1519552e5fde490a6b9c61f032af57592a1c15ed256","observation_id":"e15fdd26-5ed9-4661-bea6-fd7ccb957a32","resolution":{"observed_at":"2026-08-16T04:32:38.164486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.754114Z","title":"T2i-compbench: A comprehensive benchmark for open- world compositional text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.754114Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:d488a9a82beb8260a73337fe0ae067e7d4957b4c3cb439fa1dd674f056bb232c","observation_id":"0a187407-5d32-4ea9-af7e-70fbac53d3d0","resolution":{"observed_at":"2026-08-16T04:32:37.754114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.142006Z","title":"Openclip, 2021","venue":null,"work_id":"fd081331-bfe9-4cbe-8692-93a7221a6da6","year":2021},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.758118Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:d54605addf2bcbfdc7137b62632993d8434ddc14fc087e54be5e88f16b72e6dc","observation_id":"9fdf6f7e-e5d1-4629-a575-6631904d0fbc","resolution":{"observed_at":"2026-08-16T04:32:38.145998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01000","last_updated":"2023-03-02T06:33:33Z","snapshot_observed_at":"2026-08-16T15:51:30.138353Z","submitted_at":"2023-03-02T06:33:33Z","title":"X&Fuse: Fusing Visual Information in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2303.01000","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.01000","snapshot_observed_at":"2026-08-16T04:32:37.917871Z","title":"X&Fuse: Fusing Visual Information in Text-to-Image Generation","venue":"cs.CV","work_id":"b479316e-7d82-4cb3-b5c6-c9f6286e4cc2","year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.762395Z"},"links":{"cited_paper":"/paper/2303.01000","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:91c6907f3d43d961f848c35c687604be50015b2e053e7558f08cde9cb82311a6","observation_id":"fc05b7c0-5f3c-47e6-a232-3c9c525e0c48","resolution":{"observed_at":"2026-08-16T04:32:37.924264Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.766454Z","title":"Multi-concept customization of text- to-image diffusion","venue":null,"work_id":null,"year":1931},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.766454Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:f9546c9d149d2bf7b980c82155e818c8e41974ffb9aab29bd4c532c9ba0a276b","observation_id":"475967bc-e754-42a9-b8cb-ec6b382ef0a8","resolution":{"observed_at":"2026-08-16T04:32:37.766454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10537","last_updated":"2024-08-30T04:51:28Z","snapshot_observed_at":"2026-08-16T16:07:11.903489Z","submitted_at":"2022-12-20T18:46:28Z","title":"Does CLIP Bind Concepts? Probing Compositionality in Large Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10537","snapshot_observed_at":"2026-08-16T04:32:37.770193Z","title":"Does clip bind concepts? probing compositionality in large image models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.770193Z"},"links":{"cited_paper":"/paper/2212.10537","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:37df095708773f440fc3ffc66f570e1973fd4516a1dce04302dfcebe588f2b77","observation_id":"27cc0c02-f10f-4d5c-9aac-99aecd694353","resolution":{"observed_at":"2026-08-16T04:32:37.770193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.123293Z","title":"Compositional visual generation with composable diffusion models","venue":null,"work_id":"3e282454-9101-4f35-b033-f11efa3effbb","year":2022},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.774118Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:d860da15f6cd3c83e374ae8d93bd4a61a23312897cebaf223eaaaa43a49bc66e","observation_id":"eba71ed0-9fec-446b-8835-8cfc7bbad605","resolution":{"observed_at":"2026-08-16T04:32:38.127426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.110892Z","title":"Conform: Contrast is all you need for high- fidelity text-to-image diffusion models","venue":null,"work_id":"a32e22c9-a1fa-4027-964a-f8f309b98d0c","year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.777873Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:f69b6581737f190dd4f66cdee99d7d15d5d29879272a71fc21813ed258a23be8","observation_id":"246ef3c6-f8aa-415c-95d5-4755765e9599","resolution":{"observed_at":"2026-08-16T04:32:38.115080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.781845Z","title":"Null-text inversion for editing real im- ages using guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.781845Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:200c60b74451b946469ebc4a8bb5b83982307df3e24edeb6043319614a6bdbc2","observation_id":"3effc674-5468-43ba-b74a-f63f11fe3166","resolution":{"observed_at":"2026-08-16T04:32:37.781845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08246","last_updated":"2024-05-14T00:22:06Z","snapshot_observed_at":"2026-08-16T13:52:58.724164Z","submitted_at":"2024-05-14T00:22:06Z","title":"Compositional Text-to-Image Generation with Dense Blob Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08246","snapshot_observed_at":"2026-08-16T04:32:37.785519Z","title":"Compositional text-to-image generation with dense blob representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.785519Z"},"links":{"cited_paper":"/paper/2405.08246","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:8d7994da7d7d89f6757007dad4483596582c9cdc19e882a95e84208425cfec87","observation_id":"bfdfa16b-5383-4db0-8855-825f07bbc94d","resolution":{"observed_at":"2026-08-16T04:32:37.785519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.089635Z","title":"Compositional abilities emerge multiplicatively: Ex- ploring diffusion models on a synthetic task","venue":null,"work_id":"9be15e22-29be-49f8-8f6a-e4bf95215939","year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.789348Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:5362cedd103d78dc5a26ea44fa2af52aabe4ba6e4c6f5c64870f74a69bf5aca8","observation_id":"593e2bfe-744e-49ab-b89f-0c891c861d1c","resolution":{"observed_at":"2026-08-16T04:32:38.095525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.792906Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.792906Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:1f4de671cb1f18c2dbc285ff14740e640efb74f59ea866924f7a4179bfbc1987","observation_id":"60bc3daf-34c9-453c-99e6-2b33424ecf8a","resolution":{"observed_at":"2026-08-16T04:32:37.792906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.071182Z","title":"Linguistic binding in dif- fusion models: Enhancing attribute correspondence through attention map alignment","venue":null,"work_id":"90f18e1f-361b-4f21-8c37-0ed5ceed6307","year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.796732Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:cf855ef83161eed1710f594b9fbcbabaed7f8d06eb20bc5fbcc601fcc6b03c11","observation_id":"80927ef5-59b0-4991-8688-f531ccadf660","resolution":{"observed_at":"2026-08-16T04:32:38.074977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.060070Z","title":"High-resolution image 9 synthesis with latent diffusion models","venue":null,"work_id":"ac1ebb3d-4e36-41ac-90f1-c6f722d6e89d","year":2022},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.800192Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:746c02ad77b56d95036a2156c2df3c472b097cc1ba41fef462c60a05cd4b2cab","observation_id":"b666c1f3-c711-4fda-aaa9-29d28451b183","resolution":{"observed_at":"2026-08-16T04:32:38.063720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.803812Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven gen- eration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.803812Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:269224cebd4c736a7680c0989446cd95abf134c7bc957dbd9a9f16ef2b41b914","observation_id":"a3633a04-5f50-4a87-b22d-b3a43a6cff16","resolution":{"observed_at":"2026-08-16T04:32:37.803812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.042745Z","title":"Collage diffusion","venue":null,"work_id":"3aaf96e2-1a7e-4d03-b9dd-171d5f1d0bd2","year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.807535Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:b699c99292f41ae037c2dae0da2794ee27a7e7ed0ffca94bd738028111668d38","observation_id":"2180b882-8dc7-4b3e-8605-5a8c3baf1bd8","resolution":{"observed_at":"2026-08-16T04:32:38.046303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.811840Z","title":"In- stantbooth: Personalized text-to-image generation without test-time finetuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.811840Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:47f0fa0d0c21e2a08c07f1b62c191e972ad78a7015562ccad977b3231aa3d534","observation_id":"9673ca5c-6ba6-4a31-9fc1-0a6269c44097","resolution":{"observed_at":"2026-08-16T04:32:37.811840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05846","last_updated":"2024-10-21T09:38:03Z","snapshot_observed_at":"2026-08-17T01:47:42.984618Z","submitted_at":"2024-03-09T09:11:49Z","title":"Diffusion Lens: Interpreting Text Encoders in Text-to-Image Pipelines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05846","snapshot_observed_at":"2026-08-16T04:32:37.815468Z","title":"Diffusion lens: Interpreting text encoders in text-to-image pipelines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.815468Z"},"links":{"cited_paper":"/paper/2403.05846","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:561d532f2224212776273977918fc72070812ea0493b9b7a4a4cc80e6b037504","observation_id":"25ae24a8-e593-4180-a8e5-ab39b7a7fa8c","resolution":{"observed_at":"2026-08-16T04:32:37.815468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.819233Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.819233Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:c98190ac19cdcd36d29170be48bf108c08beecea5c8ef3c2eb7ff20e49b94b3f","observation_id":"44ce8b81-3659-4245-bbe4-75c113bf497e","resolution":{"observed_at":"2026-08-16T04:32:37.819233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.017913Z","title":"A feature-integration theory of attention","venue":null,"work_id":"5c27cda9-1265-4d46-b019-d5c21bf134a2","year":null},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.822804Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:79f6a632d6a5539d8794e4e6b6f6d7cf1929638d5f7e64d7499dbc998c9fa057","observation_id":"8a9d1631-6d7b-4ee4-8f20-e7560056296a","resolution":{"observed_at":"2026-08-16T04:32:38.021965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:38.006027Z","title":"Compositional text-to-image synthesis with attention map control of diffusion models","venue":null,"work_id":"83ebd12f-2ee3-4958-a491-ccc12899a2ca","year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.826762Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:5f405e04480fa0e33abdd5334d6b5d5574999a8eda7980088190a5f730a32e40","observation_id":"a69a5f3f-ef06-47e8-84a7-f895f0dfb716","resolution":{"observed_at":"2026-08-16T04:32:38.010243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.993136Z","title":"Elite: Encoding visual concepts into textual embeddings for customized text-to-image generation","venue":null,"work_id":"e65acd80-4c02-433e-8ffa-51cec99c7dd0","year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.830414Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:bfa76d4565178ee4f2782f4f3974443fff0e908b23d661e9166cb6d0c4b79e14","observation_id":"3a6d0582-4e8f-4dc2-af51-7b889b5ccbcb","resolution":{"observed_at":"2026-08-16T04:32:37.997285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.834554Z","title":"Fastcomposer: Tuning-free multi- subject image generation with localized attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.834554Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:dc98817dbc674ed86efc8a06ac16617e57ea626c8411466d7a2f501a022e1592","observation_id":"77391611-dd56-4e12-8280-20fc649ef992","resolution":{"observed_at":"2026-08-16T04:32:37.834554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07844","last_updated":"2025-03-24T21:33:14Z","snapshot_observed_at":"2026-08-16T13:43:56.351260Z","submitted_at":"2024-06-12T03:21:34Z","title":"Improving Compositional Attribute Binding in Text-to-Image Generative Models via Enhanced Text Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07844","snapshot_observed_at":"2026-08-16T04:32:37.838448Z","title":"Understanding and mitigating compositional issues in text-to-image generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.838448Z"},"links":{"cited_paper":"/paper/2406.07844","citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:0f2e0d184f2a3ce8777545ab8b1cd0453d53999a694c1f2b0af64301cc6e9e9d","observation_id":"bd17cd23-2685-4f28-83f3-2800da2cfaaa","resolution":{"observed_at":"2026-08-16T04:32:37.838448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:32:37.974627Z","title":"Layoutdiffusion: Controllable diffusion model for layout-to-image generation","venue":null,"work_id":"24a98dd7-3aa8-4d1e-87ea-6fd19c4b7ec3","year":2023},"citing_paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:37.842627Z"},"links":{"citing_paper":"/paper/2505.01104"},"observation_digest":"sha256:008aaec8e6693f07c09f37bc37d960338338f5087ed6001903bc07be16050f15","observation_id":"dcafdac5-7e56-46c7-beb9-7d52ccc63e47","resolution":{"observed_at":"2026-08-16T04:32:37.978537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.01104","last_updated":"2025-05-02T08:31:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T04:24:21.477835Z","submitted_at":"2025-05-02T08:31:43Z","title":"VSC: Visual Search Compositional Text-to-Image Diffusion Model"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2505.01104."}