{"as_of":"2026-08-13T12:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d63f352022277950726a04f750915bae8b83a9f03d8c9eba997e685c557fceb8","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:08:54.669287Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:45:53.297589Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T15:58:37.263440Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15236","snapshot_observed_at":"2026-08-06T14:45:53.297589Z","title":"Text embed- ding is not all you need: Attention control for text-to-image semantic alignment with text self-attention maps.arXiv preprint arXiv:2411.15236, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17853","last_updated":"2026-06-21T15:14:16Z","snapshot_observed_at":"2026-08-07T20:37:21.945333Z","submitted_at":"2025-07-23T18:20:46Z","title":"Detail++: Training-Free Detail Enhancer for T2I Diffusion Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:53.297589Z"},"links":{"cited_paper":"/paper/2411.15236","citing_paper":"/paper/2507.17853"},"observation_digest":"sha256:cfdfc47c811e383eef66ff37812a12bc18ce27ebfbffcffd15371ff2a502564e","observation_id":"fdbcc39c-bc22-4799-9ead-0a82d02e5fc4","resolution":{"observed_at":"2026-08-06T14:45:53.297589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"cited_work":{"arxiv_id":"2411.15236","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15236","snapshot_observed_at":"2026-07-03T15:58:37.263440Z","title":"Text embedding is not all you need: Attention control for text-to-image semantic alignment with text self-attention maps.arXiv preprint arXiv:2411.15236, 2024","venue":null,"work_id":"ec1f285c-568b-43e6-abe5-83e1587735bd","year":2024},"citing_paper":{"arxiv_id":"2607.02220","last_updated":"2026-07-02T14:26:47Z","snapshot_observed_at":"2026-08-01T18:29:16.831004Z","submitted_at":"2026-07-02T14:26:47Z","title":"DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-03T15:56:38.037304Z"},"links":{"cited_paper":"/paper/2411.15236","citing_paper":"/paper/2607.02220"},"observation_digest":"sha256:0f6bf4182ecbe3bda03bb362add42f9436d44cd162ea5a69933fb79c25d1e0eb","observation_id":"46a62a12-f3ce-40f9-a558-0886d5c4ec17","resolution":{"observed_at":"2026-07-03T15:58:37.265067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15236/citation-record","integrity":"/paper/2411.15236/integrity","json":"/paper/2411.15236/citation-record.json","paper":"/paper/2411.15236"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:56.535602Z","title":"A-star: Test-time attention segregation and retention for text-to-image synthesis","venue":null,"work_id":"f4baae85-d734-41b8-a5f4-7d485832a873","year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.220813Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:ea05dba38c58c47fcb949439bfdc77a2ea33bfd1f0672d8a8ad6379f5d2ad39f","observation_id":"860654df-32b1-470a-a7be-77ce9b923569","resolution":{"observed_at":"2026-08-12T15:08:56.587696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18893","last_updated":"2024-06-28T03:22:33Z","snapshot_observed_at":"2026-08-13T06:20:31.813947Z","submitted_at":"2024-06-27T05:08:46Z","title":"AlignIT: Enhancing Prompt Alignment in Customization of Text-to-Image Models","version":2},"cited_work":{"arxiv_id":"2406.18893","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.18893","snapshot_observed_at":"2026-08-12T15:08:55.604066Z","title":"AlignIT: Enhancing Prompt Alignment in Customization of Text-to-Image Models","venue":"cs.CV","work_id":"b47e248f-bac3-4df5-85d3-b911c5e7d027","year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.416975Z"},"links":{"cited_paper":"/paper/2406.18893","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:25738e52d0cf6fd58a6dfb1bde84bfadf005bf34f599057aedcf6c9bad25fa92","observation_id":"00464a84-ec3f-481f-9cba-3fb45053ed2d","resolution":{"observed_at":"2026-08-12T15:08:55.655150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:56.496433Z","title":"Attend-and-excite: Attention-based se- mantic guidance for text-to-image diffusion models","venue":null,"work_id":"b9301711-6655-4f29-a9e4-c18bf630a240","year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.538102Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:2a6b52ef043937da81bae06dbb8fd3dc49910bf7336d6481c016f814deda657e","observation_id":"f3a26ef5-c45c-459a-a889-f967ed3a35fd","resolution":{"observed_at":"2026-08-12T15:08:56.510085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-12T15:08:53.586669Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.586669Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:d4fbd231bda520105078ada734f63160729173b7e39f4b4c3ab1a90ff70ccba9","observation_id":"86b56c1a-ed34-4e6f-a549-f9508e3e5072","resolution":{"observed_at":"2026-08-12T15:08:53.586669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-08-13T00:59:54.489440Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-12T15:08:53.596085Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.596085Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:20d422245db2fd8dcecd73f41aa15e7844fe252683aca04d3d5ae6b315ccea2d","observation_id":"c1746190-6bc2-4565-81e2-59ffb069b285","resolution":{"observed_at":"2026-08-12T15:08:53.596085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:56.415172Z","title":"Dall-eval: Probing the reasoning skills and social biases of text-to- image generation models","venue":null,"work_id":"245cb0b9-193f-41db-9c9d-ae5a3da5fd9f","year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.629726Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:f6056e8e4cca49d9fa88fd3844279655aa33ab2b92f8b68b4c52bea4ea297a0b","observation_id":"338f1936-24c5-4ed3-94a4-fa7ee20f7b0b","resolution":{"observed_at":"2026-08-12T15:08:56.459247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:53.675405Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.675405Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:0cf55500f5e1e88de8e49353d3398c8817aa42c977dd6aaee65172a3ba27a87a","observation_id":"a614f833-0c21-4618-8e76-d663731cda2e","resolution":{"observed_at":"2026-08-12T15:08:53.675405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-10T14:28:11.482404Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-12T15:08:53.683502Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.683502Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:9f34cefbd7c62e0b2861d08584db2dd9c03209c6628fb25f982e74ff47456695","observation_id":"38e3d833-4cdc-45bd-8fd6-117feeac26d1","resolution":{"observed_at":"2026-08-12T15:08:53.683502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10781","snapshot_observed_at":"2026-08-12T15:08:53.730797Z","title":"When attention sink emerges in language models: An empirical view","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.730797Z"},"links":{"cited_paper":"/paper/2410.10781","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:a2ae709c4ca7e32f8f00166a518e82240d2bb14ba7932106c29c6a35782e9f71","observation_id":"735bb36e-7c43-4f19-bb83-85f56785282f","resolution":{"observed_at":"2026-08-12T15:08:53.730797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-12T15:08:53.768421Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.768421Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:b4611d355c158511c741a1710a99eba7cd8664233afc111d468ac9628079ce11","observation_id":"9f994c93-3122-47c8-bd26-2ca7ec81dc13","resolution":{"observed_at":"2026-08-12T15:08:53.768421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:56.327690Z","title":"spacy 2: Natural lan- guage understanding with bloom embeddings, convolutional neural networks and incremental parsing","venue":null,"work_id":"0ea20c21-5c70-45ab-ae29-2b58ba8a5815","year":2017},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.783216Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:2deb4f499411a607addb9c7f0539b43e8eb82bf5fd6ee9d26db3aeb59c65495e","observation_id":"e0a854e5-19ca-4449-8159-8bf6b8d2fed6","resolution":{"observed_at":"2026-08-12T15:08:56.362672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-12T15:08:53.821243Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.821243Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:705c630dee190067d7af262a6c46a6b25ef934a1d21a9c3a4a7c5fade7670a87","observation_id":"ce474741-af47-465b-bc87-cbc72ca61bd7","resolution":{"observed_at":"2026-08-12T15:08:53.821243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:56.253929Z","title":"Tifa: Accu- rate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":"7642cbce-2a8c-476e-8d16-e0255c9cf882","year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.842397Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:7835c9494a951e0c997d1dd4ae25a69721646415eb1a5f9e4c9844d785729b68","observation_id":"7ffb49e3-94ef-49ad-a930-5195b5240431","resolution":{"observed_at":"2026-08-12T15:08:56.288975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05268","last_updated":"2024-11-30T11:55:19Z","snapshot_observed_at":"2026-08-13T00:35:14.954754Z","submitted_at":"2024-04-08T07:59:04Z","title":"MC$^2$: Multi-concept Guidance for Customized Multi-concept Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05268","snapshot_observed_at":"2026-08-12T15:08:53.854867Z","title":"Mc2: Multi-concept guidance for customized multi-concept generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.854867Z"},"links":{"cited_paper":"/paper/2404.05268","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:7f194d458fa3b9a83491001d897c9ea271caff7d9ecb29776f93d698791a492b","observation_id":"4139fcd9-6cf9-4359-9bca-762418452722","resolution":{"observed_at":"2026-08-12T15:08:53.854867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:53.879934Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.879934Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:870ae95d0645b1e8c667559d631a5d9720000a987194a239d3880333d5b042e9","observation_id":"166d9dcb-4ec2-453d-b425-f61bd04fea16","resolution":{"observed_at":"2026-08-12T15:08:53.879934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-12T15:08:53.954810Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.954810Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:49ee9fc8532ca5c307daa10d8c7bf077d96b423aee2af92aa031da15c644cc16","observation_id":"9be8d80a-c345-45a0-a1d6-eb7b3402a058","resolution":{"observed_at":"2026-08-12T15:08:53.954810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:53.982683Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.982683Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:4e3aea02380263b789dacd2b3bfd24db5e31ecd23eb68121d93b0c4c48e73f25","observation_id":"978e7c52-b3e2-417e-9378-8a35852e42b8","resolution":{"observed_at":"2026-08-12T15:08:53.982683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:53.993512Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.993512Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:feebbbc9f26941520c38d576880a2786d8eb7f67a95703498c1ed60f158ad468","observation_id":"cd0d00d4-ea19-4ec4-9c31-f439499692a8","resolution":{"observed_at":"2026-08-12T15:08:53.993512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17804","last_updated":"2024-03-26T15:42:01Z","snapshot_observed_at":"2026-08-13T00:44:36.119295Z","submitted_at":"2024-03-26T15:42:01Z","title":"Improving Text-to-Image Consistency via Automatic Prompt Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17804","snapshot_observed_at":"2026-08-12T15:08:54.008711Z","title":"Improving text- to-image consistency via automatic prompt optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.008711Z"},"links":{"cited_paper":"/paper/2403.17804","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:7e23896d5cbd9daccafe0d80fcbb17d6d41c5acdbf20c26ac12dc073e4200f16","observation_id":"37b1587b-5b1e-4954-a3ad-5feb3b425a7a","resolution":{"observed_at":"2026-08-12T15:08:54.008711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20972","last_updated":"2025-03-24T12:16:17Z","snapshot_observed_at":"2026-08-12T22:13:53.382996Z","submitted_at":"2024-10-28T12:43:48Z","title":"Attention Overlap Is Responsible for The Entity Missing Problem in Text-to-image Diffusion Models!","version":2},"cited_work":{"arxiv_id":"2410.20972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.20972","snapshot_observed_at":"2026-08-12T15:08:55.172958Z","title":"Attention Overlap Is Responsible for The Entity Missing Problem in Text-to-image Diffusion Models!","venue":"cs.CV","work_id":"76e40adb-04a0-46a2-8c46-32b846d8f8c0","year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.067179Z"},"links":{"cited_paper":"/paper/2410.20972","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:608820a31dfcb92039192f1e987289383e85008616ab5afe0d356afcca12127f","observation_id":"c62ebd91-f847-4e46-a36a-22593e22af9e","resolution":{"observed_at":"2026-08-12T15:08:55.214378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:56.064481Z","title":"Conform: Contrast is all you need for high- fidelity text-to-image diffusion models","venue":null,"work_id":"657d5524-fef2-4aed-a24d-467c96f13469","year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.125524Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:a6d182bec3764b5d58215716774543b48b927ddb4804ec8328fa15bb3dc28681","observation_id":"22456177-2924-4e5a-80e3-d21454ed916a","resolution":{"observed_at":"2026-08-12T15:08:56.127872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:55.970832Z","title":"Openai gpt-3 api [gpt-3.5-turbo], 2024","venue":null,"work_id":"b1dca9a9-a310-419b-bebf-7b54f40ac116","year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.138455Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:34b45e0e159fda9f59805844fb4df00f85f54878f1fb1da06acafe7034a66c9f","observation_id":"70120ce3-9e5c-4932-97f2-7d689dec5a89","resolution":{"observed_at":"2026-08-12T15:08:56.003417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-12T15:08:54.150477Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.150477Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:bf371cd565accc5a3f8bd2d9d5577f3e64a077e26ba9a35bd07b3fa567684353","observation_id":"1b51419f-9f9c-4f71-bb8d-f1216a926d55","resolution":{"observed_at":"2026-08-12T15:08:54.150477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14041","last_updated":"2024-07-27T14:22:56Z","snapshot_observed_at":"2026-08-12T23:18:58.374622Z","submitted_at":"2024-07-19T05:36:22Z","title":"Not All Noises Are Created Equally:Diffusion Noise Selection and Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14041","snapshot_observed_at":"2026-08-12T15:08:54.173401Z","title":"Not all noises are created equally: Diffusion noise selection and optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.173401Z"},"links":{"cited_paper":"/paper/2407.14041","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:5f2e6796a8269616c0ad4cf0c87faf1140dfa9cd9b08388ed27689e726f1538b","observation_id":"f7c116de-be8d-4031-88e7-7e733ee9434a","resolution":{"observed_at":"2026-08-12T15:08:54.173401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:54.188458Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.188458Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:98694bd81bf10938a97605fc2a2893b1b156c03907d0e164dd104a657302be0c","observation_id":"1ade333e-63e3-43c6-9714-1cd9299d83c7","resolution":{"observed_at":"2026-08-12T15:08:54.188458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:54.235980Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.235980Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:62598d68ff9bae7078bb9bd9f1b5289ae535875552e16261c0292836b9d8a3ad","observation_id":"d350a184-03ee-4255-a4d6-34504c349c54","resolution":{"observed_at":"2026-08-12T15:08:54.235980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-12T15:08:54.256485Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.256485Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:dadaa9c7b1e823adfaac3fb0d47f50cc2161c58207575b70f2c8ebefad68f00b","observation_id":"0b906bca-8342-4e94-a1ca-9173e430b137","resolution":{"observed_at":"2026-08-12T15:08:54.256485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:55.859059Z","title":"Linguistic bind- ing in diffusion models: Enhancing attribute correspondence through attention map alignment","venue":null,"work_id":"9da9eeb5-13bd-44b0-84bf-723e4456e11c","year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.270378Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:91f83d7bbd825d22371f0ce9b4d539cc5a1bba6ce1dd80800d18e8b1dd9adc51","observation_id":"11e5687e-4de8-4665-8bde-81fe11a06ab5","resolution":{"observed_at":"2026-08-12T15:08:55.870591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:54.331546Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.331546Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:de6d665555b245431d95289021f9d50100c73bca74b82aa419536987b278d7a7","observation_id":"b3976570-40f6-4017-8709-f07fdd194195","resolution":{"observed_at":"2026-08-12T15:08:54.331546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:55.781382Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"a10901d4-bb2c-4b08-b920-cd43f4acff2b","year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.376477Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:602b2346fe7f30d23a3cb7165afc937c4216267ebf38816faf1057348103b2fc","observation_id":"e67aa0c6-9e1a-4956-a64a-a3190cd26d30","resolution":{"observed_at":"2026-08-12T15:08:55.791771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:55.750268Z","title":"Rethinking the spatial inconsistency in classifier- free diffusion guidance","venue":null,"work_id":"44492ef6-f84c-4c2f-9150-2a6ca9a3bb87","year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.386550Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:c5c9eea9780336a3ebc8911530e2fe16a32271d77cad178e83960923c1fa3a0c","observation_id":"bfd31bc5-6cb1-49fd-be3d-344a8282fc4d","resolution":{"observed_at":"2026-08-12T15:08:55.762366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-12T15:08:54.393582Z","title":"Massive activations in large language models.arXiv preprint arXiv:2402.17762, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.393582Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:4848df33571ffb4b3e1a07e11a89457c27cf36406d2c2393300d7641d7140e1d","observation_id":"fd48f046-aa25-41ac-bf2b-ac475226fc33","resolution":{"observed_at":"2026-08-12T15:08:54.393582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:54.448164Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.448164Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:ffc92da856fa93819de401bd912ee349238bd810476602d9d8905c9550c31aec","observation_id":"f95914e2-e112-4fba-9254-4cc7a3ab33f7","resolution":{"observed_at":"2026-08-12T15:08:54.448164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03626","last_updated":"2024-06-23T23:50:59Z","snapshot_observed_at":"2026-08-13T05:08:36.070418Z","submitted_at":"2023-12-06T17:13:15Z","title":"TokenCompose: Text-to-Image Diffusion with Token-level Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03626","snapshot_observed_at":"2026-08-12T15:08:54.481001Z","title":"Tokencompose: Grounding diffusion with token-level supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.481001Z"},"links":{"cited_paper":"/paper/2312.03626","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:788d15a2fd4b46ff8f255f0eda60a9c5d9a85d34d7f08822bfbc94496780259f","observation_id":"61e611f5-978f-42c8-af57-4d3effba7709","resolution":{"observed_at":"2026-08-12T15:08:54.481001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-12T15:08:54.493758Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.493758Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:21dd796ca91ab463574bfe8d8c6d0978750fac443331bb0c4b4bf06e43399c34","observation_id":"7ea65f26-5a4c-4102-a902-2ab30b770d93","resolution":{"observed_at":"2026-08-12T15:08:54.493758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:55.680030Z","title":"Dynamic prompt learning: Addressing cross- attention leakage for text-based image editing","venue":null,"work_id":"64aa1010-c2ff-4a8b-8d4e-7c0c763e5acc","year":null},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.508264Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:aebd44a675ab1a123b1d80cb32dc32d0446bf1fe72be209122f12df77b8e41b5","observation_id":"68feadc4-3997-4a2a-89c4-757edabb1c2d","resolution":{"observed_at":"2026-08-12T15:08:55.688429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15330","last_updated":"2024-10-27T04:44:41Z","snapshot_observed_at":"2026-08-12T23:59:02.601724Z","submitted_at":"2024-05-24T08:12:41Z","title":"Towards Understanding the Working Mechanism of Text-to-Image Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15330","snapshot_observed_at":"2026-08-12T15:08:54.570225Z","title":"Towards understanding the working mechanism of text-to-image dif- fusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.570225Z"},"links":{"cited_paper":"/paper/2405.15330","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:0b96a27f216df138bf105f335c4eeaa69f7c9e5125aad2eafb1af65af4c2c79c","observation_id":"f24ac3fb-769c-4092-b47d-a0ea293bd3a1","resolution":{"observed_at":"2026-08-12T15:08:54.570225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01154","last_updated":"2024-04-01T14:59:13Z","snapshot_observed_at":"2026-08-13T00:40:04.705890Z","submitted_at":"2024-04-01T14:59:13Z","title":"Uncovering the Text Embedding in Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01154","snapshot_observed_at":"2026-08-12T15:08:54.605688Z","title":"Uncovering the text embedding in text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.605688Z"},"links":{"cited_paper":"/paper/2404.01154","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:4eb9ee7d11b6480dda57d277687134b4d17e42bdccf6da4ad2c4cbbbd74167b2","observation_id":"5a92f757-1784-42dd-8ef2-10fe272ceac7","resolution":{"observed_at":"2026-08-12T15:08:54.605688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-12T15:08:54.617831Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.617831Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:64fead92dbe113bdab4ef06c3344f18e73c2360e00fd413af36f513203501cf2","observation_id":"988c4283-3a19-43a4-aa41-6e97888d8372","resolution":{"observed_at":"2026-08-12T15:08:54.617831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-10T14:28:08.728516Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-08-12T15:08:54.627473Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? arXiv preprint arXiv:2210.01936, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.627473Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:46bb8fdc21af56c42f526403f964fe5845587b5a159903de587d256d5af71f2e","observation_id":"1c5deeee-8208-4051-8fa1-6835cb49f8d4","resolution":{"observed_at":"2026-08-12T15:08:54.627473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06381","last_updated":"2024-03-11T02:18:27Z","snapshot_observed_at":"2026-08-13T00:58:00.883131Z","submitted_at":"2024-03-11T02:18:27Z","title":"Enhancing Semantic Fidelity in Text-to-Image Synthesis: Attention Regulation in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06381","snapshot_observed_at":"2026-08-12T15:08:54.669287Z","title":"is there a green backpack?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.669287Z"},"links":{"cited_paper":"/paper/2403.06381","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:a8da4c739fa86cabf1a33d8120889721452db4f9753f9624b5e75fa58efea6d0","observation_id":"2d139588-cb0e-453b-8fe0-eca0c44a2ca8","resolution":{"observed_at":"2026-08-12T15:08:54.669287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T09:33:26.194778Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 2 inbound Pith citation observations for arXiv:2411.15236."}