{"as_of":"2026-08-09T02:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0f52a3d704796ad9559c6cc12d31f33e29583ba1a92e39fb5ffc2c02bcec822","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:51:30.517584Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:41:21.200157Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-07T12:41:21.200157Z","title":"Conceptattention: Diffu- sion transformers learn highly interpretable features.arXiv preprint arXiv:2502.04320, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23758","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-08T23:25:14.933706Z","submitted_at":"2025-05-29T17:59:46Z","title":"LoRAShop: Training-Free Multi-Concept Image Generation and Editing with Rectified Flow Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:21.200157Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2505.23758"},"observation_digest":"sha256:9827a95b2501b8817c3b70da3e983eaf097b7694771b1ad09d243095509605ae","observation_id":"233f2121-ba18-4444-9534-6a742e222961","resolution":{"observed_at":"2026-08-07T12:41:21.200157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-07T05:41:31.024475Z","title":"Conceptattention: Diffusion transformers learn highly interpretable features.CoRR, abs/2502.04320, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07280","last_updated":"2025-06-10T11:37:10Z","snapshot_observed_at":"2026-08-07T10:25:31.097897Z","submitted_at":"2025-06-08T20:52:34Z","title":"From Generation to Generalization: Emergent Few-Shot Learning in Video Diffusion Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:31.024475Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2506.07280"},"observation_digest":"sha256:070c346a1804af80473e3282514f67edd891cddac11c61c4367345e0853a3513","observation_id":"e5d4b584-b4d5-4ec3-9d37-32aeef6aa1bb","resolution":{"observed_at":"2026-08-07T05:41:31.024475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":"2502.04320","doi":"10.48550/arxiv.2502.04320","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Con- ceptattention: Diffusion transformers learn highly inter- pretable features","venue":"ArXiv.org","work_id":"f5715b3d-4e8a-459a-b8b2-901eb2f0fe8e","year":2025},"citing_paper":{"arxiv_id":"2507.23313","last_updated":"2025-07-31T07:47:01Z","snapshot_observed_at":"2026-08-02T09:25:05.244128Z","submitted_at":"2025-07-31T07:47:01Z","title":"The Cow of Rembrandt - Analyzing Artistic Prompt Interpretation in Text-to-Image Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T23:41:50.534434Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2507.23313"},"observation_digest":"sha256:7c697dcb2b4779005ce0264533b75dae86fe0bae1e522906459b567aa0aedf8e","observation_id":"e373986a-7abc-4b74-a3b0-20d237a9dc01","resolution":{"observed_at":"2026-05-21T23:44:26.945529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-05T13:27:41.569139Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05323","last_updated":"2025-09-09T12:40:17Z","snapshot_observed_at":"2026-08-08T23:24:28.005005Z","submitted_at":"2025-08-30T19:46:18Z","title":"Attention of a Kiss: Exploring Attention Maps in Video Diffusion for XAIxArts","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:27:41.569139Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2509.05323"},"observation_digest":"sha256:c9598eef99b4901b1cd1292133e753af493e2269e7abc8d0b24c4b94593e139b","observation_id":"8e151f58-cd7c-4cf5-925e-a8d75f068994","resolution":{"observed_at":"2026-08-05T13:27:41.569139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-04T08:19:59.521627Z","title":"Conceptattention: Diffusion transformers learn highly interpretable features, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.21605","last_updated":"2026-06-17T16:14:08Z","snapshot_observed_at":"2026-08-08T23:24:42.432622Z","submitted_at":"2025-10-24T16:10:09Z","title":"S3OD: Towards Generalizable Salient Object Detection with Synthetic Data","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T08:19:59.521627Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2510.21605"},"observation_digest":"sha256:a181f67b5b29d5f763a72b0b819e0d0052072f6ec470bec72ae9f88057d29160","observation_id":"286c8497-c10b-40f7-8d9c-569fb466ffb7","resolution":{"observed_at":"2026-08-04T08:19:59.521627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":"2502.04320","doi":"10.48550/arxiv.2502.04320","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Con- ceptattention: Diffusion transformers learn highly inter- pretable features","venue":"ArXiv.org","work_id":"f5715b3d-4e8a-459a-b8b2-901eb2f0fe8e","year":2025},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:74a4bec89d34e4f39e77155566172aaefd8599f02dc51998fb7daeddf52bdd89","observation_id":"014dd85b-2817-4cc2-be1c-e2a8fccbdcff","resolution":{"observed_at":"2026-05-10T02:53:29.908134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":"2502.04320","doi":"10.48550/arxiv.2502.04320","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Con- ceptattention: Diffusion transformers learn highly inter- pretable features","venue":"ArXiv.org","work_id":"f5715b3d-4e8a-459a-b8b2-901eb2f0fe8e","year":2025},"citing_paper":{"arxiv_id":"2604.23786","last_updated":"2026-07-17T17:17:29Z","snapshot_observed_at":"2026-08-02T15:32:57.242948Z","submitted_at":"2026-04-26T16:22:39Z","title":"FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T06:16:59.725843Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2604.23786"},"observation_digest":"sha256:d016eeed532793244b8c5caa57f2c94fff782cdc131e23b1aacdd0a505c46e30","observation_id":"fe15ad0f-f369-4514-aa9c-f95023a90daa","resolution":{"observed_at":"2026-05-11T21:16:12.253353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-02T15:32:58.066814Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23786","last_updated":"2026-07-17T17:17:29Z","snapshot_observed_at":"2026-08-02T15:32:57.242948Z","submitted_at":"2026-04-26T16:22:39Z","title":"FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T15:32:58.066814Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2604.23786"},"observation_digest":"sha256:1d02843a1d143c12428a0cc20171c78fbca44422243b665b1271df86c48f2734","observation_id":"26316507-ecd0-4158-ae13-55a10d372608","resolution":{"observed_at":"2026-08-02T15:32:58.066814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":"2502.04320","doi":"10.48550/arxiv.2502.04320","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Con- ceptattention: Diffusion transformers learn highly inter- pretable features","venue":"ArXiv.org","work_id":"f5715b3d-4e8a-459a-b8b2-901eb2f0fe8e","year":2025},"citing_paper":{"arxiv_id":"2605.07907","last_updated":"2026-05-08T15:45:34Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:45:34Z","title":"Consistency Regularised Gradient Flows for Inverse Problems","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-11T03:21:35.082352Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2605.07907"},"observation_digest":"sha256:8050b2e3b2f23bb00250ae52dd93c4b68e2b1697bee30ef12a6c808937af3ed7","observation_id":"1e0e87f6-6282-4654-a044-369e679d2a9a","resolution":{"observed_at":"2026-05-11T03:25:55.059096Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":"2502.04320","doi":"10.48550/arxiv.2502.04320","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Con- ceptattention: Diffusion transformers learn highly inter- pretable features","venue":"ArXiv.org","work_id":"f5715b3d-4e8a-459a-b8b2-901eb2f0fe8e","year":2025},"citing_paper":{"arxiv_id":"2605.10180","last_updated":"2026-05-11T08:31:57Z","snapshot_observed_at":"2026-08-01T15:31:49.304094Z","submitted_at":"2026-05-11T08:31:57Z","title":"What Concepts Lie Within? Detecting and Suppressing Risky Content in Diffusion Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T04:35:39.370969Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2605.10180"},"observation_digest":"sha256:ecaf83f5e2fcb8c4e421854b7086d12b409eabd5f0edebdb6abb2bbcbd489fdd","observation_id":"b53677f1-09e8-4e1f-b252-47ec5ad2bebb","resolution":{"observed_at":"2026-05-12T06:06:26.433353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":"2502.04320","doi":"10.48550/arxiv.2502.04320","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Con- ceptattention: Diffusion transformers learn highly inter- pretable features","venue":"ArXiv.org","work_id":"f5715b3d-4e8a-459a-b8b2-901eb2f0fe8e","year":2025},"citing_paper":{"arxiv_id":"2606.06875","last_updated":"2026-06-05T03:43:04Z","snapshot_observed_at":"2026-08-08T17:46:30.236646Z","submitted_at":"2026-06-05T03:43:04Z","title":"Unified Safe In-context Image Generation in Multimodal Diffusion Transformers via Restricting Unsafe Information Flows","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T22:58:44.478077Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2606.06875"},"observation_digest":"sha256:91e9e65d753a69dda9cd4e26ac798dc7b2de7a9a68fb02011a89161743363f0d","observation_id":"794bcc62-c9f1-4579-80ab-8a00799ac7e8","resolution":{"observed_at":"2026-07-02T16:07:09.083615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-01T13:25:54.283706Z","title":"Conceptattention: Diffusion transformers learn highly interpretable features.arXiv preprint arXiv:2502.04320, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19139","last_updated":"2026-07-30T16:07:04Z","snapshot_observed_at":"2026-08-03T13:02:29.806237Z","submitted_at":"2026-07-21T14:29:59Z","title":"Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T13:25:54.283706Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2607.19139"},"observation_digest":"sha256:493774ed36344608035f4fc9837c2dacd34d0026dc63090181ed5a1f600b8e04","observation_id":"1c2eb649-ccb4-42b1-a613-5a0adcff069e","resolution":{"observed_at":"2026-08-01T13:25:54.283706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04320/citation-record","integrity":"/paper/2502.04320/integrity","json":"/paper/2502.04320/citation-record.json","paper":"/paper/2502.04320"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-08T22:51:30.333740Z","title":"and Zuidema, W","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.333740Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:ddb1133e370e6d05e378522d033de53e33773011d983c74179ee50554e9d28d7","observation_id":"8c7919ed-079b-461e-8aa8-f182a905f229","resolution":{"observed_at":"2026-08-08T22:51:30.333740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00390","last_updated":"2022-09-07T04:14:48Z","snapshot_observed_at":"2026-08-07T15:26:15.477145Z","submitted_at":"2021-12-01T10:17:25Z","title":"SegDiff: Image Segmentation with Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00390","snapshot_observed_at":"2026-08-08T22:51:30.338470Z","title":"SegDiff : Image Segmentation with Diffusion Probabilistic Models , September 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.338470Z"},"links":{"cited_paper":"/paper/2112.00390","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:479bd7f380b7fc765e411ba495f9bb3b477c9fad85cafc80c47861ecd70233f1","observation_id":"a83e9e0a-cadd-41c2-881e-f837daf8404b","resolution":{"observed_at":"2026-08-08T22:51:30.338470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03126","last_updated":"2022-03-16T01:35:49Z","snapshot_observed_at":"2026-07-06T12:15:47.711366Z","submitted_at":"2021-12-06T15:55:30Z","title":"Label-Efficient Semantic Segmentation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03126","snapshot_observed_at":"2026-08-08T22:51:30.342260Z","title":"Label- Efficient Semantic Segmentation with Diffusion Models , March 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.342260Z"},"links":{"cited_paper":"/paper/2112.03126","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:74c39324badcbddae99c814e1bbc764d60b4b48509d95af47eca7726a21d1ff5","observation_id":"770be66a-b762-4493-8a3d-cb35658fbf49","resolution":{"observed_at":"2026-08-08T22:51:30.342260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.00825","last_updated":"2016-04-04T11:52:07Z","snapshot_observed_at":"2026-08-01T00:36:40.003240Z","submitted_at":"2016-04-04T11:52:07Z","title":"Layer-wise Relevance Propagation for Neural Networks with Local Renormalization Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.00825","snapshot_observed_at":"2026-08-08T22:51:30.346022Z","title":"Layer-wise Relevance Propagation for Neural Networks with Local Renormalization Layers , April 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.346022Z"},"links":{"cited_paper":"/paper/1604.00825","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:3b0588f11299cdd70e7a09acbd4f5f65510b87acd9b8446ce74a2c480986fca5","observation_id":"1e2458e1-311e-4e71-bfce-0e29cbd9e825","resolution":{"observed_at":"2026-08-08T22:51:30.346022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-06T07:25:23.651829Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-08-08T22:51:30.349907Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.349907Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:d41a6d5154fdeaad6f44ccc8550e89ed1b9160292198016bd4147a0965ec4fe2","observation_id":"609d7847-06fe-45fd-81f0-198bdca9e3db","resolution":{"observed_at":"2026-08-08T22:51:30.349907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13188","last_updated":"2023-01-30T18:53:09Z","snapshot_observed_at":"2026-08-03T19:59:42.715353Z","submitted_at":"2023-01-30T18:53:09Z","title":"Extracting Training Data from Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13188","snapshot_observed_at":"2026-08-08T22:51:30.353679Z","title":"Extracting Training Data from Diffusion Models , January 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.353679Z"},"links":{"cited_paper":"/paper/2301.13188","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:570e5e461a4f118ee41b8df863fd4cd247e8550343b68b9e2c5a688fcd192731","observation_id":"9c2b28d1-55b2-4abb-a2b3-0ba950d533b6","resolution":{"observed_at":"2026-08-08T22:51:30.353679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14294","last_updated":"2021-05-24T17:49:18Z","snapshot_observed_at":"2026-08-04T11:32:10.695202Z","submitted_at":"2021-04-29T12:28:51Z","title":"Emerging Properties in Self-Supervised Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14294","snapshot_observed_at":"2026-08-08T22:51:30.357789Z","title":"Emerging Properties in Self - Supervised Vision Transformers , May 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.357789Z"},"links":{"cited_paper":"/paper/2104.14294","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:55bc2cac3b81716340e2b25530097079a85d388dfa9677b703003669908aee93","observation_id":"72881085-ab39-4e6d-88f9-d7d1d4a4d515","resolution":{"observed_at":"2026-08-08T22:51:30.357789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09838","last_updated":"2021-04-05T11:19:28Z","snapshot_observed_at":"2026-08-05T04:44:39.721990Z","submitted_at":"2020-12-17T18:56:33Z","title":"Transformer Interpretability Beyond Attention Visualization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09838","snapshot_observed_at":"2026-08-08T22:51:30.361375Z","title":"Transformer Interpretability Beyond Attention Visualization , April 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.361375Z"},"links":{"cited_paper":"/paper/2012.09838","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:e57cc472766cbb61feebcc083129fc95b7da1295ff090f14996b09eae39a040a","observation_id":"f2c4b612-51a8-4d5b-9205-10bc526d8363","resolution":{"observed_at":"2026-08-08T22:51:30.361375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:51:30.365200Z","title":"Attend-and- Excite : Attention - Based Semantic Guidance for Text -to- Image Diffusion Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.365200Z"},"links":{"citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:ef4f7fab103c221c54a1f36f6e29a936e4b707829646c8152cf50b959896e9ce","observation_id":"738c633f-5567-49ac-84ac-e2c21dfce76b","resolution":{"observed_at":"2026-08-08T22:51:30.365200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03373","last_updated":"2023-11-29T10:21:48Z","snapshot_observed_at":"2026-08-06T15:13:18.487979Z","submitted_at":"2023-04-06T21:00:00Z","title":"Training-Free Layout Control with Cross-Attention Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03373","snapshot_observed_at":"2026-08-08T22:51:30.368808Z","title":"Training- Free Layout Control with Cross - Attention Guidance , November 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.368808Z"},"links":{"cited_paper":"/paper/2304.03373","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:18eed551bde249dd5d2c4ef8d4d0844cedd217cfe59203fe7a3c55a0e5d45ad0","observation_id":"d2a8940a-b9c6-40bf-b148-c1de63cc00c1","resolution":{"observed_at":"2026-08-08T22:51:30.368808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.17070","last_updated":"2021-03-30T00:12:10Z","snapshot_observed_at":"2026-08-04T19:47:36.226265Z","submitted_at":"2021-03-30T00:12:10Z","title":"PiCIE: Unsupervised Semantic Segmentation using Invariance and Equivariance in Clustering","version":1},"cited_work":{"arxiv_id":"2103.17070","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.17070","snapshot_observed_at":"2026-08-08T22:51:31.018810Z","title":"PiCIE: Unsupervised Semantic Segmentation using Invariance and Equivariance in Clustering","venue":"cs.CV","work_id":"98427557-2773-4605-a7be-cdae09df94c4","year":2021},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.372406Z"},"links":{"cited_paper":"/paper/2103.17070","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:d64171b702daf734218c7567d3dcc55670fedb50aa4ca694d895c018a0c70538","observation_id":"9aaf1493-47d9-4307-b7be-1fcfaa83e78e","resolution":{"observed_at":"2026-08-08T22:51:31.022701Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09611","last_updated":"2024-12-12T18:59:40Z","snapshot_observed_at":"2026-07-06T20:06:09.333397Z","submitted_at":"2024-12-12T18:59:40Z","title":"FluxSpace: Disentangled Semantic Editing in Rectified Flow Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09611","snapshot_observed_at":"2026-08-08T22:51:30.375916Z","title":"FluxSpace : Disentangled Semantic Editing in Rectified Flow Transformers , December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.375916Z"},"links":{"cited_paper":"/paper/2412.09611","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:4b6903e122fc28c351eb5608755ff63d45214349b468b215958ad93b8fd9478e","observation_id":"4457faec-e223-4efd-b871-6533c22a2f1e","resolution":{"observed_at":"2026-08-08T22:51:30.375916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-08T22:51:30.379390Z","title":"Vision Transformers Need Registers , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.379390Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:4c70b5c377ec712fae5c8db48aaca21a198f2729a870a682635c7094e5248021","observation_id":"dd4542d8-af62-4912-92a8-5df459594db5","resolution":{"observed_at":"2026-08-08T22:51:30.379390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-08T22:51:30.383170Z","title":"An Image is Worth 16x16 Words : Transformers for Image Recognition at Scale , June 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.383170Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:d6957ecef6e4599546c1138e5848457fa061ab477b90d1ad698e4d93e686111d","observation_id":"d7e74634-b778-4be1-b99f-f4391ec3d053","resolution":{"observed_at":"2026-08-08T22:51:30.383170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00986","last_updated":"2023-06-11T23:36:38Z","snapshot_observed_at":"2026-08-08T15:37:34.180546Z","submitted_at":"2023-06-01T17:59:56Z","title":"Diffusion Self-Guidance for Controllable Image Generation","version":3},"cited_work":{"arxiv_id":"2306.00986","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00986","snapshot_observed_at":"2026-08-08T22:51:30.978700Z","title":"Diffusion Self-Guidance for Controllable Image Generation","venue":"cs.CV","work_id":"29b8d590-e5c1-4de3-bc67-99aed45d0af7","year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.386761Z"},"links":{"cited_paper":"/paper/2306.00986","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:58b202b4b3b73ef337e89edd6cbbbab3cfd766995c11c7d7b9d47d9179afa3b9","observation_id":"0a07c957-12c5-4a2d-9ef3-c1161b607ab5","resolution":{"observed_at":"2026-08-08T22:51:30.982597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-08T22:51:30.390325Z","title":"Scaling Rectified Flow Transformers for High - Resolution Image Synthesis , March 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.390325Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:1615aba4f0d77c2bd4e6caf1817517851b0d27a21187e22cba4c4c4286f69cbf","observation_id":"40f0e65d-fc3d-4050-bbba-995415c4e134","resolution":{"observed_at":"2026-08-08T22:51:30.390325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:51:30.394346Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.394346Z"},"links":{"citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:d8aa3e8ac1fefbf8e59c7435326c890f5ac3f9c6502af77547ecbd6fdf0a9e69","observation_id":"e950b0dd-ccd9-4dbf-a0a4-cff94d7573cb","resolution":{"observed_at":"2026-08-08T22:51:30.394346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05916","last_updated":"2024-03-29T03:40:47Z","snapshot_observed_at":"2026-08-07T05:17:24.854291Z","submitted_at":"2023-10-09T17:59:04Z","title":"Interpreting CLIP's Image Representation via Text-Based Decomposition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05916","snapshot_observed_at":"2026-08-08T22:51:30.398000Z","title":"A., and Steinhardt, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.398000Z"},"links":{"cited_paper":"/paper/2310.05916","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:00e04082d3ae961b8324451247467947f745b798b48286e6c9bec0656719743c","observation_id":"defb6842-ee33-495f-bcea-0fa5f2286cda","resolution":{"observed_at":"2026-08-08T22:51:30.398000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11263-014-0713-9","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:51:30.553489Z","title":"ImageNet Auto - Annotation with Segmentation Propagation","venue":null,"work_id":"24e3011e-5059-4d55-ad8c-c5d8b3be04dc","year":2014},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.401686Z"},"links":{"citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:2a700504a2fc3990cefd9c4a67c04015f938e9e3e8a4aa13c93d98bbabbe85ba","observation_id":"13b9f209-b716-4b72-b900-0eef2cc62d94","resolution":{"observed_at":"2026-08-08T22:51:30.558819Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05852","last_updated":"2024-05-09T15:39:54Z","snapshot_observed_at":"2026-08-05T20:36:13.830132Z","submitted_at":"2024-05-09T15:39:54Z","title":"Pre-trained Text-to-Image Diffusion Models Are Versatile Representation Learners for Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05852","snapshot_observed_at":"2026-08-08T22:51:30.404867Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.404867Z"},"links":{"cited_paper":"/paper/2405.05852","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:1a23a946fe3a87745c37de4975923163cbc26777d94f3f6512e790933aa8fcf1","observation_id":"856f6a24-3d80-4fa8-a1ca-a9bdc88335d6","resolution":{"observed_at":"2026-08-08T22:51:30.404867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08414","last_updated":"2022-03-16T06:08:47Z","snapshot_observed_at":"2026-08-05T19:30:04.459795Z","submitted_at":"2022-03-16T06:08:47Z","title":"Unsupervised Semantic Segmentation by Distilling Feature Correspondences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08414","snapshot_observed_at":"2026-08-08T22:51:30.408783Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.408783Z"},"links":{"cited_paper":"/paper/2203.08414","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:288d02fdd1c895dc5a011d406e0246c1d154da76a1fdf31a5d1ad522e8dd8a06","observation_id":"ca5d20cf-7f76-4232-b4b3-32e816d04992","resolution":{"observed_at":"2026-08-08T22:51:30.408783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-08T22:51:30.412279Z","title":"Prompt-to- Prompt Image Editing with Cross Attention Control , August 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.412279Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:0f4636073c49e1f136c046b10f27b21b0de9cac8d8674547bcdec50179ec2fcd","observation_id":"775f2ebe-a2fd-41ae-9611-4341a5bf3584","resolution":{"observed_at":"2026-08-08T22:51:30.412279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02557","last_updated":"2024-04-12T15:48:47Z","snapshot_observed_at":"2026-08-03T00:41:20.399858Z","submitted_at":"2023-10-04T03:30:32Z","title":"Generalization in diffusion models arises from geometry-adaptive harmonic representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02557","snapshot_observed_at":"2026-08-08T22:51:30.416092Z","title":"P., and Mallat, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.416092Z"},"links":{"cited_paper":"/paper/2310.02557","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:8f47224750078f6ac780655b3d2f7a0bddbd54456529e57857469dae54944ad2","observation_id":"a29b1f14-7036-4d01-9d5f-ed42a0faf9e5","resolution":{"observed_at":"2026-08-08T22:51:30.416092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09316","last_updated":"2024-09-30T03:17:39Z","snapshot_observed_at":"2026-08-07T23:37:33.510608Z","submitted_at":"2023-06-15T17:51:28Z","title":"Diffusion Models for Open-Vocabulary Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09316","snapshot_observed_at":"2026-08-08T22:51:30.419474Z","title":"Diffusion Models for Open - Vocabulary Segmentation , September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.419474Z"},"links":{"cited_paper":"/paper/2306.09316","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:9a3ed64f2780766243e2de73103226f788f79549bfaa0f1fc284c6776fe06696","observation_id":"a5dc0093-a2ad-4a58-a1d8-449fc0adde92","resolution":{"observed_at":"2026-08-08T22:51:30.419474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-08T22:51:30.423270Z","title":"C., Lo, W.-Y., Dollár, P., and Girshick, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.423270Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:946652d6a01c74fd4ddf15e75ef8946b2cf279c000880eea497c229ec0229553","observation_id":"8c4fd63f-497c-4c19-8ecf-7a7679d91aa7","resolution":{"observed_at":"2026-08-08T22:51:30.423270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:51:30.426778Z","title":null,"venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.426778Z"},"links":{"citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:b2ec476a7635ba6fce56ffb16e41227cf63da32dd049605a1ffec107a70d050c","observation_id":"645504f3-664f-4a1d-b8bb-024d27065370","resolution":{"observed_at":"2026-08-08T22:51:30.426778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:51:31.125452Z","title":null,"venue":null,"work_id":"494197d5-6440-4ad7-adda-c6d3d7a763d0","year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.430207Z"},"links":{"citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:b24110f5e9ac5cca57be3607d49fba011fbe255b5d7fa52843edcc463438659a","observation_id":"5a2c4880-61f3-4e11-96be-4b05bf4f886c","resolution":{"observed_at":"2026-08-08T22:51:31.129147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16203","last_updated":"2023-09-13T01:16:45Z","snapshot_observed_at":"2026-07-06T15:09:08.648296Z","submitted_at":"2023-03-28T17:59:56Z","title":"Your Diffusion Model is Secretly a Zero-Shot Classifier","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16203","snapshot_observed_at":"2026-08-08T22:51:30.433654Z","title":"C., Prabhudesai, M., Duggal, S., Brown, E., and Pathak, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.433654Z"},"links":{"cited_paper":"/paper/2303.16203","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:8bd647c17d124d4e598389f8e9b8cceb23fe0a702b4324e11918539899b8bb7a","observation_id":"0f6928a4-2f4a-452e-a257-6eebbbc4badb","resolution":{"observed_at":"2026-08-08T22:51:30.433654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05221","last_updated":"2023-08-10T16:05:14Z","snapshot_observed_at":"2026-08-06T02:49:25.172569Z","submitted_at":"2023-01-12T18:59:08Z","title":"Open-vocabulary Object Segmentation with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2301.05221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.05221","snapshot_observed_at":"2026-08-08T22:51:30.772404Z","title":"Open-vocabulary Object Segmentation with Diffusion Models","venue":"cs.CV","work_id":"e79c144c-d6b9-45fd-bbcb-1a0bfa75bed7","year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.437041Z"},"links":{"cited_paper":"/paper/2301.05221","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:072a57fa2e2815a381064783e292f44f9ced3aeb75c7c902d8c0c7bec068c949","observation_id":"0c117fd9-4b46-4f8f-922a-4e389e6440d6","resolution":{"observed_at":"2026-08-08T22:51:30.776111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-08T22:51:30.440588Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.440588Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:eb528434cdc04a9cf568cd98e2daff2eec743cc576b71b23fb163350e120602a","observation_id":"3295af62-2c4f-4b70-a679-68a0e565a74b","resolution":{"observed_at":"2026-08-08T22:51:30.440588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03431","last_updated":"2024-03-06T03:32:56Z","snapshot_observed_at":"2026-08-03T13:50:02.414004Z","submitted_at":"2024-03-06T03:32:56Z","title":"Towards Understanding Cross and Self-Attention in Stable Diffusion for Text-Guided Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03431","snapshot_observed_at":"2026-08-08T22:51:30.443951Z","title":"Towards Understanding Cross and Self - Attention in Stable Diffusion for Text - Guided Image Editing , March 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.443951Z"},"links":{"cited_paper":"/paper/2403.03431","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:c70c608a92d00ca3e1bb84b099c9e69ecaa444636fc8abe3357cc58838703b90","observation_id":"78f599a0-771b-449e-bcc4-4f8fb1a48f46","resolution":{"observed_at":"2026-08-08T22:51:30.443951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-08T22:51:30.447239Z","title":"Flow Straight and Fast : Learning to Generate and Transfer Data with Rectified Flow , September 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.447239Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:945002947c58d421daa86cc230b93f5201cc1a395b820dd5d24b25c67f62b21b","observation_id":"4b6825cf-7455-447f-b22b-a9eebb838bee","resolution":{"observed_at":"2026-08-08T22:51:30.447239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14291","last_updated":"2024-03-21T10:56:12Z","snapshot_observed_at":"2026-07-06T17:48:12.002601Z","submitted_at":"2024-03-21T10:56:12Z","title":"Open-Vocabulary Attention Maps with Token Optimization for Semantic Segmentation in Diffusion Models","version":1},"cited_work":{"arxiv_id":"2403.14291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14291","snapshot_observed_at":"2026-08-08T22:51:30.732647Z","title":"Open-Vocabulary Attention Maps with Token Optimization for Semantic Segmentation in Diffusion Models","venue":"cs.CV","work_id":"cac41f17-b290-4da5-9b3e-8cf0c8786e66","year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.450874Z"},"links":{"cited_paper":"/paper/2403.14291","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:f9204c94070a83e34ff630b5d2ba4d5690b6f7839e4b6007187e1dd3931e83cd","observation_id":"5e4174c8-2611-4510-bd2f-5d3f579344b5","resolution":{"observed_at":"2026-08-08T22:51:30.736499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:51:31.115490Z","title":null,"venue":null,"work_id":"b411517f-32c9-45bb-b4ee-8efd4fb1049d","year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.454246Z"},"links":{"citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:e94a17502cd109bfdb190ad8345193c564486e798960d1ac90eb6963345e4f99","observation_id":"6210da07-c566-4922-b569-c40f2a9bfddf","resolution":{"observed_at":"2026-08-08T22:51:31.118945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-08T22:51:30.457401Z","title":"DINOv2 : Learning Robust Visual Features without Supervision , February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.457401Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:2e98f8e9a0854f7ff0616321b3e33dfd8e40adaa73c348f5788d6b7584e7c3d3","observation_id":"9392d588-5623-4982-a831-ff44d36e8ef6","resolution":{"observed_at":"2026-08-08T22:51:30.457401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-08T22:51:30.460316Z","title":"PyTorch : An Imperative Style , High - Performance Deep Learning Library , December 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.460316Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:0d35ea52862db6a898e15965aedff005767d43ae4c384cd1325f6397ea01d120","observation_id":"dca7f9e3-9348-49bf-b6b1-22f37c4020c2","resolution":{"observed_at":"2026-08-08T22:51:30.460316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-08T22:51:30.463663Z","title":"and Xie, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.463663Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:49ed878c9a18fc6a442b7ab4f0018aecf5e07de1aa775f0c2d244d2e7592f690","observation_id":"a225cf19-2489-4d88-96a7-706d4a8b8889","resolution":{"observed_at":"2026-08-08T22:51:30.463663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-08T22:51:30.467066Z","title":"SDXL : Improving Latent Diffusion Models for High - Resolution Image Synthesis , July 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.467066Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:224a61ae49f68b21eccfcc24d5fda76424d13218bea985995e95d6096428161b","observation_id":"1d7beaa9-8877-496a-9198-0f0a0de79938","resolution":{"observed_at":"2026-08-08T22:51:30.467066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-08T22:51:30.470288Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.470288Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:816f6998bb818e60e9a7f52d1547b40a4f8338e0e313cafd1bceab3dcc9f3d93","observation_id":"48e90fb0-27ef-49c6-9ee5-f05c1543f8a8","resolution":{"observed_at":"2026-08-08T22:51:30.470288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-08T22:51:30.473563Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.473563Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:079dd13bf3d363cc0a92170aee9292c7ecc903b81636ab6e49c14c1d07da9d38","observation_id":"c2c5a252-5706-4faa-b942-8c70d3f1b984","resolution":{"observed_at":"2026-08-08T22:51:30.473563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-08T22:51:30.477146Z","title":"V., Carion, N., Wu, C.-Y., Girshick, R., Dollár, P., and Feichtenhofer, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.477146Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:6c1b840e050b3ca6e784ba69b15fa7bdf8c3dbee7649ffb6405d0f51b149f334","observation_id":"a25eb93c-c981-427d-bd0d-f44de1c09b83","resolution":{"observed_at":"2026-08-08T22:51:30.477146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-08T22:51:30.480460Z","title":"High- Resolution Image Synthesis with Latent Diffusion Models , April 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.480460Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:aabd6c1108b05ee20ef15ad756648505da79f0bcabfd9dcd9c81e75115151536","observation_id":"fee83678-a421-4231-aa04-1c2c38c2ee7f","resolution":{"observed_at":"2026-08-08T22:51:30.480460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-06T11:05:16.105361Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-08T22:51:30.483665Z","title":"U- Net : Convolutional Networks for Biomedical Image Segmentation , May 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.483665Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:45ecf7a135b1be3a1ddb415f3f1cf50351914b5fea397c7633d045ba3d7c18d1","observation_id":"eaad2de4-2aa0-4853-9908-81c32c144cb7","resolution":{"observed_at":"2026-08-08T22:51:30.483665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02391","last_updated":"2019-12-03T02:13:03Z","snapshot_observed_at":"2026-07-06T05:13:49.420787Z","submitted_at":"2016-10-07T19:54:24Z","title":"Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02391","snapshot_observed_at":"2026-08-08T22:51:30.490389Z","title":"R., Cogswell, M., Das, A., Vedantam, R., Parikh, D., and Batra, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.490389Z"},"links":{"cited_paper":"/paper/1610.02391","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:b450abd56ee504bca91ec3f24e7f3b91e00d973004307ea4a6221295e2bc0e57","observation_id":"0d980ec8-17a9-4a44-8cce-1d2e12b4889a","resolution":{"observed_at":"2026-08-08T22:51:30.490389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07661","last_updated":"2024-05-07T12:00:34Z","snapshot_observed_at":"2026-08-07T10:26:04.330809Z","submitted_at":"2023-12-12T19:00:04Z","title":"CLIP as RNN: Segment Countless Visual Concepts without Training Endeavor","version":3},"cited_work":{"arxiv_id":"2312.07661","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.07661","snapshot_observed_at":"2026-08-08T22:51:30.632772Z","title":"CLIP as RNN: Segment Countless Visual Concepts without Training Endeavor","venue":"cs.CV","work_id":"e95fa1b8-5353-4c19-b750-94723b4dc35b","year":2023},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.493433Z"},"links":{"cited_paper":"/paper/2312.07661","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:ddb504648847baca208852b2b5460b22e8a885fe555f5e6a2fa776c3b12bb53a","observation_id":"d0b2afb8-8fe5-417b-9f19-cb62552bbb8a","resolution":{"observed_at":"2026-08-08T22:51:30.636567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04885","last_updated":"2022-12-08T18:38:46Z","snapshot_observed_at":"2026-08-03T15:47:47.841099Z","submitted_at":"2022-10-10T17:55:41Z","title":"What the DAAM: Interpreting Stable Diffusion Using Cross Attention","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04885","snapshot_observed_at":"2026-08-08T22:51:30.496805Z","title":"What the DAAM : Interpreting Stable Diffusion Using Cross Attention , December 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.496805Z"},"links":{"cited_paper":"/paper/2210.04885","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:f01d29f67709d150ebfc296b65a4bc16ef4bc88a73129175678d56309c2453af","observation_id":"7a90582c-664f-43de-ad20-1304c543abfa","resolution":{"observed_at":"2026-08-08T22:51:30.496805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12469","last_updated":"2024-04-02T17:40:03Z","snapshot_observed_at":"2026-07-06T16:09:44.283461Z","submitted_at":"2023-08-23T23:44:44Z","title":"Diffuse, Attend, and Segment: Unsupervised Zero-Shot Segmentation using Stable Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12469","snapshot_observed_at":"2026-08-08T22:51:30.500093Z","title":"Diffuse, Attend , and Segment : Unsupervised Zero - Shot Segmentation using Stable Diffusion , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.500093Z"},"links":{"cited_paper":"/paper/2308.12469","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:cbd26559fee81cc08b80f68d1e3e998323b73f18a689c86bf36764a786cacdeb","observation_id":"927927ff-6866-4d31-b25a-ca8ed11d3295","resolution":{"observed_at":"2026-08-08T22:51:30.500093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02426","last_updated":"2026-06-30T05:31:38Z","snapshot_observed_at":"2026-07-06T19:10:08.541482Z","submitted_at":"2024-09-04T04:14:02Z","title":"Breaking the Curse of Dimensionality: Diffusion Models Efficiently Learn Low-Dimensional Distributions","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02426","snapshot_observed_at":"2026-08-08T22:51:30.503757Z","title":"Diffusion Models Learn Low - Dimensional Distributions via Subspace Clustering , December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.503757Z"},"links":{"cited_paper":"/paper/2409.02426","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:f654c519f74dfd524300814bf363ccfbb0d3625073acbb19e357ef32c7921179","observation_id":"18f6e557-2c90-4cb2-a9cc-9172a5c63a5c","resolution":{"observed_at":"2026-08-08T22:51:30.503757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.07013","last_updated":"2019-11-16T11:00:16Z","snapshot_observed_at":"2026-07-06T08:37:28.734352Z","submitted_at":"2019-11-16T11:00:16Z","title":"Understanding and Improving Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.07013","snapshot_observed_at":"2026-08-08T22:51:30.507227Z","title":"Understanding and Improving Layer Normalization , November 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.507227Z"},"links":{"cited_paper":"/paper/1911.07013","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:0230b7dbf8124f098e822e1cf97c106fca72b3a18220ed5af04bec195ac24aaf","observation_id":"3f68ee24-48f7-4099-a447-b85ad5b40753","resolution":{"observed_at":"2026-08-08T22:51:30.507227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-08T22:51:30.510651Z","title":"CogVideoX : Text -to- Video Diffusion Models with An Expert Transformer , March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.510651Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:51d8a545ac01a76e99fbb11c0b1799f396d1748e6ee12aaebc1ed68e42d798a9","observation_id":"90877743-4f2b-46af-b2b3-28f9ab064aa4","resolution":{"observed_at":"2026-08-08T22:51:30.510651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-08T22:51:30.514096Z","title":"iBOT : Image BERT Pre - Training with Online Tokenizer , January 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.514096Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:566e81c86a073a9d5e2d5f2367a6de341abccbdf0666d6629b7be70fa5b831dd","observation_id":"e2fc2cdf-b61b-4a91-bdb2-6cc16926b791","resolution":{"observed_at":"2026-08-08T22:51:30.514096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:51:30.517584Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.517584Z"},"links":{"citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:54cb616aeb310d9e93310c706ac11b793aa5c7205d263fbfca1a8fe9e1b2cb99","observation_id":"8a00a806-1da0-4a55-98cd-a82587431609","resolution":{"observed_at":"2026-08-08T22:51:30.517584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:24:17.482379Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":46,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 12 inbound Pith citation observations for arXiv:2502.04320."}