{"as_of":"2026-08-21T00:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d57a3783ace2dd999f7db744474be5998d65bfe799cef91382099c35d37e121a","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:59:32.123895Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08940/citation-record","integrity":"/paper/2509.08940/integrity","json":"/paper/2509.08940/citation-record.json","paper":"/paper/2509.08940"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.509018Z","title":"Introducing stable diffusion 3.5.https: //stability.ai/news/introducing- stable- diffusion-3-5, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.509018Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:7548adbceb543fc795ab585e3bf0911970b12e22b69be5a424b0de5233a03fd7","observation_id":"81d039fb-fbed-48b0-84d4-1165c0c6dac0","resolution":{"observed_at":"2026-08-04T19:59:30.509018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.572637Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.572637Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:f212a598a02707635e4fd6ea5bf7f1c399c5dce7fbebdfb1f45946ab69a28976","observation_id":"d2f8f49d-fac9-4b2d-af55-eee6ea2b0e75","resolution":{"observed_at":"2026-08-04T19:59:30.572637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.630088Z","title":"Claude 3.5 sonnet, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.630088Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:47457c12d31a6812573cd74cdec7d2a77b53b9ab5ccbc5ac438b4c3e49c2dcc2","observation_id":"cde85b98-1207-46ac-8138-6887510d2aec","resolution":{"observed_at":"2026-08-04T19:59:30.630088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.670621Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.670621Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:bbc9fffc77e463f7766d80ead4bf9e828321917941be1e7457178877a5b71cce","observation_id":"658233e9-adde-4865-a2db-dcacc943a1fd","resolution":{"observed_at":"2026-08-04T19:59:30.670621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.726321Z","title":"Easily acces- sible text-to-image generation amplifies demographic stereo- types at large scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.726321Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:d4664253a3c51364c7493415830b96df8602cdcb0aa77a4d18da85e31f94e736","observation_id":"575aad73-607b-4e71-859d-cd4b190fae62","resolution":{"observed_at":"2026-08-04T19:59:30.726321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.794154Z","title":"Pixart-α: Fast training of dif- fusion transformer for photorealistic text-to-image synthesis,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.794154Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:22acf9757ab66ca055c2e90f2f7f3a0686c0c470af605bf4f22e4cc61948d0fd","observation_id":"f0ae3c7b-fea0-486c-8abb-f3698004014e","resolution":{"observed_at":"2026-08-04T19:59:30.794154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.862605Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.862605Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:001bb465a79f026b02296b02ede9914d77b5df682c6af28a7528d3ff74d48678","observation_id":"54253f9e-cf96-4ccb-a43d-44dd05b20277","resolution":{"observed_at":"2026-08-04T19:59:30.862605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.919450Z","title":"Tibet: Identifying and evaluating biases in text-to-image generative models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.919450Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:c07ba43952bca1add3e0263ec750b113d95e024a473faa8d85608be8de822346","observation_id":"700c5ccc-d7d5-4033-a837-7a52cb22dfff","resolution":{"observed_at":"2026-08-04T19:59:30.919450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.975637Z","title":"Evolving interpretable visual classifiers with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.975637Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:e3f5e3ba49927db2c7bbbb28e92e73dbe4ea50afb53751289670f40330b12ea7","observation_id":"e1a3396b-a157-4784-913f-8f9fc3dd4e82","resolution":{"observed_at":"2026-08-04T19:59:30.975637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04053","last_updated":"2023-08-30T18:41:01Z","snapshot_observed_at":"2026-08-19T17:33:29.206707Z","submitted_at":"2022-02-08T18:36:52Z","title":"DALL-Eval: Probing the Reasoning Skills and Social Biases of Text-to-Image Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04053","snapshot_observed_at":"2026-08-04T19:59:31.032268Z","title":"Dall-eval: Probing the reasoning skills and social biases of text-to-image generative transformers.arXiv preprint arXiv:2202.04053, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.032268Z"},"links":{"cited_paper":"/paper/2202.04053","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:0313fbfb610161cc6eac05f8463d1e08e7a1f61a3669bc1594016d8f0e46085f","observation_id":"8ab89cb5-043b-46de-b2a5-680c1a4830ec","resolution":{"observed_at":"2026-08-04T19:59:31.032268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.088012Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.088012Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:ee877f7154fb29b1262dcd7551c74b3d97e7a1ee28d48c7b182593f53fca3780","observation_id":"7e424687-ddf0-4094-bdc9-7f316ebd0c48","resolution":{"observed_at":"2026-08-04T19:59:31.088012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.140277Z","title":"Weighted kappa: Nominal scale agreement provision for scaled disagreement or partial credit.Psycho- logical Bulletin, 70(4):213–220, 1968","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.140277Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:12cc0cc42e87f2a33ca1f6530cf0106789163c4d1aa1288a40bf0628312e9ebd","observation_id":"d569b897-1298-4865-885b-d2048051c200","resolution":{"observed_at":"2026-08-04T19:59:31.140277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.210195Z","title":"Openbias: Open-set bias detection in text-to-image generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.210195Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:1650612f334151fb8b6212568bac59211d77f3925b7f5c233257374a69f3f119","observation_id":"75866fca-59b5-4ce0-a1d1-3d259f8014b2","resolution":{"observed_at":"2026-08-04T19:59:31.210195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.252564Z","title":"Gradbias: Un- veiling word influence on bias in text-to-image generative models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.252564Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:6d8335d6cb78ce40dc43e46a6abaeaf5f8be45917464fead5ecf49157c35cf0d","observation_id":"117896d1-2121-4d68-a9b4-188d0ff66711","resolution":{"observed_at":"2026-08-04T19:59:31.252564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.334975Z","title":"Efros, and Assaf Shocher","venue":null,"work_id":null,"year":1934},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.334975Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:f71152ce65b7fd552688903ebcc69aa6e2285e2c9dffb3e123959cf553eec060","observation_id":"cf8c470f-4422-42dd-8416-b9d2450aa94d","resolution":{"observed_at":"2026-08-04T19:59:31.334975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.388678Z","title":"Dreamlike photoreal 2.0.https:// huggingface.co/dreamlike- art/dreamlike- photoreal-2.0, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.388678Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:8987ef2bcdb290194c552e24ded4d484ae767cd2aad0d60d431cd4cbf3acf6da","observation_id":"5d4a7d17-d9b7-48f6-bd1f-2230cdc08195","resolution":{"observed_at":"2026-08-04T19:59:31.388678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.441662Z","title":"Gonzalez, and Serena Yeung-Levy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.441662Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:7db50c954a7e713aa6998322fa2c9226a559230f3fd35f8b9808a8a660fcc9ea","observation_id":"335b10f0-374b-4c09-9299-ba91392bec29","resolution":{"observed_at":"2026-08-04T19:59:31.441662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10893","last_updated":"2023-07-17T12:13:46Z","snapshot_observed_at":"2026-08-17T03:01:29.512755Z","submitted_at":"2023-02-07T18:25:28Z","title":"Fair Diffusion: Instructing Text-to-Image Generation Models on Fairness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10893","snapshot_observed_at":"2026-08-04T19:59:31.465984Z","title":"Friedrich, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.465984Z"},"links":{"cited_paper":"/paper/2302.10893","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:4091d9786c86b62840e45f228d3eff0010dfa5c236f36d71a50233a90057d32d","observation_id":"cdce51d6-1966-4bdd-8166-5e1bba124c1a","resolution":{"observed_at":"2026-08-04T19:59:31.465984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.544269Z","title":"Efros, and Jacob Steinhardt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.544269Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:ddaf052c435411f38e326335b4bf2319338212c0ffe69b1356c9efc62dac7fad","observation_id":"48a5780a-0dae-4c8e-a589-78089860f677","resolution":{"observed_at":"2026-08-04T19:59:31.544269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.688526Z","title":"Efros, and Jacob Steinhardt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.688526Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:2f835d445217f15615b2d8f060686bada3ba0b5476a025366faaa3eff07c9724","observation_id":"7780a2b4-0b73-4ee3-8341-0f819671a46e","resolution":{"observed_at":"2026-08-04T19:59:31.688526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.819527Z","title":"Ghosh and A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.819527Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:71abf6c48306ac04860ae21ad213acc31ccd0e9d17a22c982d6a79ba34e97d44","observation_id":"bf268ded-2e1a-4d72-bd74-f93353855218","resolution":{"observed_at":"2026-08-04T19:59:31.819527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.990501Z","title":"Tiam - a metric for evaluating alignment in text- to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.990501Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:d298b59841b1892710b3a0d990f1b6c702398c1e3c6fc3432d962790aaf98748","observation_id":"0ebd14a9-d23e-420f-b2f8-17859a48516b","resolution":{"observed_at":"2026-08-04T19:59:31.990501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00997","last_updated":"2024-11-01T19:41:28Z","snapshot_observed_at":"2026-08-16T13:03:40.806634Z","submitted_at":"2024-11-01T19:41:28Z","title":"Identifying Implicit Social Biases in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00997","snapshot_observed_at":"2026-08-04T19:59:32.033940Z","title":"Hamidieh, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.033940Z"},"links":{"cited_paper":"/paper/2411.00997","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:cc7d6426f08710424529d5db57a353289d9a7f2b30a6bce2db2781efa6e87b50","observation_id":"573cc18c-e153-4aa5-9451-413924bd9151","resolution":{"observed_at":"2026-08-04T19:59:32.033940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-04T19:59:32.037428Z","title":"Hessel, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.037428Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:fd7727a5e736ce441f6ecbd96c3c60f09f06d3b6f5c9f8e3bf98ec279c82ef40","observation_id":"bea47ca7-3a83-499c-b14e-e4876a7cd95f","resolution":{"observed_at":"2026-08-04T19:59:32.037428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.041162Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.041162Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:f94d7560b323e8836a5fa74399e3d803e964f2a5b2a4a9b11223d91fd0d77920","observation_id":"8d74983c-a919-460e-9f64-e3fd7bf8a8d1","resolution":{"observed_at":"2026-08-04T19:59:32.041162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11897","last_updated":"2023-08-17T21:45:52Z","snapshot_observed_at":"2026-08-16T15:46:31.920890Z","submitted_at":"2023-03-21T14:41:02Z","title":"TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11897","snapshot_observed_at":"2026-08-04T19:59:32.044233Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering.arXiv preprint arXiv:2303.11897, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.044233Z"},"links":{"cited_paper":"/paper/2303.11897","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:7536929cdbf10039558b86bc29cbe0efc6b7112412136dd655d3fae2c832fa52","observation_id":"e75287e3-5e9d-47c4-a4c7-88e450328cb7","resolution":{"observed_at":"2026-08-04T19:59:32.044233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.047680Z","title":"The platonic representation hypothesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.047680Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:f8b34f67d0f97947fdede5ea48ce47dd82cf7372446c7425b64d3c50737b3ebf","observation_id":"f9db45c6-f7d3-4417-9b63-288275eabe67","resolution":{"observed_at":"2026-08-04T19:59:32.047680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.050946Z","title":"Open- clip, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.050946Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:36921c680066a78cd1a493403c73cc05f3e843ad40c8b58f5d6dce1876ec97b5","observation_id":"e55b4387-1553-4dc5-a1fa-aa39c0951488","resolution":{"observed_at":"2026-08-04T19:59:32.050946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.053809Z","title":"Building and better understanding vision- language models: insights and future directions., 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.053809Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:9725ad34c5102f4ab1ecb69270e8bec227d65d29719353be75c01fa89578ed2a","observation_id":"66c8cbd8-6895-4518-9141-9f6df24f13ca","resolution":{"observed_at":"2026-08-04T19:59:32.053809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.056711Z","title":"Holis- tic evaluation of text-to-image models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.056711Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:ea7487fd61d73be735b875cc5cb04f84e87409baeb04d0653ec4bbe9ff145c72","observation_id":"e8659c36-7678-4992-99a1-1dca0441ace6","resolution":{"observed_at":"2026-08-04T19:59:32.056711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.059366Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image genera- tion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.059366Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:f9cc26af346aa61fc00998424e0c40663971ea054a510df0796cbb7fdb39635b","observation_id":"d07116be-2f74-448a-b26f-3fdb1ada69bb","resolution":{"observed_at":"2026-08-04T19:59:32.059366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.061975Z","title":"Sdxl- lightning: Progressive adversarial diffusion distillation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.061975Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:189510a56d135c0ac44ec5b05e70bb2597c3b5407592b971acdaa01ae2761240","observation_id":"0a15c961-a024-4cae-9d5e-7aa955d8f3a1","resolution":{"observed_at":"2026-08-04T19:59:32.061975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.064740Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.064740Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:f40a82015a4027e758795661e7013819ea90da30f0e6fd162a8fa538d9c1b901","observation_id":"a02f7ee7-a224-455c-9956-212f628ceef1","resolution":{"observed_at":"2026-08-04T19:59:32.064740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05217","last_updated":"2026-04-11T14:28:03Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:21:46Z","title":"Organizing Unstructured Image Collections using Natural Language","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05217","snapshot_observed_at":"2026-08-04T19:59:32.067260Z","title":"Organizing unstructured im- age collections using natural language.arXiv preprint arXiv:2410.05217, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.067260Z"},"links":{"cited_paper":"/paper/2410.05217","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:0f5e28b26f1d66efb8b1a689dc4ad1cb3e7241370a19032158d5acea963fa87e","observation_id":"171b2240-bc8f-4a71-9800-182e1ed4b7c4","resolution":{"observed_at":"2026-08-04T19:59:32.067260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.070457Z","title":"Stable bias: Analyzing soci- etal representations in diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.070457Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:1ba98ff65ccd7c673caed8678af21982b69a844bdaf25bed4e2d5bba121f4911","observation_id":"d14f0be7-c498-4e5f-8451-4601b979c91a","resolution":{"observed_at":"2026-08-04T19:59:32.070457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.073286Z","title":"Hello gpt-4o.https : / / openai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.073286Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:3447edfe367daa0f211cf19ed656223cbc7d34958f315db25b0e63046834fe70","observation_id":"aebf6db7-c0ea-4aa6-a4b4-213acf902880","resolution":{"observed_at":"2026-08-04T19:59:32.073286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.075920Z","title":"Benchmark for compositional text- to-image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.075920Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:4fdd5a7f60a4149c03f683758dcb7cdf33a622d2dc49125b27069d80a872a75f","observation_id":"6df17b41-fbad-4187-ad41-e67b5d501381","resolution":{"observed_at":"2026-08-04T19:59:32.075920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.078562Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.078562Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:e98ebda6e0e6d72c2b70292e8ff568eedb0451ff9739a495312a24e83f5b32cf","observation_id":"f54ee6c5-47e8-43c4-80ad-90b76730763a","resolution":{"observed_at":"2026-08-04T19:59:32.078562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-08-17T05:51:02.087480Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-04T19:59:32.081276Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.arXiv preprint arXiv:2205.11487, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.081276Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:af7c75927bfb09093f0ef7ca96afc2ca6362d4f062d1ab2a9b514e5d4f5dc6c5","observation_id":"21388654-3437-4853-9b88-d3721b64b3c5","resolution":{"observed_at":"2026-08-04T19:59:32.081276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.084590Z","title":"Improved techniques for training gans","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.084590Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:c3750fe7863789282b32c86eef6cdaf7e1eac971e17913fbf098ead3be78c0f4","observation_id":"ffdd2c57-7085-4399-acc6-6a47636313b7","resolution":{"observed_at":"2026-08-04T19:59:32.084590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.087095Z","title":"LAION-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.087095Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:09718ec7bba44342669b84dd9fc4c7bb0ed2d5829c4262ac6208625a3fa5f189","observation_id":"f12b4483-ce9a-46e1-8933-4b9ef7e9cbfc","resolution":{"observed_at":"2026-08-04T19:59:32.087095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.089618Z","title":"A statistical interpretation of term specificity and its application in retrieval.Journal of Doc- umentation, 28(1):11–21, 1972","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.089618Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:089a6969b5120ca2946bd7b40c2ab67415fc12f9dd7c3245cddfa520a7bb229e","observation_id":"32a75aa1-daab-46ca-a27b-a5d9e181727a","resolution":{"observed_at":"2026-08-04T19:59:32.089618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.092171Z","title":"Smith, Luke Zettlemoyer, and Tao Yu","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.092171Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:9fa7596ade9f8241dbbd2093e0d2b13aa3faa784039dee9db2dadae22a6ac20f","observation_id":"78791598-ae31-4022-b818-64b9a3878497","resolution":{"observed_at":"2026-08-04T19:59:32.092171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.094821Z","title":"Mass- producing failures of multimodal systems with language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.094821Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:622a4fc5814d951000647fceb48baf897ef0a74cc65b7c6fd1aa2ce991674815","observation_id":"7be95edd-8ab4-421b-8e90-478a11565aab","resolution":{"observed_at":"2026-08-04T19:59:32.094821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.097314Z","title":"T2iat: Measuring valence and stereotypical biases in text-to-image generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.097314Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:a09cdd18889dc94d9b46b42574c6212184e28d954e1f3ab34eea464e6edddf63","observation_id":"4f259602-53d9-4f67-a401-16dbfe2b7ad2","resolution":{"observed_at":"2026-08-04T19:59:32.097314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.099866Z","title":"To- wards fairness in visual recognition: Effective strategies for bias mitigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.099866Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:4f87ed1e1c2e722fd6754ccbdddb6079a48728b3367b58de4eb73ae0c9581aa4","observation_id":"34019dc5-ca7b-4465-8223-ecac12c6e0be","resolution":{"observed_at":"2026-08-04T19:59:32.099866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-18T22:18:02.034966Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-04T19:59:32.102328Z","title":"Menacing appearance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.102328Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:f281ab400c8cbbfeab711e61a6009a83d30ccc836a872813eaaa096d13e03dc1","observation_id":"d2e44fef-7cac-4680-9705-e9a6e449ee52","resolution":{"observed_at":"2026-08-04T19:59:32.102328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.105888Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.105888Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:f1a367585e4b5862284574451fc4d987ec6447a471cc61a855eacd949d6aa3fb","observation_id":"921c4e1d-f5e3-4d66-962b-090e29092c7f","resolution":{"observed_at":"2026-08-04T19:59:32.105888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.108777Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.108777Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:b79e350cd6cbad868cc1db72cacd2326e5afb8064556ca52fd4cbd827b409890","observation_id":"3af71953-bca0-4f5c-9321-3df22450f3d9","resolution":{"observed_at":"2026-08-04T19:59:32.108777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.112135Z","title":"- A rating of 1 means the two attributes are not similar at all, and images containing one attribute would not contain the other","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.112135Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:964cfee40f908c72370833474d34d13ad2b13b3bcb1aa3e496a97d8d4f408e04","observation_id":"affaa59b-5103-4c11-a36f-7bb0f6e1b690","resolution":{"observed_at":"2026-08-04T19:59:32.112135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.114861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.114861Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:906eab2d33a6b8d461b2f1e10ff8b232f3b21445e6f745eb1aa4f6c3c36ddc86","observation_id":"409bd186-dbb0-4374-a5e7-ee56b3f829e9","resolution":{"observed_at":"2026-08-04T19:59:32.114861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.117776Z","title":"vines” Prompt Description: “technology","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.117776Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:123162e2785f006d7a992ac2ec42c2a708f484b177d09db9d984c5b4f387c20c","observation_id":"6c7f7fba-7e33-4005-a19c-60163e70ba71","resolution":{"observed_at":"2026-08-04T19:59:32.117776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.121160Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.121160Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:6ba72ef5aa6cda520981dd6d4253f19fc79ee00c850f0fe1f7d62c7774d43cdd","observation_id":"70ef2912-9052-44cf-a71e-640cf2c80661","resolution":{"observed_at":"2026-08-04T19:59:32.121160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.123895Z","title":"Menacing appear- ance","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.123895Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:ecf49af6568aa98cabe5adc7ce3fb9902013175417f0852f869a86be03485f68","observation_id":"e3b5eab2-3813-4db2-a236-f302e8333a3f","resolution":{"observed_at":"2026-08-04T19:59:32.123895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T02:14:32.927502Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2509.08940."}