{"as_of":"2026-08-22T10:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3bcbd46a2d897e975e88251236a8d28eb1058b4b1b5dc4f5d41472e9122a971","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:42:47.519295Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T17:21:37.570778Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T00:17:29.054872Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"cited_work":{"arxiv_id":"2512.08505","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.08505","snapshot_observed_at":"2026-07-03T00:17:29.054872Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","venue":"cs.CV","work_id":"470fcbfd-0ee4-424d-ad8c-f1852366dee6","year":2025},"citing_paper":{"arxiv_id":"2606.09601","last_updated":"2026-06-09T16:00:11Z","snapshot_observed_at":"2026-08-12T12:29:47.750624Z","submitted_at":"2026-06-08T15:10:25Z","title":"Assessing Sample Quality in Conditional Generation under Compositional Shift","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T17:21:37.570778Z"},"links":{"cited_paper":"/paper/2512.08505","citing_paper":"/paper/2606.09601"},"observation_digest":"sha256:0a209b91d8f7793c47873aadb17807f81c5f17b3a92074efaef5e063d5feb5d6","observation_id":"2a6d5fb0-c158-4713-81a5-0baf1e9c690f","resolution":{"observed_at":"2026-07-03T00:17:29.056144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2512.08505/citation-record","integrity":"/paper/2512.08505/integrity","json":"/paper/2512.08505/citation-record.json","paper":"/paper/2512.08505"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:41.538992Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:41.538992Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:d83bc90b536b902d5819834494b42a6b0606cd96fd632708463f4799589b6959","observation_id":"0395128c-1357-4672-861e-97a360a0a8e9","resolution":{"observed_at":"2026-08-03T17:42:41.538992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:41.686457Z","title":"Imagen 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:41.686457Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:bcf1ed8e86a707cc8247956cecec66a4b35febb9d555d68355a04a989a165d4c","observation_id":"95dd2ad9-901d-4648-9c4c-9f96e03f0443","resolution":{"observed_at":"2026-08-03T17:42:41.686457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08455","last_updated":"2025-03-11T14:04:29Z","snapshot_observed_at":"2026-08-21T17:38:45.666107Z","submitted_at":"2025-03-11T14:04:29Z","title":"Controlling Latent Diffusion Using Latent CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08455","snapshot_observed_at":"2026-08-03T17:42:41.792537Z","title":"Controlling latent diffusion us- ing latent CLIP.CoRR, abs/2503.08455, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:41.792537Z"},"links":{"cited_paper":"/paper/2503.08455","citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:dab4facbaa321d32392f0ffa7007f6e45900dc46dee4ff352e1ff34736f57ced","observation_id":"e641d3c0-800b-4ac3-9c67-159cee1b7612","resolution":{"observed_at":"2026-08-03T17:42:41.792537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:41.883627Z","title":"Natural language in- ference improves compositionality in vision-language mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:41.883627Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:ac269b880d5b2e05bd9aecaa3262ddf931338af106b407dbe0d907e7f9f38e47","observation_id":"d18a8c6a-0ad5-4106-b234-d63bfaee54fd","resolution":{"observed_at":"2026-08-03T17:42:41.883627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:41.995177Z","title":"Conceptual 12m: Pushing web-scale image-text pre- training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:41.995177Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:6bcb4fd020ccd626676486a21684cac6c6d74df5441af55f03034d90bc24ea48","observation_id":"d1c07e8f-c5cc-450b-9232-388adc718de1","resolution":{"observed_at":"2026-08-03T17:42:41.995177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:42.085964Z","title":"The hidden language of diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:42.085964Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:da88cc19db9f1b253949d2783820ac52982b1dbc93453eed659b5d95a6e3a41a","observation_id":"d93c754c-9528-4284-b1e0-b1fa696d4bb1","resolution":{"observed_at":"2026-08-03T17:42:42.085964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:42.179451Z","title":"Visual pro- gramming for step-by-step text-to-image generation and evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:42.179451Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:353af632c53e29cc8cdefac176d6fe3c48bac0be3f8a2d12d729afbe77d4d687","observation_id":"3dc468c2-5ef7-4a17-9af7-f7a0579944ef","resolution":{"observed_at":"2026-08-03T17:42:42.179451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:42.239832Z","title":"Prompt tuning inversion for text-driven image editing using diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:42.239832Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:e7b3dc56b4cbde79122aadd118fb7001e4b79cb32a04baaf0becfd6bd099f85b","observation_id":"7067c17b-2878-4b86-a5e5-4c2084c7f7d3","resolution":{"observed_at":"2026-08-03T17:42:42.239832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:42.316925Z","title":"conceptual-captions-cc12m- llavanext.https://huggingface.co/datasets/ CaptionEmporium / conceptual - captions - cc12m-llavanext, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:42.316925Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:ec26a566c37f7dfc784e321c2ab6bf917cfc1db6061b49aed293c57da19445ca","observation_id":"76c8c5cc-00cb-48fa-8357-a9af1030f2bb","resolution":{"observed_at":"2026-08-03T17:42:42.316925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:42.385164Z","title":"Scaling rec- tified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:42.385164Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:c05f5499292bcb2b6f9ce6ac5943e5e45380699792249ac8adb35662a837a72a","observation_id":"047f19df-285a-4f12-b84e-d65f5988be04","resolution":{"observed_at":"2026-08-03T17:42:42.385164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:42.462531Z","title":"W AFFLE: multimodal floorplan understand- ing in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:42.462531Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:ae4b93a3020ef6eb90a0ecb14533997f3f33b04bc1dd3ed0bbd61864d8103ffd","observation_id":"a2a87ed1-974c-490c-8ec5-23e61722f996","resolution":{"observed_at":"2026-08-03T17:42:42.462531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:42.543822Z","title":"A large scale analysis of gender biases in text- to-image generative models.CoRR, abs/2503.23398, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:42.543822Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:4fd3fbd3584db454dddc67204778d54fbc69285a4fb7b9a555892aae2b22d30a","observation_id":"b20d284a-67ce-4b45-9d46-47f1bf61cd31","resolution":{"observed_at":"2026-08-03T17:42:42.543822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:42.679901Z","title":"Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, and Yoshua Bengio","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:42.679901Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:de523a323012e117a0b917f4151b9e01535199e51ca72a4970ea22547041efbc","observation_id":"e75551d3-a408-44c6-b93c-1c017d0a1f53","resolution":{"observed_at":"2026-08-03T17:42:42.679901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:42.796165Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:42.796165Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:05b03d671469dc072dca95a5b3e1df9355ada1bd53c24b3683a8a85e62661cb4","observation_id":"caba42ec-6237-4680-8097-afb840c3f172","resolution":{"observed_at":"2026-08-03T17:42:42.796165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:42.867695Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:42.867695Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:770e4cba44107973295df14c4e4597b20dff3b108b08698f6e8aabd8124c22d8","observation_id":"751a7e2f-28b5-4050-a817-8220e971f0c1","resolution":{"observed_at":"2026-08-03T17:42:42.867695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:43.017973Z","title":"Denoising Dif- fusion Probabilistic Models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:43.017973Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:f1931999051e5d12d9fe8b8695dc8416a23c6fdfdf277100491d9722c8ff245b","observation_id":"96922295-a8d6-4e52-8d30-21bfadcefc5a","resolution":{"observed_at":"2026-08-03T17:42:43.017973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:43.101096Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:43.101096Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:3f45b4968611eec835a58ebff75bf558fa0a569a84afe982a610ea8832c3962f","observation_id":"0c71f37b-6b80-4140-9174-38bb78ac7d80","resolution":{"observed_at":"2026-08-03T17:42:43.101096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:43.165022Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:43.165022Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:d29efe95fca1534ffc77730e3fdeba3accf591d6eb5082d8a74cdde5942159c9","observation_id":"1383ef8d-d2b1-47c7-ae06-e603f09bdf19","resolution":{"observed_at":"2026-08-03T17:42:43.165022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:43.273452Z","title":"Vi- sual hallucinations of multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:43.273452Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:3cdb3b7c2b847c13f7b3e6347f38473abbd624c7d91f23181c3ff0cc5aaddc7c","observation_id":"4a359c2e-82ac-41be-991b-50ce1fd44617","resolution":{"observed_at":"2026-08-03T17:42:43.273452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:43.387476Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:43.387476Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:af2ed4479b63849c1ffbf7ccd72f167a2524175fcc1823279a169114c27fec57","observation_id":"c3f43404-8aa9-42c4-824a-42c258e14c35","resolution":{"observed_at":"2026-08-03T17:42:43.387476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-03T17:42:43.495579Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:43.495579Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:de07d2c0d41d50be6e3cb128ad6da58e27cdd904dbcf49cdab934d6aed60c593","observation_id":"8e18b373-1a08-4bbd-ad84-10ff5e7d8a89","resolution":{"observed_at":"2026-08-03T17:42:43.495579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:43.639090Z","title":"Auto-encoding varia- tional bayes, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:43.639090Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:36230dd923428c92127d84e4bb40179f438557668c56154acfa4d83e8f9dc241","observation_id":"49174265-638a-43a8-bb78-12e567db0ee4","resolution":{"observed_at":"2026-08-03T17:42:43.639090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:43.758276Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:43.758276Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:57330eb8375af9bc9647d9ffa4be9fe208506e09f0c1100269845e274a2906b8","observation_id":"399e3402-6d56-4ec0-b8bf-b33a71a54e9a","resolution":{"observed_at":"2026-08-03T17:42:43.758276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-08-18T03:21:35.557463Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-03T17:42:43.835726Z","title":"Genai-bench: Evaluat- ing and improving compositional text-to-visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:43.835726Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:3fd0a5ad5d7abc383f8e1646d789bafc2f79393e1bd67d6e1ec6b105b0cbfdc1","observation_id":"9e2288a9-e8a4-4b19-85a0-1741d6505915","resolution":{"observed_at":"2026-08-03T17:42:43.835726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:43.942840Z","title":"Crowdclip: Unsupervised crowd counting via vision-language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:43.942840Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:0787fa499e88ae70f57d4828c1006ce38f355765ae37aaea838b74cf866b7089","observation_id":"a0197877-0fe8-44a2-b3b1-eb8d4691a980","resolution":{"observed_at":"2026-08-03T17:42:43.942840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:44.059757Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:44.059757Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:31d4db8a2f4718013ee1a7fbd2a356b7056eb4990cbf0ab484c57e6a8c7393cb","observation_id":"231b8c3b-48fd-44cd-9ec0-42b48704ff58","resolution":{"observed_at":"2026-08-03T17:42:44.059757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:44.145308Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:44.145308Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:a4407c78c45ec5e1f95774835158f702531ff740775920eca7a5af5501f3e1c5","observation_id":"31b088cf-2787-4f5b-9b81-c8fe2ac797d6","resolution":{"observed_at":"2026-08-03T17:42:44.145308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:44.216055Z","title":"Jaakkola, Xuhui Jia, and Saining Xie","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:44.216055Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:ca376b161afb2c2c9695b2c31c3f3436b7335ec09ce48b02fd88425e8e7cfcbc","observation_id":"9ff244e6-d051-4706-9700-4f989150a652","resolution":{"observed_at":"2026-08-03T17:42:44.216055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:44.320322Z","title":"Teaching CLIP to count to ten","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:44.320322Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:be6e4481b3a02b6cc284c6b3c6621028120c49b3ff6dbb2d11b6bcaf831b71d8","observation_id":"421cb7b0-11b4-4bf7-8802-ca588f841bd7","resolution":{"observed_at":"2026-08-03T17:42:44.320322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:44.396799Z","title":"Dynamic classifier-free diffusion guidance via online feedback.CoRR, abs/2509.16131, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:44.396799Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:678cbb9902db96f0cd175b8ab1a8d904b35d73ced52af11e4e0cd546d5e40c61","observation_id":"f3c69b6a-0519-4606-97e1-64f34e41531f","resolution":{"observed_at":"2026-08-03T17:42:44.396799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:44.477545Z","title":"Know ”no” better: A data- driven approach for enhancing negation awareness in clip","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:44.477545Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:ba9fc7351a6660279c66adc2eaa74abce14d8a4d0a2d464958615003a68a15a7","observation_id":"3a35a985-9a2c-4f3d-8c30-141be8145d57","resolution":{"observed_at":"2026-08-03T17:42:44.477545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:44.581515Z","title":"Understanding the latent space of dif- fusion models through the lens of riemannian geometry","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:44.581515Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:3497b4259418c2df7916b24a6b191c00140cd2fcb35f349c2f103bbd8ed4e231","observation_id":"dadeb2c0-1ee5-44c6-9cac-0af519e77692","resolution":{"observed_at":"2026-08-03T17:42:44.581515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:44.664646Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:44.664646Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:9ba53fc98605d07316376c7a189b847c98cb2842773270c08ebcf36477f5e17e","observation_id":"0763b12a-7f0c-4064-8b3a-7ed3b413be86","resolution":{"observed_at":"2026-08-03T17:42:44.664646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:44.744314Z","title":"Seeing what mat- ters: Empowering CLIP with patch generation-to-selection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:44.744314Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:78f0998b1ab2c07b96a227cf570560a5c9b6ae9f293f1633a5a68501cea980ca","observation_id":"db2d023f-35f5-4b32-990b-d8c11bf1d091","resolution":{"observed_at":"2026-08-03T17:42:44.744314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:44.805647Z","title":"SDXL: Improving Latent Diffusion Mod- els for High-Resolution Image Synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:44.805647Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:979cf66a5ac517d646347106e8973657e49d4ac8aed46a9f48c93ed738bad540","observation_id":"be42a573-1fd4-4c83-85a2-5007808bfd0d","resolution":{"observed_at":"2026-08-03T17:42:44.805647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:44.921513Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:44.921513Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:28f0a23e89367cb80e1eac681e5c09676d65d3c041382eb36af561862ec23d55","observation_id":"abb01e2e-3132-45d5-9d30-5032d9405dbb","resolution":{"observed_at":"2026-08-03T17:42:44.921513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:45.034164Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.034164Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:b7da87f4539f5eb531cbc0a716f575f09b4b2cf0d715df41f7cea5188d14b588","observation_id":"f3b2caac-2d11-4db7-b48e-45e8da855029","resolution":{"observed_at":"2026-08-03T17:42:45.034164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-03T17:42:45.118237Z","title":"Hierarchical text-conditional image gener- ation with clip latents.arXiv preprint arXiv:2204.06125, 1 (2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.118237Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:fda5788f0823e3e3a0f9c99f90a28c4d24809a5139a9a5613e45bf8f9bf4c5da","observation_id":"6ff6ad89-c252-4bd2-9eba-60beae412ffb","resolution":{"observed_at":"2026-08-03T17:42:45.118237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:45.178558Z","title":"Contrastive sequential-diffusion learn- ing: Non-linear and multi-scene instructional video synthe- sis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.178558Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:a38aa2cd3b2e8f90634d93b2a86834fa68aab36d567da74a66235f2f3c80eeaa","observation_id":"681b55b6-b14d-4277-895f-17966a2200fb","resolution":{"observed_at":"2026-08-03T17:42:45.178558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:45.302760Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.302760Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:7577fdea9d1e08e9f4097285d761270cc9e01c1ed5b126ec1f5eb867a3586cf4","observation_id":"5d532076-0834-4212-b118-922c42aa6257","resolution":{"observed_at":"2026-08-03T17:42:45.302760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:45.378085Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.378085Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:cc2d1c4da2c0aa4808ae9601d57a4976878ac8652daca2a2422834eb4c09a138","observation_id":"c202dba4-bd51-4a02-be43-2888b052a6a8","resolution":{"observed_at":"2026-08-03T17:42:45.378085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:45.431054Z","title":"Denton, Seyed Kamyar Seyed Ghasemipour, Raphael Gontijo Lopes, Burcu Karagol Ayan, Tim Salimans, Jonathan Ho, David J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.431054Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:4a7ef9701385d9261f4825e3a2faa9cfb7bfb242d625701b45e62d3ce86a1c70","observation_id":"8001f49e-2a7f-42cc-a2e9-be7acb5a3311","resolution":{"observed_at":"2026-08-03T17:42:45.431054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:45.494569Z","title":"Fast high- resolution image synthesis with latent adversarial diffusion distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.494569Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:1454f2ef7548e9cc2abeb13081bf08772865f29fb8eeddcb5489e39a539f8a84","observation_id":"995c11eb-de6c-44cc-bfab-e8b0307c0ade","resolution":{"observed_at":"2026-08-03T17:42:45.494569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:45.555854Z","title":"Proposalclip: Unsupervised open-category object proposal generation via exploiting CLIP cues","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.555854Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:a910af61ddaf0fc2ea65dedbaf9ea971b14086d117018fd13c31dfc9e56cd71c","observation_id":"1d0e75c2-5898-4b07-bebc-a94fae7ab41e","resolution":{"observed_at":"2026-08-03T17:42:45.555854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:45.615933Z","title":"Generalizing alignment paradigm of text-to-image genera- tion with preferences through f-divergence minimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.615933Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:307e76ec14117a667e7be4d3601dff56c5b17fafd7a7381e094c4191beb2b776","observation_id":"9b4e1ed2-d1f0-42c3-81ea-59cb3b404f96","resolution":{"observed_at":"2026-08-03T17:42:45.615933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-03T17:42:45.715373Z","title":"Repre- sentation learning with contrastive predictive coding.CoRR, abs/1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.715373Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:280da33173c39d3730a4b1271df9043fd77f663b21891b16a43df45a969eb113","observation_id":"cef10814-e137-4ea1-9f05-8eae77c4ed4e","resolution":{"observed_at":"2026-08-03T17:42:45.715373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:45.791008Z","title":"Explaining the SDXL la- tent space.https : / / huggingface","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.791008Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:2bc717ee1cee5315c6728ca60da961582aac4067039702f0c6373ccdd3b695d6","observation_id":"15def88c-675d-4a4f-afbe-7372394baa26","resolution":{"observed_at":"2026-08-03T17:42:45.791008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:45.846834Z","title":"Wang, Songwei Ge, Tero Karras, Ming-Yu Liu, and Yogesh Balaji","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.846834Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:c155c7eed90751780440f2685e7ce8e75453ae60f945f25af6cfa99e2ac4d31a","observation_id":"f3b47dc0-083c-4d51-9fa2-ba81dc74d906","resolution":{"observed_at":"2026-08-03T17:42:45.846834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:45.906111Z","title":"DIRE for diffusion-generated image detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:45.906111Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:a2a36ce16f3e42d342b85224833ed75590305809bd34829a7c3fc34ebf94bc7d","observation_id":"88f45ffb-8ef8-4d48-a899-14bb0e583a1a","resolution":{"observed_at":"2026-08-03T17:42:45.906111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:46.000697Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:46.000697Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:c7851e5b06f97a3eaee124f98a63065907d561f39c8f90ab96959d7cb10866c5","observation_id":"496e8ca8-7542-4cbe-be1e-1ba8961f9ac2","resolution":{"observed_at":"2026-08-03T17:42:46.000697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:46.018049Z","title":"Good seed makes a good crop: Discovering secret seeds in text-to- image diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:46.018049Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:7edfb6b9442da86e85b206ae10005df4245eb9c9c6c7d5fee899f21fc6415221","observation_id":"6afb50b1-ce2e-49c1-b527-b06f1bdda2f5","resolution":{"observed_at":"2026-08-03T17:42:46.018049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16033","last_updated":"2025-06-10T18:32:17Z","snapshot_observed_at":"2026-08-17T17:43:42.512008Z","submitted_at":"2025-02-22T01:52:37Z","title":"Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16033","snapshot_observed_at":"2026-08-03T17:42:46.128986Z","title":"Multi- modal inconsistency reasoning (MMIR): A new benchmark for multimodal reasoning models.CoRR, abs/2502.16033,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:46.128986Z"},"links":{"cited_paper":"/paper/2502.16033","citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:cb343a2c44d4794860cd79e3eec96a1e78dc193b6c12fb4016c5ed0552e5b5c7","observation_id":"45c92c83-0408-4789-82f4-6fc233b19171","resolution":{"observed_at":"2026-08-03T17:42:46.128986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:46.241114Z","title":"Diffusion models: A comprehensive survey of methods and applications.ACM computing surveys, 56(4): 1–39, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:46.241114Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:2d2ec362e26590de69fb520feaa1ce69e69d2651c192f9dff3ca31b197e093b6","observation_id":"922598df-8391-4fd1-abde-aab6b70b7716","resolution":{"observed_at":"2026-08-03T17:42:46.241114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:46.342889Z","title":"Object-aware inversion and re- assembly for image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:46.342889Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:6df49d334fbe12b0b174fac89a8502ac09b84802ad085921b7a5764c83a85182","observation_id":"4658c2ee-3d59-4420-afd5-65465441b7c7","resolution":{"observed_at":"2026-08-03T17:42:46.342889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:46.421924Z","title":"What you see is what you read? improving text- image alignment evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:46.421924Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:3bbcfd8c4d23227495b0675afd6633087bfe37ac637a834a24d67e603cdd89dc","observation_id":"05c79a39-fed9-4d1d-8acc-ae3225567327","resolution":{"observed_at":"2026-08-03T17:42:46.421924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:46.584942Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:46.584942Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:7968ecebc8701d30698dad6a726f3f6157cc9a548da5daefbd2c7902db7e156d","observation_id":"db63a228-8628-43d1-b1a0-ee7a7a5bd8d6","resolution":{"observed_at":"2026-08-03T17:42:46.584942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:46.705248Z","title":"Long-clip: Unlocking the long-text capabil- ity of CLIP","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:46.705248Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:fd3ea9ab3df55e7cbf045d38637aa57a659b73bc2c8f124a613dc7016023243d","observation_id":"6e3403d7-df90-45ae-b584-b4d393019349","resolution":{"observed_at":"2026-08-03T17:42:46.705248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:46.780282Z","title":"Let’s verify and reinforce image gener- ation step by step","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:46.780282Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:b3d7d081fd1334c765ff4d363a6ec529d36ba9689f5b5dad30c1344603b9104f","observation_id":"2529d679-a6e7-4502-9442-45ed8355261e","resolution":{"observed_at":"2026-08-03T17:42:46.780282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:46.928724Z","title":"Dis- tinctive image captioning via CLIP guided group optimiza- tion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:46.928724Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:eaf0d1bf723bca5a791acdb5245faff23321ffa9c504a0afa7c51f569c745b21","observation_id":"3f6003db-be9c-4aef-adc5-d3f6714cc218","resolution":{"observed_at":"2026-08-03T17:42:46.928724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:47.054752Z","title":"Investigating and mitigating the multimodal hallucination snowballing in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:47.054752Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:b91c011cd7f93eeb5578a2c9cbbd68dbd4519c961f1d6fdb4724ff8c34f124ea","observation_id":"59ae0145-59d8-41d3-8c90-68bbe2fb9599","resolution":{"observed_at":"2026-08-03T17:42:47.054752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:47.190226Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:47.190226Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:6894da284261b3ee4f7d54fd94a7f3f88c618af3902cb2d32fccb1990d4aee77","observation_id":"07542c4f-819b-41bc-b4b5-c9517346f555","resolution":{"observed_at":"2026-08-03T17:42:47.190226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:47.314365Z","title":"This modification should render that specific aspect non-factual or illogical within the context of the original sentence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:47.314365Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:60176053879b00dd56d69fe6847f95d521d2a0a18862113bc9f6805dc12d3054","observation_id":"0f158136-4bdb-44e1-82f2-0412013a93ce","resolution":{"observed_at":"2026-08-03T17:42:47.314365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:47.413249Z","title":"No additional text, explanations, or formatting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:47.413249Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:69a074cc8a3f5f0b8462dd838ed41f6a2103535bc1db235ef95ace39c75ef86c","observation_id":"f52c40aa-f61b-49fb-9e61-0b431463d43a","resolution":{"observed_at":"2026-08-03T17:42:47.413249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:42:47.519295Z","title":"Change the {ERROR_TYPE} in the following PROMPT: PROMPT: {PROMPT} B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T17:42:47.519295Z"},"links":{"citing_paper":"/paper/2512.08505"},"observation_digest":"sha256:07bc01f7b6178539b23a8e3511fa4dc427b5536e04a07e5f6268543a950ea1d7","observation_id":"4cc92bc9-05e4-4a85-84c2-b5f79d1c88e9","resolution":{"observed_at":"2026-08-03T17:42:47.519295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.08505","last_updated":"2026-06-28T19:01:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:22:28.683067Z","submitted_at":"2025-12-09T11:45:01Z","title":"Early Estimation of Language to Latent Alignment in Diffusion Models"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2512.08505."}