{"as_of":"2026-08-14T14:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73714ec5ce57288d76a7d0f9361372454ac928385ca3abf195c44b6f6ffffbee","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:20:51.244779Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08210/citation-record","integrity":"/paper/2506.08210/integrity","json":"/paper/2506.08210/citation-record.json","paper":"/paper/2506.08210"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.07126","last_updated":"2024-11-11T16:58:31Z","snapshot_observed_at":"2026-08-12T22:03:10.373420Z","submitted_at":"2024-11-11T16:58:31Z","title":"Edify Image: High-Quality Image Generation with Pixel Space Laplacian Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07126","snapshot_observed_at":"2026-08-07T05:20:50.977218Z","title":"Edify image: High-quality im- age generation with pixel space laplacian diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.977218Z"},"links":{"cited_paper":"/paper/2411.07126","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:5f3383bc13c118c781856e539e4756c16a830d1ace0570daf88c193aa9d2f8d9","observation_id":"398c47e8-fb10-4e8a-a0e9-f818b192f0c9","resolution":{"observed_at":"2026-08-07T05:20:50.977218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T05:20:50.982334Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.982334Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:1e4aeb7522b91471afe8ebdcab69ce0a80f1bfdb32a188df6d39c31a08b5e92c","observation_id":"aa460d2e-26ff-4f00-8a19-b5c09a34d2db","resolution":{"observed_at":"2026-08-07T05:20:50.982334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:50.986447Z","title":"Imagen 3.arXiv preprint arXiv:2408.07009, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.986447Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:c43165770cc46aab62353d29664ce8ee17eefa31c4765d17f390c9439a835744","observation_id":"61d7c6d3-68f9-41d1-a5cb-65495b3ba30f","resolution":{"observed_at":"2026-08-07T05:20:50.986447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05961","last_updated":"2024-08-21T22:46:05Z","snapshot_observed_at":"2026-08-13T00:34:33.528585Z","submitted_at":"2024-04-09T02:51:05Z","title":"LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05961","snapshot_observed_at":"2026-08-07T05:20:50.990041Z","title":"Llm2vec: Large language models are secretly pow- erful text encoders.arXiv preprint arXiv:2404.05961, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.990041Z"},"links":{"cited_paper":"/paper/2404.05961","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:010b6466b80a05acc5296ad9e6a7ffbd462da32caf9db6b1d57ca46e02c0496e","observation_id":"1634a2a4-269c-4570-bf60-f9799e1fad0e","resolution":{"observed_at":"2026-08-07T05:20:50.990041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18786","last_updated":"2023-05-31T17:55:44Z","snapshot_observed_at":"2026-08-13T11:29:46.092750Z","submitted_at":"2023-05-30T06:40:08Z","title":"Scalable Performance Analysis for Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2305.18786","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18786","snapshot_observed_at":"2026-08-07T05:20:51.591495Z","title":"Scalable Performance Analysis for Vision-Language Models","venue":"cs.CV","work_id":"5cbffe05-6860-4bc6-a0ed-2cc405d12cce","year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.994543Z"},"links":{"cited_paper":"/paper/2305.18786","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:b6844577095f998e8d64fecc40eeccbda5ecead50c024c8b401217f7b0cebd9a","observation_id":"e697754a-d932-4d75-9ef7-6b3d7692d37a","resolution":{"observed_at":"2026-08-07T05:20:51.597266Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T05:20:50.998688Z","title":"PixArt-alpha: Fast Training of Diffu- sion Transformer for Photorealistic Text-to-Image Synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.998688Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:5500eda1cae8ddbcbb56b5f5d0d31d125f8bb42983f10c390ffee630d34d9b77","observation_id":"9b84a85a-28d1-424a-ae5d-98817c55b024","resolution":{"observed_at":"2026-08-07T05:20:50.998688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:52.023339Z","title":"Textdiffuser-2: Unleashing the power of language models for text rendering","venue":null,"work_id":"52d9a996-a0ba-47dd-937e-8dd9e262deea","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.006114Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:68158f53a75f9debbf2111d67af1bb1afe29b440bde15ea06ef4de8ee87537f2","observation_id":"c575c6f6-6984-4190-8a71-a26d056f684d","resolution":{"observed_at":"2026-08-07T05:20:52.027527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-07T05:20:51.010211Z","title":"Bge m3-embedding: Multi- lingual, multi-functionality, multi-granularity text embed- dings through self-knowledge distillation.arXiv preprint arXiv:2402.03216, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.010211Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:5dfd25caabbe69ddb79c070ca3c5f92f21c7699ac1fdaffa78dc8fbfafb466cb","observation_id":"853b019a-3335-47a9-8701-ce431034a2e2","resolution":{"observed_at":"2026-08-07T05:20:51.010211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:52.011768Z","title":"Visual pro- gramming for step-by-step text-to-image generation and evaluation","venue":null,"work_id":"9354e27d-8898-4abf-b99a-2c7a63afa455","year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.014921Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:c7fd072907b4428a5a9135080015bef944900b6cf4935200425b12c4dfc3cd1e","observation_id":"c497bdec-1a28-48ba-876e-9ebb948eda0c","resolution":{"observed_at":"2026-08-07T05:20:52.015758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:52.000288Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"42a203b5-0dbd-4426-922c-f2b3c5c44618","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.018690Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:28afff9cd5673aba022ce7e6e06d2ea3e52d12c8eca6a328e7883b29903a561e","observation_id":"23195d1b-b58d-4436-8aed-e94a525398a1","resolution":{"observed_at":"2026-08-07T05:20:52.004536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02535","last_updated":"2023-12-24T23:11:19Z","snapshot_observed_at":"2026-08-13T15:51:26.424803Z","submitted_at":"2022-09-06T14:36:57Z","title":"Analyzing Transformers in Embedding Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.02535","snapshot_observed_at":"2026-08-07T05:20:51.022450Z","title":"An- alyzing transformers in embedding space.arXiv preprint arXiv:2209.02535, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.022450Z"},"links":{"cited_paper":"/paper/2209.02535","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:0b29284ae6ca72d56de21f81bcaa383916ff8eb75aab6403f4ba9e870c8fb236","observation_id":"9924718c-6b1b-4cff-a924-0ff9529cfff8","resolution":{"observed_at":"2026-08-07T05:20:51.022450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.989746Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"724b367c-ce16-4876-beb6-7e1aac7d67db","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.027375Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:247318b4f490199642a9906cea4360f3103163806597b30425ffe2eb3469e8f5","observation_id":"e5739900-abb2-4b2c-a8d6-cef0fd7ec774","resolution":{"observed_at":"2026-08-07T05:20:51.993821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-13T00:10:49.002216Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-07T05:20:51.030846Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers.arXiv preprint arXiv:2405.05945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.030846Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:81599fc987a3431d7005ebf484c8fce432bbfbf51004a3cecc8bf0e1f07eb98b","observation_id":"becaf3ad-2e97-42fc-9820-e757bec27070","resolution":{"observed_at":"2026-08-07T05:20:51.030846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.978763Z","title":"Visual fact checker: en- abling high-fidelity detailed caption generation","venue":null,"work_id":"57f2ff69-28a5-4e36-869c-0bb678dd0400","year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.034740Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:4e83f1b2c0e6db1f7b42527872dbb3c1c3a21c307c95fc385c7cae4c04e57eff","observation_id":"941aed29-e666-4cc1-ae4c-391ecdcb3f49","resolution":{"observed_at":"2026-08-07T05:20:51.982389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:20:51.038814Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.038814Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:7da448bbcec14357d1a4fbcb76ca98c7c9a76dc74fc7a99af19aec6c75c04062","observation_id":"c4abb752-e600-45c3-8439-85cbfcb3b568","resolution":{"observed_at":"2026-08-07T05:20:51.038814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07614","last_updated":"2024-07-11T11:05:53Z","snapshot_observed_at":"2026-08-12T23:25:03.495443Z","submitted_at":"2024-07-10T12:52:49Z","title":"MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07614","snapshot_observed_at":"2026-08-07T05:20:51.042386Z","title":"Mars: Mixture of auto-regressive mod- els for fine-grained text-to-image synthesis.arXiv preprint arXiv:2407.07614, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.042386Z"},"links":{"cited_paper":"/paper/2407.07614","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:6ac80915bf8ebd7bec7f5757f5d2f86ec6bc0bce9b8afc8e80bd01d8b0d727a4","observation_id":"fbc237b3-b337-479e-8e9a-c9f999690795","resolution":{"observed_at":"2026-08-07T05:20:51.042386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T05:20:51.046257Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning.arXiv preprint arXiv:2104.08718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.046257Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:9f0c4263f48455e2c9f161f2d8b20d1ba0127c740a8b48c3fd6f000cfe7c25c9","observation_id":"ea91496f-857e-48f3-9b51-e200fe3e3686","resolution":{"observed_at":"2026-08-07T05:20:51.046257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.968973Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"f12ea4c2-50ee-4617-8bff-6e8bbc34e196","year":2017},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.051035Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:0702e184628eae70f06271157bde1e1e7831dc36ae79f53567391a0113e47961","observation_id":"6d8bb99b-0573-4499-ae53-3369c5a78347","resolution":{"observed_at":"2026-08-07T05:20:51.972571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T05:20:51.054665Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.054665Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:a044a3546a723da254483add64162583060115b310a96674cf9d7a16ba8b14c1","observation_id":"039cbba8-4e40-41f8-b62d-971cdaf3469e","resolution":{"observed_at":"2026-08-07T05:20:51.054665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T05:20:51.058500Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.058500Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:c2294ca0a1ac4cea13844918b81898331fe44634113a9ce81219d6128a9ded64","observation_id":"927c9c3c-c01b-44c8-bdbb-8c2e2d661b09","resolution":{"observed_at":"2026-08-07T05:20:51.058500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.957805Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":"64b8fb5c-d62e-4831-a2d2-341ea8eeb969","year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.062379Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:f72fd158d0ed8db1a1cb2279df7f0c417eed85b5a06ee0c1a5eee71e513f0321","observation_id":"6f26b31b-c794-4861-bf2b-2305a5e532db","resolution":{"observed_at":"2026-08-07T05:20:51.961439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.946185Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":"d6d81e4b-6f21-4495-8b1a-e95dc51deb0f","year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.066724Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:42d7fc1a97852ebdf8100a0613f7560e34022881495917012a085b1ed5e5c667","observation_id":"87b63063-c52e-4bc7-bce0-91687dd6dc4d","resolution":{"observed_at":"2026-08-07T05:20:51.950410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:20:51.070312Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.070312Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:f0eb81664bd61d2847bb74543f6ee3ba85d085bece21de8dea299c89680e1328","observation_id":"23a02f78-89ab-48d2-941a-1acf24767390","resolution":{"observed_at":"2026-08-07T05:20:51.070312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.934405Z","title":"What does bert learn about the structure of language? InACL,","venue":null,"work_id":"07f474a9-857f-4d00-8afb-2766a659c544","year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.074586Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:26a427f981d5b89500a0c41a22e7c68ba444185445e2564fbd3eca59ba5bf8d9","observation_id":"5f9e4d79-9629-4745-bedf-a538a28a0496","resolution":{"observed_at":"2026-08-07T05:20:51.938958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T05:20:51.078207Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.078207Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:394a1a38066e42e84c4bec13c06ee06a798149e70b7671d8ad65702e97509955","observation_id":"a744e85c-dbf0-40ea-8e1b-74831bdc6daa","resolution":{"observed_at":"2026-08-07T05:20:51.078207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01502","last_updated":"2024-05-02T17:32:59Z","snapshot_observed_at":"2026-08-13T00:16:00.065013Z","submitted_at":"2024-05-02T17:32:59Z","title":"Analyzing the Role of Semantic Representations in the Era of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01502","snapshot_observed_at":"2026-08-07T05:20:51.082207Z","title":"Analyzing the role of semantic representations in the era of large language models.arXiv preprint arXiv:2405.01502,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.082207Z"},"links":{"cited_paper":"/paper/2405.01502","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:1f85a04f865acbdc9519e2cdb58b2e027d7289e6114068477e7db4ebe28f7424","observation_id":"d6902ad0-3b3b-41c4-8c12-dd1929b6dc40","resolution":{"observed_at":"2026-08-07T05:20:51.082207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.923646Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"228f8ee8-319d-4be8-9bad-5c216cab2090","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.086581Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:c3436539735a16d44ba1a5d951b59b08d9939fdd258f9ff6c837931554bf481c","observation_id":"79b400d3-f8ac-4ef6-9dff-60a433fc1530","resolution":{"observed_at":"2026-08-07T05:20:51.927459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.911064Z","title":"Analyzing and improving the training dynamics of diffusion models","venue":null,"work_id":"003fc098-0b3b-41aa-b2f3-609f93155522","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.089829Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:57b6d5af2b385d88bd62b43d6e713c42c8e7e49ae8059ef4f032b87db4bc6927","observation_id":"b44455d0-a6cc-4098-bd00-f884dce11158","resolution":{"observed_at":"2026-08-07T05:20:51.916207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-08-14T08:11:36.232487Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-07T05:20:51.093052Z","title":"Nv- embed: Improved techniques for training llms as generalist embedding models.arXiv preprint arXiv:2405.17428, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.093052Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:fa86a9ded7b576f33d147820e3c8476421d29b2adb11e3ffe968c113ed0fd970","observation_id":"8f166b0a-9b9b-4618-8442-4e80d4ff018d","resolution":{"observed_at":"2026-08-07T05:20:51.093052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-08-12T23:38:59.439688Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-07T05:20:51.096656Z","title":"Genai-bench: Evaluating and improv- ing compositional text-to-visual generation.arXiv preprint arXiv:2406.13743, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.096656Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:93fae6fc014f7a289c0c25890ba9b5df46265ca7f94f6c5fcf9f5d3bc08aaae5","observation_id":"4093adbf-4e7f-4333-9802-e5abbf15e686","resolution":{"observed_at":"2026-08-07T05:20:51.096656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03281","last_updated":"2023-08-07T03:52:59Z","snapshot_observed_at":"2026-08-04T23:10:23.964516Z","submitted_at":"2023-08-07T03:52:59Z","title":"Towards General Text Embeddings with Multi-stage Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03281","snapshot_observed_at":"2026-08-07T05:20:51.100614Z","title":"Towards general text embeddings with multi-stage contrastive learning.arXiv preprint arXiv:2308.03281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.100614Z"},"links":{"cited_paper":"/paper/2308.03281","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:71f27e1c9a475b13bcb48c1c0dc67fbc806a6432332a7c4cbfe136b89165d3a9","observation_id":"ce625a39-7946-45c8-88db-e4bd5b49427b","resolution":{"observed_at":"2026-08-07T05:20:51.100614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.899590Z","title":"Llm- grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models","venue":null,"work_id":"1a985b82-ca7b-43b6-9112-c74e736d4c7d","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.104499Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:f254b2133ce15fa2faba005a1233d9cb1064f602882bbfba5e04361377874cd1","observation_id":"6fe2513e-05dc-4728-b10f-6418a9231af6","resolution":{"observed_at":"2026-08-07T05:20:51.903817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.889011Z","title":"Common diffusion noise schedules and sample steps are flawed","venue":null,"work_id":"8c9dc00e-1be6-4cc8-850a-f868a7db373a","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.108275Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:0ab841f353dc2a7b376132bdde75a3d92e08003ecf9a74e439e13f4d7ec47975","observation_id":"e25b3597-2306-45ac-b073-ecdae4731aad","resolution":{"observed_at":"2026-08-07T05:20:51.892766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.878762Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration","venue":null,"work_id":"badbe3fb-9492-4614-8b6b-ee267eb65807","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.112353Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:250ba83f7c60a9ea4b960fa21c7fec6036b0fad2127a21bad02a766c1c9682d7","observation_id":"04ead64d-cb04-459d-bb57-c2d51b0d4bf9","resolution":{"observed_at":"2026-08-07T05:20:51.882601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-07T05:20:51.115963Z","title":"Playground v3: Im- proving text-to-image alignment with deep-fusion large lan- guage models.arXiv preprint arXiv:2409.10695, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.115963Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:ae656691343bc9d6a41eda2a836a62b1288893dc671b2e406751bc863110e609","observation_id":"78c10748-bbdd-4373-b842-1ba1ad57c327","resolution":{"observed_at":"2026-08-07T05:20:51.115963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10562","last_updated":"2023-05-03T16:36:38Z","snapshot_observed_at":"2026-08-13T13:17:49.689853Z","submitted_at":"2022-12-20T18:59:23Z","title":"Character-Aware Models Improve Visual Text Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10562","snapshot_observed_at":"2026-08-07T05:20:51.120173Z","title":"Character-aware models improve visual text rendering.arXiv preprint arXiv:2212.10562, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.120173Z"},"links":{"cited_paper":"/paper/2212.10562","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:54dfad9ee1dcebd3873cbd4eef13b3e9470b63e44268d12c08601b47cc3ed69b","observation_id":"46685bd4-1272-4c9a-a0e6-f226a9a9bce3","resolution":{"observed_at":"2026-08-07T05:20:51.120173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01509","last_updated":"2024-06-09T13:07:50Z","snapshot_observed_at":"2026-08-13T04:04:39.831807Z","submitted_at":"2024-03-03T13:14:47Z","title":"Fantastic Semantics and Where to Find Them: Investigating Which Layers of Generative LLMs Reflect Lexical Semantics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01509","snapshot_observed_at":"2026-08-07T05:20:51.123785Z","title":"Fan- tastic semantics and where to find them: Investigating which layers of generative llms reflect lexical semantics.arXiv preprint arXiv:2403.01509, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.123785Z"},"links":{"cited_paper":"/paper/2403.01509","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:806fbafee7b59b8178ad23acb6678774e71f2ff628ec5ffd1348ae67e5f18514","observation_id":"9494912b-8c09-407f-8ccd-0cbc9de6a8ff","resolution":{"observed_at":"2026-08-07T05:20:51.123785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.867528Z","title":"Decoupled weight decay regularization, 2017","venue":null,"work_id":"bcb189d0-4c88-45b4-bbca-5eb9aa904cea","year":2017},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.127292Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:b27a1469370d33dbc6457dcad6cf1ab772c1b8873ab38547eff240536ad7b677","observation_id":"f5a33c4b-94c4-443c-99bd-e73523f50273","resolution":{"observed_at":"2026-08-07T05:20:51.870995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.855743Z","title":"Salesforce AI Research’s SFR-embedding, the top performing text-embedding model","venue":null,"work_id":"fdf451f5-1ec5-4496-ab38-8c368b17821b","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.130898Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:c98be7c848df84cd6000f5cc5ff037162738f347e108d6b4d23cd9efc60cdc0b","observation_id":"5e1143d1-e17e-46dc-b0ad-588a8094bacf","resolution":{"observed_at":"2026-08-07T05:20:51.860167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07316","last_updated":"2023-03-19T13:37:01Z","snapshot_observed_at":"2026-08-14T05:00:07.792972Z","submitted_at":"2022-10-13T19:42:08Z","title":"MTEB: Massive Text Embedding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07316","snapshot_observed_at":"2026-08-07T05:20:51.134528Z","title":"Mteb: Massive text embedding benchmark.arXiv preprint arXiv:2210.07316, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.134528Z"},"links":{"cited_paper":"/paper/2210.07316","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:b12bd0772c5580823c96770dc7a4239732a4ffd709d53c7df9d575f3779849ec","observation_id":"08adad73-ee57-430b-936f-99f7ffdda3e4","resolution":{"observed_at":"2026-08-07T05:20:51.134528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.139116Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.139116Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:02f83a3a1f21ed8b5dde36f3c62984f9680c0cac4a23820f5467c03f07cf9865","observation_id":"b6d0ab25-1849-45fd-b079-deb6eeff7e55","resolution":{"observed_at":"2026-08-07T05:20:51.139116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T05:20:51.143069Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.143069Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:63e0ffcb164f0beca8c45f15737e5b33e98814426edb75fcaf57974f71b490a2","observation_id":"08aee82c-0c41-472e-9dcb-815af9af02ab","resolution":{"observed_at":"2026-08-07T05:20:51.143069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.838522Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"975a7c2d-b23f-445a-88d0-f861036539a3","year":2021},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.147265Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:cfe886bdcdca90c33f4448eec2cfb09a923f3bcfc9e846dac5fc60c1155ec0a3","observation_id":"be6f771f-b28b-44e4-b94d-fd8c5e1e1042","resolution":{"observed_at":"2026-08-07T05:20:51.842843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.828908Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.JMLR, 2020","venue":null,"work_id":"c832337a-23ab-4d95-b77b-e25b835c3c1d","year":2020},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.150903Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:f1576a1c6f621dac1bff112270077b05397a08c39fb30c6e9eb659b034b91665","observation_id":"30bb8684-6000-4e2c-a8f7-3ee077efd3ab","resolution":{"observed_at":"2026-08-07T05:20:51.832409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T05:20:51.154397Z","title":"Hierarchical text-conditional image gen- eration with clip latents.arXiv preprint arXiv:2204.06125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.154397Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:997c40e3ca441635501480de43845b5c6404ac1ee1754ff655e4c146db591b12","observation_id":"8f990867-8353-45e4-9157-07fab43f9504","resolution":{"observed_at":"2026-08-07T05:20:51.154397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.818738Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"93d8d7e5-3c61-4210-bb83-2ee84f648791","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.158439Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:472d53d52503b1e167db275b16a31e62fc1b0111360077755b1031ac2189c2ac","observation_id":"d242fceb-18b2-42b1-b1f2-e59bf4045b48","resolution":{"observed_at":"2026-08-07T05:20:51.822625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.807858Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"ac37c17a-bbaf-41f9-bf6d-93cc5bab23e5","year":2015},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.161994Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:cefd6c1a280f1e6be185d19e0a9fe06300a8c6f7a129a6205a91481317763c5e","observation_id":"cf875356-8584-4dfa-b89e-7565d2e257a6","resolution":{"observed_at":"2026-08-07T05:20:51.811734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.796506Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"3853c255-693e-4f47-9e0b-4cafeb983437","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.165570Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:f96af54f4f8b3a71b81d815a660f75545f3fdb2ebc5d43106c80b4c1644e6cf1","observation_id":"1d1708d4-fdd0-4ca0-8d8e-d1275221830b","resolution":{"observed_at":"2026-08-07T05:20:51.800992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.786346Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"1442eb36-da5b-4094-b79a-f646c4a573c9","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.169459Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:c97ddd349a1a87951748fa9d72a6206d42d22bf85cdfd2754f99f13055631292","observation_id":"c2cf3cc2-a1d7-4f07-9be7-d6131df0fd71","resolution":{"observed_at":"2026-08-07T05:20:51.790009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15449","last_updated":"2025-09-07T18:50:16Z","snapshot_observed_at":"2026-08-13T04:11:58.141409Z","submitted_at":"2024-02-23T17:25:10Z","title":"Repetition Improves Language Model Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15449","snapshot_observed_at":"2026-08-07T05:20:51.173283Z","title":"Repetition improves lan- guage model embeddings.arXiv preprint arXiv:2402.15449,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.173283Z"},"links":{"cited_paper":"/paper/2402.15449","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:631b640a6f08414d0fd1c5270023be92f8c46e8f9ebf78b2efff68a945596cfe","observation_id":"554f8853-d4a0-49a4-9075-33be8ee69c87","resolution":{"observed_at":"2026-08-07T05:20:51.173283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T05:20:51.181220Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.181220Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:f23047e91112d2283d8e9161fec1cb90ffc5089d64cd29b9a10d9be2a2990ff2","observation_id":"8f9e3754-0106-4a25-8f2d-4963b637f538","resolution":{"observed_at":"2026-08-07T05:20:51.181220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.775540Z","title":"Stable diffusion training with mo- saicml.Mosaic Research Blog, 2023","venue":null,"work_id":"3998fa56-9479-421c-baa3-3dd8e6012f87","year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.184771Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:d493260d52ec473b6feb8cb32e733e728e8ae9e12c13a0bb63a177e157f2e03b","observation_id":"ce1863b8-9a5e-46e5-a0ea-e282955f68fd","resolution":{"observed_at":"2026-08-07T05:20:51.779633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06316","last_updated":"2019-05-15T17:48:56Z","snapshot_observed_at":"2026-08-07T09:02:14.264924Z","submitted_at":"2019-05-15T17:48:56Z","title":"What do you learn from context? Probing for sentence structure in contextualized word representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.06316","snapshot_observed_at":"2026-08-07T05:20:51.188280Z","title":"What do you learn from context? probing for sentence struc- ture in contextualized word representations.arXiv preprint arXiv:1905.06316, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.188280Z"},"links":{"cited_paper":"/paper/1905.06316","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:3f27253e0ee26331cc2b76121feeba7f58a0d63eb6ed3493fee696d9cfa0bb95","observation_id":"650e3c80-0662-460e-a644-f33a1de5cf4b","resolution":{"observed_at":"2026-08-07T05:20:51.188280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.764254Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":"81ed514b-f94c-4f21-9334-0ade7f597cfd","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.192566Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:b8797869ff82d7424e5c7f48f67eb783b74543981c879ae05dbce3bddbdb78f9","observation_id":"8256558b-81e8-4136-ab26-a8ed29f1c08f","resolution":{"observed_at":"2026-08-07T05:20:51.768198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T05:20:51.196243Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.196243Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:7a6f3999ca201a784f3a23e7e3ccf673c8a184150c4c9905992f5b48e0209a6f","observation_id":"df1e8bc0-cccc-4034-90a9-ac8b7fbfef8c","resolution":{"observed_at":"2026-08-07T05:20:51.196243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.752063Z","title":"Diffusers: State-of-the-art diffusion models.GitHub repository, 2022","venue":null,"work_id":"6ed2b645-65f7-4ade-8216-adb86a484e71","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.199902Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:aaee20a0783d6d25087f0f2d13c937ae6e88c8eef24b7193def06791d3669144","observation_id":"c1827cbc-35e5-458e-96d8-66c9a8fe0679","resolution":{"observed_at":"2026-08-07T05:20:51.756013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-07T05:20:51.203423Z","title":"Text embeddings by weakly-supervised contrastive pre- training.arXiv preprint arXiv:2212.03533, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.203423Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:78f216c0d09858338e3720d05a945a67296a329a25123236ba89d741ae193159","observation_id":"5727adb9-dd26-4d48-b90c-70e3e7357347","resolution":{"observed_at":"2026-08-07T05:20:51.203423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.740732Z","title":"Improving text embeddings with large language models","venue":null,"work_id":"aad8bfbe-cb6f-4887-bf26-6789aeb9fd51","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.206990Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:bbcc8a537795397b4375dccf2c204067b414e33356bef79ce5114125de241aeb","observation_id":"3189fe56-8ea4-442d-b5f1-2e8540898742","resolution":{"observed_at":"2026-08-07T05:20:51.744839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16820","last_updated":"2025-03-17T15:53:14Z","snapshot_observed_at":"2026-08-13T00:22:03.823167Z","submitted_at":"2024-04-25T17:58:43Z","title":"Revisiting Text-to-Image Evaluation with Gecko: On Metrics, Prompts, and Human Ratings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16820","snapshot_observed_at":"2026-08-07T05:20:51.210596Z","title":"Revisiting text-to-image evaluation with gecko: On met- rics, prompts, and human ratings.arXiv preprint arXiv:2404.16820, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.210596Z"},"links":{"cited_paper":"/paper/2404.16820","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:497cdae5c38b877c250aa354c3b35806f1190b87c4c26f98f343c6ca462a543d","observation_id":"f715e3cf-606d-4af0-979d-491ffc7800f5","resolution":{"observed_at":"2026-08-07T05:20:51.210596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-07T05:20:51.214409Z","title":"Sana: Ef- ficient high-resolution image synthesis with linear diffusion transformers.arXiv preprint arXiv:2410.10629, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.214409Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:cceb9428d28d92b6123694a290ee68082032043b66c71cc0f95fd6f207bd2bff","observation_id":"fd00a9b6-0f84-43ba-831f-ebc5df508ea0","resolution":{"observed_at":"2026-08-07T05:20:51.214409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.728746Z","title":"ByT5: Towards a token-free future with pre-trained byte- to-byte models.TACL, 2022","venue":null,"work_id":"1cdf2ae7-cb2b-4485-933e-94f60460aff3","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.218461Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:36bdb2fdc9adf3bc49dee76d560573606dd8189ee21a54c006e6f5033c54d90f","observation_id":"eca2e838-1853-4e5e-aa53-4efa5424ae8d","resolution":{"observed_at":"2026-08-07T05:20:51.733137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T05:20:51.222983Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.222983Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:cf0e12bc21d876e76e116b1b1c1ef598b5a7b9e4bc439963ecd003d421a87dc4","observation_id":"1f715680-9d55-44af-af67-261e85e2dc28","resolution":{"observed_at":"2026-08-07T05:20:51.222983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.718111Z","title":"What you see is what you read? improving text- image alignment evaluation","venue":null,"work_id":"d61178f4-90ba-4479-b9a2-c9b4157e9b69","year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.226960Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:7d6c4efa52809f657da22757720406fed820132a5ed026d2111c32f649345f6c","observation_id":"8ca66ea2-ab10-4a4d-8f5a-92033c24c6b7","resolution":{"observed_at":"2026-08-07T05:20:51.721893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14381","last_updated":"2024-09-22T09:53:13Z","snapshot_observed_at":"2026-08-12T22:40:13.073785Z","submitted_at":"2024-09-22T09:53:13Z","title":"Investigating Layer Importance in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14381","snapshot_observed_at":"2026-08-07T05:20:51.230669Z","title":"Inves- tigating layer importance in large language models.arXiv preprint arXiv:2409.14381, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.230669Z"},"links":{"cited_paper":"/paper/2409.14381","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:32882ad3e7d3a0ea78a075e539c827a4f4bb654eec3229b7cb021f79fb1fce54","observation_id":"c5623f59-da6b-48f4-81dd-6f7bd2954a2d","resolution":{"observed_at":"2026-08-07T05:20:51.230669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-07T05:20:51.235247Z","title":"Pytorch fsdp: experi- ences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.235247Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:75f638e52489cf57865ac51f3a4cb48bbf341ca41303ad56f469015efc144a77","observation_id":"d7afd82b-89f1-4642-9c27-61a1bdf32373","resolution":{"observed_at":"2026-08-07T05:20:51.235247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-12T23:49:22.404216Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-08-07T05:20:51.240632Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit.arXiv preprint arXiv:2406.18583,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.240632Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:94489d13f5892635d5f4b8e2b356196fc6e949c8cb41425a92582d8bfac4bd1a","observation_id":"ae66d45d-f3f5-45a0-91f6-994ca9ad6a26","resolution":{"observed_at":"2026-08-07T05:20:51.240632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.707073Z","title":"a beautiful morning in the woods with the sun peaking through the trees","venue":null,"work_id":"2ec48032-9968-4ee6-a33b-64d959d58544","year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.244779Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:a4c1d4d3db07ef69151cad71ed1c40183df62a216facaf0dcf971a31c933b233","observation_id":"275b4bab-9df2-45e8-a30a-4291d5d7f937","resolution":{"observed_at":"2026-08-07T05:20:51.711029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2506.08210."}