{"as_of":"2026-08-15T11:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb6ce911c9909fceb2eb37cb33940720fa1d881e41672d28ec5726f61ae9de66","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:11:00.639240Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:30:31.258053Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12391","snapshot_observed_at":"2026-08-03T20:30:31.258053Z","title":"Efficient scaling of diffusion transformers for text-to-image generation.arXiv preprint arXiv:2412.12391, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-07T03:18:48.553937Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:31.258053Z"},"links":{"cited_paper":"/paper/2412.12391","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:ec340288c223f9d6784ba1456fa0f1da1c27aa21dccd19fd48bca1c55eebf501","observation_id":"e89e2380-e22a-43ab-8d62-db81ad126e7e","resolution":{"observed_at":"2026-08-03T20:30:31.258053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12391","snapshot_observed_at":"2026-08-01T10:59:49.288561Z","title":"Efficient scaling of diffusion transformers for text-to-image generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20048","last_updated":"2026-07-22T11:42:42Z","snapshot_observed_at":"2026-08-05T09:15:47.648858Z","submitted_at":"2026-07-22T11:42:42Z","title":"Importance-Aware OBS Pruning for Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T10:59:49.288561Z"},"links":{"cited_paper":"/paper/2412.12391","citing_paper":"/paper/2607.20048"},"observation_digest":"sha256:7e1a4db666ce6171711098b7a9421f7154aa2fe148731904c5e3d0d492d81fb6","observation_id":"52761174-4d24-43fc-a1f9-7293d6313353","resolution":{"observed_at":"2026-08-01T10:59:49.288561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12391/citation-record","integrity":"/paper/2412.12391/integrity","json":"/paper/2412.12391/citation-record.json","paper":"/paper/2412.12391"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:01.001218Z","title":"[Online; accessed 4-March-2024]","venue":null,"work_id":"fc0f4bfa-3dee-480b-a51f-c2e8d3418d40","year":2024},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.535053Z"},"links":{"citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:4fac8b4da6472e1b195b6b6b482aea11a921240341c6266db388cccac0999cf5","observation_id":"6eb7e9bf-7027-4ae4-9872-dd1ec108ed8a","resolution":{"observed_at":"2026-08-11T14:11:01.006837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-11T14:11:00.540025Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.540025Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:55972f69afc2e7335c1b0c2f2e2c8ab1e9e7bf1b09ffe226129a931e9fe776b1","observation_id":"65abf0c2-4b3b-4339-b2be-ae7f0ca877a8","resolution":{"observed_at":"2026-08-11T14:11:00.540025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T14:11:00.556269Z","title":"URL https://doi.org/10.5281/zenodo","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.556269Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:dd5471bf76137d601db0c673b29ed10128b64540d7f0dd1a3addb1548dee98b3","observation_id":"bb0157df-e0aa-498e-9542-d9fb1d151351","resolution":{"observed_at":"2026-08-11T14:11:00.556269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T14:11:00.561565Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.561565Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:7305b0d055369d99b00dfb88d57bd35701ce6d1b288ed06ac84aa0376eab772c","observation_id":"df311dd2-2ef2-449c-9626-236fec9ce460","resolution":{"observed_at":"2026-08-11T14:11:00.561565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-11T14:11:00.567171Z","title":"Manmatha, Ashwin Swaminathan, Zhuowen Tu, Stefano Ermon, and Stefano Soatto","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.567171Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:fc4a05ec33ec32457b54f18ec499a237a1ef266abf5b8110c6b20425e177e960","observation_id":"cb023b8d-cfb7-4994-8ec8-83b8fd4eff4d","resolution":{"observed_at":"2026-08-11T14:11:00.567171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T14:11:00.572731Z","title":"Sdxl: improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.572731Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:0f7c0abe8e718e8e383d4d9806c861c5cc7e8d1fa33a54c1751cd1a266fbbaaf","observation_id":"3028d1b1-2011-410d-8a7c-5f5fa92057f3","resolution":{"observed_at":"2026-08-11T14:11:00.572731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T14:11:00.577563Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.577563Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:635fdd3021ddf98da23292548760fbe28d30344c85b0bb9b1b1227d7753a970e","observation_id":"09efea52-30c3-46c0-9fc2-2064026aefee","resolution":{"observed_at":"2026-08-11T14:11:00.577563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:00.983598Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"12a7ac14-4e1a-4de5-ac18-4d2263c647fc","year":2015},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.583441Z"},"links":{"citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:d0017071b9741e8db180b5c8263e000ae8072825faba28e6962e9a9e9df0d000","observation_id":"14bd2e94-787a-4f10-8185-6e0c67911dc0","resolution":{"observed_at":"2026-08-11T14:11:00.989413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-08-15T02:49:48.402733Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-08-11T14:11:00.598263Z","title":"wikipedia.org/w/index.php?title=Mean_squared_error&oldid=1207422018","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.598263Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:7eb9b628b60fcb4abf35757480894e54eb19bc0c1f7736dbc38bd0595b33a75c","observation_id":"7df0b84d-929d-409a-8743-63c36ea9c0a2","resolution":{"observed_at":"2026-08-11T14:11:00.598263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-11T14:11:00.604152Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.604152Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:b0cd4c8c6d73988640ba729e3ff29a2ca6cce7bfa3d38a5b10da77d0ef1454a5","observation_id":"710f86f6-d71a-4824-8142-9e6a882a290c","resolution":{"observed_at":"2026-08-11T14:11:00.604152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-11T14:11:00.609126Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.609126Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:1fe26bc21cdc1666a3f9c7679fd435391cb7657abf623696a3d076d313a25166","observation_id":"df250891-c198-42ef-8cf7-c91b44fff2f3","resolution":{"observed_at":"2026-08-11T14:11:00.609126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-11T14:11:00.614058Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.614058Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:4586f9df9c07f819ca8e5932cfabaa94aa24b2271be72b57a6004798dbf7b321","observation_id":"3a17937c-00ab-4842-8bb1-8e8b85577898","resolution":{"observed_at":"2026-08-11T14:11:00.614058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-12T23:49:22.404216Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-08-11T14:11:00.618880Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.618880Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:a051cb4c1d59b685913dbbce2465f4e4f1c999072bcc58dfad8813c02e4de391","observation_id":"699907c1-0d15-4c46-a919-6f33a9bda6c4","resolution":{"observed_at":"2026-08-11T14:11:00.618880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:00.966968Z","title":"LensArt consists of 250 million image-text pairs, carefully selected from an initial pool of 1 billion noisy web image-text pairs","venue":null,"work_id":"99fb981b-cf73-4f4c-9731-9c17b98c7a17","year":2023},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.624731Z"},"links":{"citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:3f9bc8e01764bde9841e1a7d82b35fa1d47567742d904e010581630b9356b7b7","observation_id":"da66e0fe-1c08-4771-96c4-71e9a005ca97","resolution":{"observed_at":"2026-08-11T14:11:00.972905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:00.951156Z","title":"B.1 B ENCHMARKS We outline the evaluation benchmarks used to assess the performance of our image inpainting and canny edge conditioning models","venue":null,"work_id":"10103df1-f644-4443-9158-7e34bab053d2","year":2000},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.630046Z"},"links":{"citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:b448f06decc85da3505fdb5b6c11385b331e7bc22fde546d3ba9c826dafe874f","observation_id":"5ba47946-b5f7-4d59-a311-a52ff46defe1","resolution":{"observed_at":"2026-08-11T14:11:00.956046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:00.935042Z","title":null,"venue":null,"work_id":"be45e03f-a8ae-4eb5-b8b0-2102f78d2a34","year":2024},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.634831Z"},"links":{"citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:c2d52825600790bf92a749e10114802427f99381e8c67a74ea0b6b9609d23023","observation_id":"0b2474e7-bbe9-4e35-b4b1-4e433df4a3e6","resolution":{"observed_at":"2026-08-11T14:11:00.939986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:00.917019Z","title":"In addition to TIFA and ImageReward, we also provide the FID score, which measures the fidelity or similarity of the generated images to the groundtruth images","venue":null,"work_id":"1a7da54c-6b3b-48a6-b0ef-c57974070d26","year":2014},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.639240Z"},"links":{"citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:f722b8dd1846648c73491ce254e96736232b1ac1c8df110b89c945499589704e","observation_id":"d2d2f455-3e5b-43d7-beaa-68fe9dad98db","resolution":{"observed_at":"2026-08-11T14:11:00.924216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T14:11:00.593507Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.593507Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:204c8f9b038fd4c787e43f971bf260d1ee50a340efe93cac799c7dca13bcd010","observation_id":"001bea12-8fd3-4ba3-bce3-ce49bc74b0c7","resolution":{"observed_at":"2026-08-11T14:11:00.593507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11897","last_updated":"2023-08-17T21:45:52Z","snapshot_observed_at":"2026-08-13T12:19:54.379421Z","submitted_at":"2023-03-21T14:41:02Z","title":"TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11897","snapshot_observed_at":"2026-08-11T14:11:00.550971Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.550971Z"},"links":{"cited_paper":"/paper/2303.11897","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:19bc3e24feb2dbac51078f1f908039b1b7144f9b959e30367630f719d1effdad","observation_id":"30cca4b0-6871-4574-a296-a74f49fb3437","resolution":{"observed_at":"2026-08-11T14:11:00.550971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T14:11:00.588431Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.588431Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:2c9013a1920f02c1523d5c2c25fe3617433cd3586a3d3a110fa9da057dadce40","observation_id":"99a30b2d-0b47-440f-911c-a8e9c81fdd8d","resolution":{"observed_at":"2026-08-11T14:11:00.588431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T14:11:00.545632Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.545632Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:b872d5be74e745a26b499ed765213bf6282cc608f082e3c1148b83dd9ac79393","observation_id":"e79e9040-d0fe-4f84-88b8-78fb9ef02d14","resolution":{"observed_at":"2026-08-11T14:11:00.545632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10972","last_updated":"2023-05-21T07:07:55Z","snapshot_observed_at":"2026-08-14T17:24:49.885507Z","submitted_at":"2023-01-26T07:37:22Z","title":"On the Importance of Noise Scheduling for Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10972","snapshot_observed_at":"2026-08-11T14:11:00.529321Z","title":"1 Junsong Chen, Chongjian Ge, Enze Xie, Yue Wu, Lewei Yao, Xiaozhe Ren, Zhongdao Wang, Ping Luo, Huchuan Lu, and Zhenguo Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.529321Z"},"links":{"cited_paper":"/paper/2301.10972","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:bb5a9e4c179759647abe889dc504e5d626e2214acfca48cc75c158073195e7b6","observation_id":"d23cdeee-dccc-42e5-91c7-345a749c17a9","resolution":{"observed_at":"2026-08-11T14:11:00.529321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T02:46:06.266154Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 2 inbound Pith citation observations for arXiv:2412.12391."}