{"as_of":"2026-08-09T04:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30dabb091ce76b998b7a3cfc5abbc05e27fb48bb7e121aa65abcb205ff5104f6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T01:04:45.691154Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2405.14430","last_updated":"2025-12-03T10:59:23Z","snapshot_observed_at":"2026-08-08T21:50:02.096694Z","submitted_at":"2024-05-23T11:00:07Z","title":"PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T01:17:11.261301Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2405.14430"},"observation_digest":"sha256:c92198c6f063cd84a7b4ff77b12f35d780c10c1ee4c6f5344ce235396c594ccd","observation_id":"c1bf6e93-ff1f-4a8c-ac56-7194297bd8e7","resolution":{"observed_at":"2026-05-24T01:18:42.436471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:1a99fa4bcded138dfa0f561cc556f53e6e43749e2661c7a16b20cde883d59677","observation_id":"fd326b99-339d-41ef-9657-0f1857e97335","resolution":{"observed_at":"2026-05-11T10:56:07.071520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-12T15:09:36.982610Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2410.06940"},"observation_digest":"sha256:7fdd78157339d7f3e55f71313625f8d02c77c322658cf46871dd071bff677d64","observation_id":"8728af1f-2f07-4c39-bdda-51192b67a42b","resolution":{"observed_at":"2026-05-12T15:09:37.106792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:50.009149Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2410.10629"},"observation_digest":"sha256:3810ddd36d58eac63677690ede698701d525f8b531a358d9071733ae8d393083","observation_id":"1dd59143-9730-4ee8-84a2-cc731d0854b8","resolution":{"observed_at":"2026-05-15T00:56:50.061833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T08:38:27.946746Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2412.00131"},"observation_digest":"sha256:039eee86fa9ea8f87c5ba4c4b8e66da0395155e00b22ddeeadabc2f46195e0a1","observation_id":"5efd29ea-e9f0-4d9b-bbb7-c04c01814d08","resolution":{"observed_at":"2026-05-23T08:42:45.242218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T11:45:17.473970Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2501.09732"},"observation_digest":"sha256:a5ee4d206457ec6940f6763508acef60d505b8175c255ad8e7ad1dfdf39d7522","observation_id":"5f7af95b-3c7a-4a80-8bbe-962ac750425f","resolution":{"observed_at":"2026-05-20T11:45:17.556019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T08:14:52.890145Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2501.17811"},"observation_digest":"sha256:81d88707a83a4c2acef508c24fbfa3da7f4791ed770f6cdd701551b3ae2fa989","observation_id":"3a998c9d-486f-477f-9ba3-fe809f89580b","resolution":{"observed_at":"2026-05-11T08:14:53.079659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:555bbf0a03af1f1ee383c6df001061a13935521b0587ae9b0d2b3e8a1d7ab201","observation_id":"b4466de2-93a3-412d-bd41-62fb0e516af2","resolution":{"observed_at":"2026-05-17T07:24:04.781066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-07T13:46:44.443170Z","title":"Pixart-\\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21114","last_updated":"2025-05-27T12:33:43Z","snapshot_observed_at":"2026-08-07T13:32:59.082783Z","submitted_at":"2025-05-27T12:33:43Z","title":"Differentiable Solver Search for Fast Diffusion Sampling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:44.443170Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2505.21114"},"observation_digest":"sha256:2f4cbe75f0fb717d7b95c4a4514c4aebb5b6118d072173294df131ea63a07e1b","observation_id":"feaf3134-0e15-4747-8289-d5020fd4d328","resolution":{"observed_at":"2026-08-07T13:46:44.443170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-07T13:42:36.858642Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21179","last_updated":"2025-06-03T02:46:07Z","snapshot_observed_at":"2026-08-07T21:11:55.613725Z","submitted_at":"2025-05-27T13:30:46Z","title":"Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:36.858642Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2505.21179"},"observation_digest":"sha256:96edc0a3967d8e6274a102c7a646bcf9792249f211dd0ea530ad9424f40058b8","observation_id":"6aa7c631-c78f-4fbc-a423-e9be382acc5f","resolution":{"observed_at":"2026-08-07T13:42:36.858642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-07T12:44:13.780066Z","title":"PixArt-Sigma: Weak-to-strong training of diffusion transformer for 4K text-to-image generation.arXiv preprint arXiv:2403.04692, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.780066Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:265f23dd1f00b98368bd6898b7076b3e6af83a3bf6e3f6b7dfa3242317bc6f3f","observation_id":"cc33ce15-5a5a-40cb-91cd-f8ffe9b554a6","resolution":{"observed_at":"2026-08-07T12:44:13.780066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-07T12:43:32.426651Z","title":"Pixart- σ: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24023","last_updated":"2025-05-29T21:48:28Z","snapshot_observed_at":"2026-08-07T12:35:28.787021Z","submitted_at":"2025-05-29T21:48:28Z","title":"Multi-Group Proportional Representation for Text-to-Image Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:32.426651Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2505.24023"},"observation_digest":"sha256:5f1496800e0559e1695b140a1965253cd678070f1adb706aae815812b2622bf2","observation_id":"a479a1dc-1cf6-4de7-ad80-b1f77a206296","resolution":{"observed_at":"2026-08-07T12:43:32.426651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-07T05:18:56.551512Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08351","last_updated":"2025-06-10T02:09:48Z","snapshot_observed_at":"2026-08-07T05:10:54.599202Z","submitted_at":"2025-06-10T02:09:48Z","title":"How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:56.551512Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2506.08351"},"observation_digest":"sha256:e16104cdf08217b13c28aee57e4fdc64a63f47189153e47aa086337ac6af4550","observation_id":"37a2c438-6550-49a2-a6d7-e56fa3cfdf6a","resolution":{"observed_at":"2026-08-07T05:18:56.551512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-07T05:14:40.852888Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:40.852888Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:b72c217722dbaed85715fb5a10cf924bc4d5b5c1f7166491bc18f801646f5e56","observation_id":"00f7d635-966c-4406-b3de-4ab59a097c14","resolution":{"observed_at":"2026-08-07T05:14:40.852888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T23:28:03.229878Z","title":"PixArt-Sigma : Weak-to-strong training of diffusion transformer for 4K text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-06T23:20:59.622434Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:03.229878Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:53cffb5c107d48b96127eb55e2d9492a56c3b40fca544585449366f355632fcf","observation_id":"85473dbf-336f-4058-a13a-706dc983d539","resolution":{"observed_at":"2026-08-06T23:28:03.229878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T20:26:37.842944Z","title":"Pixart-\\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-07T22:42:38.118521Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.842944Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:bd656cfe258818a20be644c4be3dd8e7c36c4edfdd50848f512e9a67c6c5b8d9","observation_id":"1c6e5d5b-eb49-4408-9bf2-6a90c31c6534","resolution":{"observed_at":"2026-08-06T20:26:37.842944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T19:50:20.126209Z","title":"Chung, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-08T17:53:51.508469Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.126209Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:5f9257887b96aa3c912b92579ad5e6686813e2ddfd6eaded6bab56a620c7be73","observation_id":"7a5cdab3-5c44-4c2d-857f-bdbbecbb83dc","resolution":{"observed_at":"2026-08-06T19:50:20.126209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T17:54:45.724628Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11554","last_updated":"2025-08-03T03:07:39Z","snapshot_observed_at":"2026-08-07T16:40:56.177031Z","submitted_at":"2025-07-14T02:59:28Z","title":"Inversion-DPO: Precise and Efficient Post-Training for Diffusion Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:54:45.724628Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.11554"},"observation_digest":"sha256:0dad41b139919b135384e2508bd56cc0a70445979ebdbef35df4525010cca306","observation_id":"674c6596-15e6-40f1-8fcf-43b62960a7f5","resolution":{"observed_at":"2026-08-06T17:54:45.724628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T16:42:11.259659Z","title":"Pixart-\\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation.arXiv preprint arXiv:2403.04692, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12933","last_updated":"2025-07-17T09:15:29Z","snapshot_observed_at":"2026-08-07T03:07:45.280876Z","submitted_at":"2025-07-17T09:15:29Z","title":"DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:11.259659Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.12933"},"observation_digest":"sha256:7eda22c44d397721af5935e8bbd2188810436ab0e2593c5ba6ef9e4f2787aefd","observation_id":"ae74d6d3-7395-4556-ac5d-55236b283dec","resolution":{"observed_at":"2026-08-06T16:42:11.259659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T12:37:05.366376Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21690","last_updated":"2025-07-29T11:13:03Z","snapshot_observed_at":"2026-08-09T00:29:58.280538Z","submitted_at":"2025-07-29T11:13:03Z","title":"APT: Improving Diffusion Models for High Resolution Image Generation with Adaptive Path Tracing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:37:05.366376Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.21690"},"observation_digest":"sha256:28ec27de6e4f92ee1b1f2d15028147264491d867a026b788f38bcfe967d0a4e8","observation_id":"faab2c4a-7a9a-433d-91d0-b5731022b0c1","resolution":{"observed_at":"2026-08-06T12:37:05.366376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-03T10:56:11.852224Z","title":"Pixart-σ: Weak-to-strong training of dif- fusion transformer for 4k text-to-image generation.arXiv preprint arXiv:2403.04692, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08303","last_updated":"2026-07-06T07:20:34Z","snapshot_observed_at":"2026-08-07T13:59:11.336528Z","submitted_at":"2026-01-13T07:46:46Z","title":"SnapGen++: Unleashing Diffusion Transformers for Efficient High-Fidelity Image Generation on Edge Devices","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T10:56:11.852224Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2601.08303"},"observation_digest":"sha256:3df1dd7dc550a6fb550060d533baf0fdadd63ae30b241932b487ac3ec87e8bad","observation_id":"f5421e55-af37-428a-8e1a-7ea89fc9132b","resolution":{"observed_at":"2026-08-03T10:56:11.852224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2603.07119","last_updated":"2026-05-04T15:27:59Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T09:11:10Z","title":"TIQA: Human-Aligned Perceptual Text Quality Assessment in Generated Images","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T14:32:59.720416Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2603.07119"},"observation_digest":"sha256:a84b719c2a05d5c6388a546323f6adf0c8d6a642b7081b4ec8c23e6ac65843ac","observation_id":"e9eb2faf-cc5d-45fc-91b7-2bba5ead58f8","resolution":{"observed_at":"2026-05-15T14:35:55.881028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2603.21002","last_updated":"2026-05-18T13:08:31Z","snapshot_observed_at":"2026-07-06T22:50:01.539214Z","submitted_at":"2025-11-25T18:54:45Z","title":"SURF: Signature-Retained Fast Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T18:11:39.642701Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2603.21002"},"observation_digest":"sha256:3d578a658e420661c0546a405b72e56fa200e96eedbef52743210fa3ab0f545b","observation_id":"68bd0e14-cad3-4529-935b-429b68459ca0","resolution":{"observed_at":"2026-05-21T18:14:17.450007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2604.07427","last_updated":"2026-04-08T17:35:36Z","snapshot_observed_at":"2026-08-09T00:13:27.562029Z","submitted_at":"2026-04-08T17:35:36Z","title":"Personalizing Text-to-Image Generation to Individual Taste","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:07:31.236729Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2604.07427"},"observation_digest":"sha256:7751d73583a9b055e994f64d89f3b4be201aff0337a01bb759cf5035b8005b87","observation_id":"47178d1a-d3e3-41b4-a887-bac27138d552","resolution":{"observed_at":"2026-05-11T05:26:02.359239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2604.07879","last_updated":"2026-04-09T06:49:43Z","snapshot_observed_at":"2026-08-08T19:50:29.984415Z","submitted_at":"2026-04-09T06:49:43Z","title":"FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:03:35.420451Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2604.07879"},"observation_digest":"sha256:02abe48bdf5b5bdc1a054a247e6450b698665fd19badef6ec25895bdca77744f","observation_id":"384fa532-d39a-4972-b90f-006eee372352","resolution":{"observed_at":"2026-05-11T07:41:00.462920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2604.11934","last_updated":"2026-04-13T18:22:50Z","snapshot_observed_at":"2026-07-06T23:00:12.978356Z","submitted_at":"2026-04-13T18:22:50Z","title":"BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T15:33:15.025940Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2604.11934"},"observation_digest":"sha256:30a9876d0183598442780c16b2da2bb8b9400042f0f08e42f25cd0f5125b7344","observation_id":"3da6f15e-deb5-4bd2-9cde-70ed7e28b979","resolution":{"observed_at":"2026-05-11T10:21:00.664118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2604.26348","last_updated":"2026-04-29T07:00:00Z","snapshot_observed_at":"2026-08-02T10:12:35.563336Z","submitted_at":"2026-04-29T07:00:00Z","title":"ACPO: Anchor-Constrained Perceptual Optimization for Diffusion Models with No-Reference Quality Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T14:05:05.560294Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2604.26348"},"observation_digest":"sha256:a76b9701821924bf71221256758148ce58e0a271975e50d7b177546a4ef5bea8","observation_id":"d4d838cf-c640-47a3-a5dd-b30f6936948c","resolution":{"observed_at":"2026-05-09T03:04:47.616327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2605.04609","last_updated":"2026-05-06T07:56:16Z","snapshot_observed_at":"2026-08-03T01:43:19.583154Z","submitted_at":"2026-05-06T07:56:16Z","title":"Advancing Aesthetic Image Generation via Composition Transfer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T18:23:12.827094Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2605.04609"},"observation_digest":"sha256:b0395c40746a6bbe59882f34ff931fbd20ff8aec2376d30636bc2fab9b15883f","observation_id":"c2f42710-215e-44fc-85df-39fb931310a2","resolution":{"observed_at":"2026-05-09T06:30:44.333026Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2605.15684","last_updated":"2026-05-15T07:13:27Z","snapshot_observed_at":"2026-08-02T22:46:51.504070Z","submitted_at":"2026-05-15T07:13:27Z","title":"ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-20T20:00:27.987481Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2605.15684"},"observation_digest":"sha256:41807e77c40a7d1d0629ef1d7b322b9ab3c94845c47335defd18d897cb994562","observation_id":"baf9c3aa-7f7d-4542-b5ac-c3f9f62bc7a7","resolution":{"observed_at":"2026-05-20T20:03:43.842993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2605.21272","last_updated":"2026-05-20T15:04:56Z","snapshot_observed_at":"2026-08-02T13:53:05.548583Z","submitted_at":"2026-05-20T15:04:56Z","title":"MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T05:21:18.369534Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2605.21272"},"observation_digest":"sha256:4ec59ab9d2f3cd8222201f29a7ff79a73f5ad32f5e4bb3b81d46d558daedb793","observation_id":"5dfc211d-86f5-47fd-abdc-2723cb4a028d","resolution":{"observed_at":"2026-05-21T05:23:58.469175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2605.22015","last_updated":"2026-05-21T05:23:21Z","snapshot_observed_at":"2026-08-02T06:54:38.654414Z","submitted_at":"2026-05-21T05:23:21Z","title":"ORBIS: Output-Guided Token Reduction with Distribution-Aware Matching for Video Diffusion Acceleration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T07:21:16.861996Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2605.22015"},"observation_digest":"sha256:22ec27663024d648d36e9a1253ff29abf0d1be3ec48d4547699748908ae3f9e6","observation_id":"10e89b33-dd90-4ceb-b175-44480b64073b","resolution":{"observed_at":"2026-05-22T07:24:43.433506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2605.25798","last_updated":"2026-05-25T12:48:17Z","snapshot_observed_at":"2026-08-03T18:16:15.377656Z","submitted_at":"2026-05-25T12:48:17Z","title":"DiSC: Resolution-Scalable Acceleration of Diffusion Models by Exploiting Sparsity and Cached Token Reuse with Hash-based Distribution","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T19:33:05.248105Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2605.25798"},"observation_digest":"sha256:f2d247f7ef4d22c8a54000b5195f89b52bf30379e42140fc071da7508570e78f","observation_id":"8d5bd4ae-0825-4893-890a-711a59f87a9b","resolution":{"observed_at":"2026-06-29T19:33:53.900908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2606.02090","last_updated":"2026-06-02T15:33:35Z","snapshot_observed_at":"2026-08-06T12:48:41.308922Z","submitted_at":"2026-06-01T11:18:11Z","title":"FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T15:25:40.039365Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2606.02090"},"observation_digest":"sha256:707e935b93385290d09aa400cf8fd94c70d747aa77a44327d0c536936901a460","observation_id":"0b450218-c9b7-4c4c-bd1f-ffc49161699b","resolution":{"observed_at":"2026-07-01T22:26:17.436674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2606.18554","last_updated":"2026-06-17T00:08:35Z","snapshot_observed_at":"2026-08-06T14:23:49.960091Z","submitted_at":"2026-06-17T00:08:35Z","title":"Forged Calamity: Benchmark for Cross-Domain Synthetic Disaster Detection in the Age of Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T21:32:27.296146Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2606.18554"},"observation_digest":"sha256:1a93b000402fb5f4729877908e33821d6b1d2ba156c174c24ad1e9214e12b129","observation_id":"d9c33576-307d-4a8c-8c2e-59afbd9c511a","resolution":{"observed_at":"2026-07-03T23:59:07.406676Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2606.32020","last_updated":"2026-06-30T17:51:26Z","snapshot_observed_at":"2026-08-03T10:16:58.559510Z","submitted_at":"2026-06-30T17:51:26Z","title":"Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T05:35:48.896721Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2606.32020"},"observation_digest":"sha256:350533e2e643b7940e74281d5e19604ac922aa018933e564196a52b6d5b424ab","observation_id":"361c2a0a-68aa-4f4f-84c3-eef4ceb1430c","resolution":{"observed_at":"2026-07-01T10:25:41.126840Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-07-14T16:28:17.428855Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09753","last_updated":"2026-07-04T13:24:14Z","snapshot_observed_at":"2026-07-16T23:18:00.569503Z","submitted_at":"2026-07-04T13:24:14Z","title":"Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T16:28:17.428855Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2607.09753"},"observation_digest":"sha256:6c9bf5fc35bb86c8fd05faf26f461580c4c670efaa54baacdd64d0626f6b965e","observation_id":"950cf92b-89e3-43d0-9d20-41e1c08ae5cd","resolution":{"observed_at":"2026-07-14T16:28:17.428855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-01T17:30:31.211432Z","title":"arXiv preprint arXiv:2403.04692 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17634","last_updated":"2026-07-20T07:40:56Z","snapshot_observed_at":"2026-08-07T08:24:41.691439Z","submitted_at":"2026-07-20T07:40:56Z","title":"MixDiffusion: Mixing Diffusion-based Uni-condition Text-to-Image Generation Models for Multi-condition Image Synthesis","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T17:30:31.211432Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2607.17634"},"observation_digest":"sha256:6cb1496313f975838d69019d04a92d9ee9a0892804834dc80b9533b693157db4","observation_id":"9a6d307a-9be5-43f5-9ede-8532edf70965","resolution":{"observed_at":"2026-08-01T17:30:31.211432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-01T08:52:47.034867Z","title":"2403.04692 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22745","last_updated":"2026-07-23T06:56:49Z","snapshot_observed_at":"2026-08-03T08:25:31.170674Z","submitted_at":"2026-07-23T06:56:49Z","title":"AI-generated Images Challenge Visual Trust in High-risk Scenarios","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T08:52:47.034867Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2607.22745"},"observation_digest":"sha256:7af3c542bda56c7575d63e3f29c21d21fd2107c4b873f3b2cf5c3b9b3e0b28e3","observation_id":"4b1322ca-60f7-43af-95db-debf5566edb5","resolution":{"observed_at":"2026-08-01T08:52:47.034867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-08T01:04:45.691154Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03057","last_updated":"2026-08-04T03:14:48Z","snapshot_observed_at":"2026-08-09T01:40:12.831628Z","submitted_at":"2026-08-04T03:14:48Z","title":"TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T01:04:45.691154Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2608.03057"},"observation_digest":"sha256:28a995adff280c1e00eea4bab7b621239a06a576e8b282037a8cc1f6c079dbf3","observation_id":"5b74a80e-9e74-4a5b-82fa-53b6f5ab358f","resolution":{"observed_at":"2026-08-08T01:04:45.691154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.04692/citation-record","integrity":"/paper/2403.04692/integrity","json":"/paper/2403.04692/citation-record.json","paper":"/paper/2403.04692"},"outbound":[],"paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 39 inbound Pith citation observations for arXiv:2403.04692."}