{"as_of":"2026-08-08T23:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:544b290403a579b4bd8b11eb6cc883a6dbffd054c766e15c5640abe59e1883bb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:34:57.381834Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T22:02:09.899347Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2112.10752"},"observation_digest":"sha256:743e34c4762e1df8cde49b85d3c441c78d5822ad4f8801eb2f9315ec1c68a4f0","observation_id":"c9e1fa55-7d71-401f-b199-a0f536a99d2c","resolution":{"observed_at":"2026-05-11T22:02:10.049564Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:55:57.612364Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2204.06125"},"observation_digest":"sha256:ffb819255422cf3e5a978887edf55bf8baac768c5ade3757534ee8d25998525f","observation_id":"8688c964-81cb-44ee-bc32-acf0cc50e4bf","resolution":{"observed_at":"2026-05-10T16:55:57.706155Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T12:24:30.071822Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2205.15868"},"observation_digest":"sha256:257dc797876a584a9c1a4dfa9d7f02423212db81080b428b7fc9b6976dd78c0a","observation_id":"627d82d3-d55d-4f65-beb1-a76d206ff8b7","resolution":{"observed_at":"2026-05-11T12:24:30.169637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:01f945a109070ccbc3a25653c060da37ea43eac7ac7e357a2ac9cddfe62afb6d","observation_id":"d992ae0f-c056-43e8-8e4b-a13887ea7fe6","resolution":{"observed_at":"2026-05-10T22:58:52.084829Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:199b53c16de35a9aa208513bb00f209bb4e56bdae83642be37a3fb913358196c","observation_id":"e8f7e586-273a-4e01-97e8-6a4102a7f999","resolution":{"observed_at":"2026-05-11T10:56:07.899835Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-07T21:34:57.381834Z","title":"& Ommer, B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09688","last_updated":"2025-02-13T15:53:52Z","snapshot_observed_at":"2026-08-07T21:27:57.856659Z","submitted_at":"2025-02-13T15:53:52Z","title":"Towards Virtual Clinical Trials of Radiology AI with Conditional Generative Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T21:34:57.381834Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2502.09688"},"observation_digest":"sha256:fd7762e731dbe4374a951e311d42cce79efc32521b336c0f8dc5efea83635e6e","observation_id":"cd4dac47-1368-453e-9956-66214302bc43","resolution":{"observed_at":"2026-08-07T21:34:57.381834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-07T14:26:30.195838Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19014","last_updated":"2025-05-31T08:00:35Z","snapshot_observed_at":"2026-08-07T14:19:32.510384Z","submitted_at":"2025-05-25T07:36:50Z","title":"Tokenizing Electron Cloud in Protein-Ligand Interaction Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:26:30.195838Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2505.19014"},"observation_digest":"sha256:1876180a98cb1eaa058aad1977cfde0505bb313992225cefb9aa3fec772b58a2","observation_id":"577a4d28-e0a1-4008-9215-cc6894d99b66","resolution":{"observed_at":"2026-08-07T14:26:30.195838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-07T13:52:33.616788Z","title":"Esser, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20723","last_updated":"2025-05-27T05:07:37Z","snapshot_observed_at":"2026-08-07T13:45:37.205370Z","submitted_at":"2025-05-27T05:07:37Z","title":"LeDiFlow: Learned Distribution-guided Flow Matching to Accelerate Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:33.616788Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2505.20723"},"observation_digest":"sha256:cef5e1fb5aa9c5e386e7fd6f66d50122e6c88b634401c9f9d5cc97da8f3a2798","observation_id":"0e9060c8-496a-4dba-989b-441152cb205f","resolution":{"observed_at":"2026-08-07T13:52:33.616788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-07T04:07:11.354540Z","title":"Esser, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11753","last_updated":"2025-06-13T13:09:11Z","snapshot_observed_at":"2026-08-07T04:01:50.924410Z","submitted_at":"2025-06-13T13:09:11Z","title":"Exploring the Effectiveness of Deep Features from Domain-Specific Foundation Models in Retinal Image Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:11.354540Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2506.11753"},"observation_digest":"sha256:6223b5572cbb8bdb4a80bddb595f0d9d83dae5669dffa8e85a4f6a0079e03a8f","observation_id":"72e589fa-862b-4016-b3a5-4f6c6c8f6cea","resolution":{"observed_at":"2026-08-07T04:07:11.354540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-06T21:46:28.121890Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23589","last_updated":"2025-06-30T07:51:58Z","snapshot_observed_at":"2026-08-08T08:02:50.830843Z","submitted_at":"2025-06-30T07:51:58Z","title":"Transition Matching: Scalable and Flexible Generative Modeling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:46:28.121890Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2506.23589"},"observation_digest":"sha256:bc1dcc17912ccf4d68fc91495aef0ab5b5621eb1ebf0c3ac77e835148201684c","observation_id":"39f2225e-a259-4729-818e-3aae54b1f9ce","resolution":{"observed_at":"2026-08-06T21:46:28.121890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-06T17:58:36.667446Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14185","last_updated":"2025-07-13T02:58:48Z","snapshot_observed_at":"2026-08-06T17:52:57.895389Z","submitted_at":"2025-07-13T02:58:48Z","title":"Latent Sensor Fusion: Multimedia Learning of Physiological Signals for Resource-Constrained Devices","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:36.667446Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2507.14185"},"observation_digest":"sha256:821b1b3666837af45e6697c168dcf3645d731a0fbdaac567005e92c2920bf5ee","observation_id":"fda2a2e6-294f-44e9-9362-250e07a6b7ec","resolution":{"observed_at":"2026-08-06T17:58:36.667446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-06T10:47:00.547306Z","title":"Tam- ing transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-08T12:16:40.336330Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.547306Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:1576feecdbaf9ecbe3f671d3d160006658a810aae50a857bba625a70ad6691cd","observation_id":"25999249-f595-49b7-89a0-68e4bd432bcb","resolution":{"observed_at":"2026-08-06T10:47:00.547306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-05T15:41:16.150346Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19626","last_updated":"2025-08-27T07:04:58Z","snapshot_observed_at":"2026-08-07T22:52:36.993339Z","submitted_at":"2025-08-27T07:04:58Z","title":"Controllable Skin Synthesis via Lesion-Focused Vector Autoregression Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:41:16.150346Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2508.19626"},"observation_digest":"sha256:58e4dbea71ee70541e737c03cd0920a98ab97806f26220fba061b9e3da3b5317","observation_id":"898cb73b-271a-4ba7-830e-301c5af7812a","resolution":{"observed_at":"2026-08-05T15:41:16.150346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-05T11:29:03.656854Z","title":"Esser, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02771","last_updated":"2025-09-02T19:20:06Z","snapshot_observed_at":"2026-08-07T13:23:05.616950Z","submitted_at":"2025-09-02T19:20:06Z","title":"Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:29:03.656854Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2509.02771"},"observation_digest":"sha256:3bd9d5df87c6003fb02b3cb68155006d5e7ee25dc2e783a2d1cf5f14e2ed1b7d","observation_id":"64746141-28d3-40d5-b6fa-56f1b65a1650","resolution":{"observed_at":"2026-08-05T11:29:03.656854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-04T07:22:12.652710Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.27497","last_updated":"2026-07-18T14:25:55Z","snapshot_observed_at":"2026-08-06T07:07:19.926806Z","submitted_at":"2025-10-31T14:19:50Z","title":"InertialAR: Autoregressive 3D Molecule Generation with Inertial Frames","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:12.652710Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2510.27497"},"observation_digest":"sha256:c9d8ea0e5e6e5611012849dee1cacb3aaaebd441d7bc137927cf0f0bbdcf3b05","observation_id":"a5b1424c-630d-4465-8998-9f1c458fb51b","resolution":{"observed_at":"2026-08-04T07:22:12.652710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2605.07915","last_updated":"2026-05-08T15:52:51Z","snapshot_observed_at":"2026-08-02T05:37:32.685801Z","submitted_at":"2026-05-08T15:52:51Z","title":"What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T01:57:24.033068Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2605.07915"},"observation_digest":"sha256:33807109a8185626c4e36d8deff2fb6fafb1df4a8116be7c761b2380d4b5eb9e","observation_id":"5b12fbaa-9ad2-42d8-b177-119cdc997842","resolution":{"observed_at":"2026-05-11T04:05:57.417886Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2605.12011","last_updated":"2026-05-12T12:00:48Z","snapshot_observed_at":"2026-08-02T23:56:46.052228Z","submitted_at":"2026-05-12T12:00:48Z","title":"CaloArt: Large-Patch x-Prediction Diffusion Transformers for High-Granularity Calorimeter Shower Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T04:40:25.725622Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2605.12011"},"observation_digest":"sha256:5865243abddb514e5d87b6493e857b615aeb38d3fd3f8354bf8287c9317309dc","observation_id":"734f5076-98ec-43e1-8c66-86eb436b1fa8","resolution":{"observed_at":"2026-05-13T04:42:15.836286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2605.25012","last_updated":"2026-05-24T11:32:30Z","snapshot_observed_at":"2026-08-07T07:42:15.092770Z","submitted_at":"2026-05-24T11:32:30Z","title":"Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T12:28:33.099835Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2605.25012"},"observation_digest":"sha256:6e0534c1878b378508840e5109250a4ce7c3f445855a9019847057d131deb1a3","observation_id":"03843ae1-6ea9-475b-a954-43b6d8fe80ca","resolution":{"observed_at":"2026-06-30T12:34:38.743266Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2605.30341","last_updated":"2026-05-28T17:59:26Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:59:26Z","title":"GPIC: A Giant Permissive Image Corpus for Visual Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T07:36:21.262064Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2605.30341"},"observation_digest":"sha256:9b81ce9569b8a8f8891ad130c881bdeab40533124b9e82d9ee0f86d114c63267","observation_id":"aa44a522-961e-4bbc-942b-d6f2520129dc","resolution":{"observed_at":"2026-06-29T07:43:14.161246Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2606.02211","last_updated":"2026-06-01T13:10:49Z","snapshot_observed_at":"2026-08-02T18:41:16.377453Z","submitted_at":"2026-06-01T13:10:49Z","title":"Consistency Training while Mitigating Obfuscation via Rate Matching","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-06-28T14:25:43.147442Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2606.02211"},"observation_digest":"sha256:68ca4b0db58ca237edb2cba86464f026e106983544d4511a3be3d1b2ef3aa8dc","observation_id":"1dc90202-abb1-4242-bb93-fc2e14f65420","resolution":{"observed_at":"2026-06-28T14:32:18.108266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2606.02305","last_updated":"2026-06-01T14:25:36Z","snapshot_observed_at":"2026-07-06T23:42:44.661608Z","submitted_at":"2026-06-01T14:25:36Z","title":"Mapping Whisper Representations to Human ECoG Responses with Interpretable Time-Resolved Neural Encoding","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-06-28T11:39:30.563754Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2606.02305"},"observation_digest":"sha256:d53a1abda6513937acfe617d373c68712ddbc6831b575b667db02270108d1fd8","observation_id":"e0631fdc-ce03-4906-ba42-240e4f13806d","resolution":{"observed_at":"2026-06-28T11:42:04.140355Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2606.08032","last_updated":"2026-06-06T07:50:50Z","snapshot_observed_at":"2026-08-05T12:36:21.118127Z","submitted_at":"2026-06-06T07:50:50Z","title":"Variational Proximal Policy Optimization","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T19:22:23.768249Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2606.08032"},"observation_digest":"sha256:816389929bf30442563b25d77d8a275bd0be134c491d2ff7428e2f097083bff8","observation_id":"7aa61616-3ae2-417a-b70b-fa8eb1c68ca9","resolution":{"observed_at":"2026-07-02T21:57:26.059020Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2606.11363","last_updated":"2026-06-09T18:43:29Z","snapshot_observed_at":"2026-08-06T10:47:54.873857Z","submitted_at":"2026-06-09T18:43:29Z","title":"NSVQ: Mitigating Codebook Collapse by Stabilizing Encoder Drift in Vector Quantization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T13:18:47.472178Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2606.11363"},"observation_digest":"sha256:92fb25869b699e96d3fe9201145bb0278bb8c7a08c92568cdd5232aaa5c51eb2","observation_id":"542bbc52-ab6e-49ae-9736-e90bc4695b2c","resolution":{"observed_at":"2026-07-03T05:27:39.708579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2606.19151","last_updated":"2026-06-17T14:56:42Z","snapshot_observed_at":"2026-07-29T21:37:47.699702Z","submitted_at":"2026-06-17T14:56:42Z","title":"The Market in the Model: Latent Diffusion as Neural Economy","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T19:05:25.386543Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2606.19151"},"observation_digest":"sha256:c5814063273d6f98edfe9cbe4383a27c618a6a18f6c6b5106862d0dd3f4230ab","observation_id":"70464072-1d41-4a12-98c3-acceea611229","resolution":{"observed_at":"2026-07-04T02:49:24.758638Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2606.19195","last_updated":"2026-06-17T15:35:38Z","snapshot_observed_at":"2026-08-06T01:19:08.037803Z","submitted_at":"2026-06-17T15:35:38Z","title":"Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T21:03:43.962738Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2606.19195"},"observation_digest":"sha256:6b1fd3043132f5d0d6a60fb9942539415f2514d321da51e5f469de87ef586fc6","observation_id":"9f2441b9-0330-4bcb-b0a0-5d1c596fbad7","resolution":{"observed_at":"2026-07-04T00:39:17.090513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-01T13:39:00.040780Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19064","last_updated":"2026-07-22T15:23:32Z","snapshot_observed_at":"2026-08-08T13:02:51.341719Z","submitted_at":"2026-07-21T12:55:34Z","title":"Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:00.040780Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2607.19064"},"observation_digest":"sha256:10b5198b4772a030dd455e8c411d56dfaea75208aaeec03d00f0fa4486c023ea","observation_id":"d0707cb4-3fa8-4053-8994-3dca0f5a748d","resolution":{"observed_at":"2026-08-01T13:39:00.040780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-03T16:50:35.363661Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28945","last_updated":"2026-07-31T01:57:07Z","snapshot_observed_at":"2026-08-07T13:15:07.247869Z","submitted_at":"2026-07-31T01:57:07Z","title":"FairDiffuseVQVAE: Sampling-Time Fairness in Tabular Diffusion via Conditional Refinement of Vector-Quantized Latents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T16:50:35.363661Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2607.28945"},"observation_digest":"sha256:1a62e1cda5bf141bd4eb1bb1c588f4aa04a1789767dbbcfb0ec94a9a8b77840c","observation_id":"01433ba0-a80d-4a11-b89c-51a8c8fefd1a","resolution":{"observed_at":"2026-08-03T16:50:35.363661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2012.09841/citation-record","integrity":"/paper/2012.09841/integrity","json":"/paper/2012.09841/citation-record.json","paper":"/paper/2012.09841"},"outbound":[],"paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2012.09841."}