{"as_of":"2026-08-18T16:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59bda35af0550b5821f622e167eb38d0788ffee0840d9e3c06d65a7eceff38fd","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:41:44.333463Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:43:49.597958Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T07:37:29.558808Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12274","snapshot_observed_at":"2026-08-04T16:43:49.597958Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.12046","last_updated":"2026-07-04T12:10:43Z","snapshot_observed_at":"2026-08-13T13:57:34.064755Z","submitted_at":"2025-09-15T15:27:29Z","title":"Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T16:43:49.597958Z"},"links":{"cited_paper":"/paper/2505.12274","citing_paper":"/paper/2509.12046"},"observation_digest":"sha256:7a1cbf5e2defdf41984ae1ff55fd0a2a2ffdaf3f080c1c022196b39336d0feb2","observation_id":"271753ac-7640-4a93-a96a-038fc82083d6","resolution":{"observed_at":"2026-08-04T16:43:49.597958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"cited_work":{"arxiv_id":"2505.12274","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12274","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context-aware autoregressive mod- els for multi-conditional image generation","venue":null,"work_id":"0504c9c0-7b7b-46c4-9f8a-08cdd6168b4d","year":2025},"citing_paper":{"arxiv_id":"2605.12138","last_updated":"2026-05-12T13:58:06Z","snapshot_observed_at":"2026-08-13T12:44:14.716958Z","submitted_at":"2026-05-12T13:58:06Z","title":"Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T07:34:41.000570Z"},"links":{"cited_paper":"/paper/2505.12274","citing_paper":"/paper/2605.12138"},"observation_digest":"sha256:386fef77903936761c5e01c019415bf5b01c0367eb241a3c8b1fcfa85b51db09","observation_id":"badc69f1-39d1-4426-ada2-3893880d96f2","resolution":{"observed_at":"2026-05-13T07:37:29.562067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12274/citation-record","integrity":"/paper/2505.12274/integrity","json":"/paper/2505.12274/citation-record.json","paper":"/paper/2505.12274"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-15T20:41:44.140241Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.140241Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:bc13fa9a1d0c8cd5a04c39134c92bfee1f4c27ffa203cb1d8992ab420e068b45","observation_id":"b72b28ee-d27f-4b59-b652-c08a02eced97","resolution":{"observed_at":"2026-08-15T20:41:44.140241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.145286Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.145286Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:1bc3713023f73fe19fa74f622a0a8254204f67f394c39e351c5ae0348398fc46","observation_id":"bb9d62a0-ec5c-4cff-a9da-dec1200e868a","resolution":{"observed_at":"2026-08-15T20:41:44.145286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.149679Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.149679Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:1bde89f41efdce22bcfd6637adf4c208a3533167f361509bf2f644616498e473","observation_id":"33e2405b-606e-4cb1-aac2-de1785b56972","resolution":{"observed_at":"2026-08-15T20:41:44.149679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.153925Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.153925Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:c9f410bbd618bdd404a45919e51be3e34ff060e02dd782fb6037411dbc19a85b","observation_id":"f685d86d-f203-4fdd-8fc8-84bf1ca0a2f0","resolution":{"observed_at":"2026-08-15T20:41:44.153925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.158511Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.158511Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:b031fe73cc9594d7933446e227cdb6ec0d79cb39e349e8ebcb84f8082945a511","observation_id":"bb331460-7bf0-43be-8a3a-44a1d0927c9d","resolution":{"observed_at":"2026-08-15T20:41:44.158511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.162762Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.162762Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:5f6e80357a867994655fe97d9c0710aa65b23b3583f717ebc45461001d9e0d28","observation_id":"baa16279-307d-47ee-b8ed-523ca45f46bb","resolution":{"observed_at":"2026-08-15T20:41:44.162762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.167468Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.167468Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:dcee6c7069f320f276973f14eb336b321d944d13fb06760401b256a3675eec6e","observation_id":"156407d8-9e67-47bb-ab47-f960667c6379","resolution":{"observed_at":"2026-08-15T20:41:44.167468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-15T20:41:44.172128Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.172128Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:4e1128bfc001940bf9afd0aa85c9a04efa3c8feb4a3412f2938675c5d445ba46","observation_id":"5996f9e7-d615-4e11-98a3-32dca0f32c30","resolution":{"observed_at":"2026-08-15T20:41:44.172128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.176633Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.176633Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:6971d00f7f77c49d2341b89cb59babc1154598e90b6efbacc5de4e79449d83f3","observation_id":"3ce2e962-59ca-4e43-90ff-16527d8e76e4","resolution":{"observed_at":"2026-08-15T20:41:44.176633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.180755Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.180755Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:f6194c581f52ef000086326b8a2f8e33174034ce8dc0a86423b06de4b0a1a0f4","observation_id":"fb6d3e11-1ed5-4bba-bb81-47aea42d4937","resolution":{"observed_at":"2026-08-15T20:41:44.180755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.184861Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.184861Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:5411d9cf11fdd40dabcdda390b7a1b182b6b525ebd45d11de54fa26666d113c1","observation_id":"0821285c-ba89-4654-baab-2b341add60be","resolution":{"observed_at":"2026-08-15T20:41:44.184861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04699","last_updated":"2025-01-08T18:59:35Z","snapshot_observed_at":"2026-08-15T21:39:35.554722Z","submitted_at":"2025-01-08T18:59:35Z","title":"EditAR: Unified Conditional Generation with Autoregressive Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04699","snapshot_observed_at":"2026-08-15T20:41:44.189077Z","title":"Editar: Unified conditional generation with autoregressive models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.189077Z"},"links":{"cited_paper":"/paper/2501.04699","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:3b5b704b56f1c6c1394067a81ef366196396709548bff7341d66c1016261b1d4","observation_id":"ad9b4fb7-d4f5-4ea4-9750-e988de3e3c70","resolution":{"observed_at":"2026-08-15T20:41:44.189077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.193688Z","title":"Controllable generation with text-to-image diffusion models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.193688Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:2fa50167f50b29835aeb0e059e88a8d6c95e329b32bb9fbc0c51a024860f22b7","observation_id":"f90a00d5-9c01-4f68-bfe3-d25d032e43f7","resolution":{"observed_at":"2026-08-15T20:41:44.193688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.197889Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.197889Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:22ec261a46d661de4bb8d136aae4a4904869a15fabd60fcbbdbf4d95e8f263eb","observation_id":"e92f3527-7725-43bb-bf06-d168a9f634ac","resolution":{"observed_at":"2026-08-15T20:41:44.197889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.202079Z","title":"Generating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.202079Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:e9b6fd2482cf4ebf238a60c9aa5956d124a36bf547e1b9a21d4aac94c2cdd05c","observation_id":"70e140b5-0e1b-4239-bb14-5d96fa847898","resolution":{"observed_at":"2026-08-15T20:41:44.202079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.206302Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.206302Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:8b76a10c5ffec591dfd6c2379037ccaa3f19417fa85828f3572bbad71d03515a","observation_id":"de25290d-2691-4d0f-bfba-32629cc05dc1","resolution":{"observed_at":"2026-08-15T20:41:44.206302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-14T02:29:38.306439Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-15T20:41:44.210819Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.210819Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:4bddde0d6aa169256c6fae324a6ce01f00984fefd9f51f3dcf020732a1ca6284","observation_id":"69bdb8b2-bc96-4de2-be4d-90258f272d3f","resolution":{"observed_at":"2026-08-15T20:41:44.210819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.946179Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"00f2f2f0-0225-4639-bc79-578bb2719d7c","year":2021},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.215575Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:3a981a75695c2e70b97989c86f2b921c701a3e38688ec4c54e2631d4aef24fe1","observation_id":"be9279aa-166d-4761-bf55-cdd2798d3837","resolution":{"observed_at":"2026-08-15T20:41:44.950893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-15T20:41:44.220396Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.220396Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:24e39295617961266fa8a8eefa6b4dc93c02ed5f26859731d2754317fc76b6b1","observation_id":"a0cf1651-5935-4d74-8fc4-dc795b4f309b","resolution":{"observed_at":"2026-08-15T20:41:44.220396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-16T13:42:07.461220Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-15T20:41:44.224837Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.224837Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:8b89acaf8d91d2ff83db95814e3ec360f80a70af96f05fd294f928801c7c2293","observation_id":"c9a44ebc-a6ad-453a-9f86-163cea55f097","resolution":{"observed_at":"2026-08-15T20:41:44.224837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-08-16T14:03:52.109479Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-15T20:41:44.229696Z","title":"Visual autoregressive mod- eling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.229696Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:46796c4aa10e62038f797910371bedf12d4662861f589e36673f8472255c2399","observation_id":"b4df1f46-ef28-4521-aac4-c23afc41165a","resolution":{"observed_at":"2026-08-15T20:41:44.229696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.233965Z","title":"Frequency autoregressive image generation with continuous tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.233965Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:f0d304c7d982d2dc96bdd529f4586d2cf9f3733efc0569512624708902626fe2","observation_id":"600e19ec-a827-445f-a4f7-27b2a57186eb","resolution":{"observed_at":"2026-08-15T20:41:44.233965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11455","last_updated":"2025-04-15T17:59:46Z","snapshot_observed_at":"2026-08-16T12:40:45.550358Z","submitted_at":"2025-04-15T17:59:46Z","title":"SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11455","snapshot_observed_at":"2026-08-15T20:41:44.238033Z","title":"Simplear: Pushing the frontier of autoregressive visual generation through pretraining, sft, and rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.238033Z"},"links":{"cited_paper":"/paper/2504.11455","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:2268c4ae8dae4bd85b2f00ed3ca33da379cd92b96567a6beda52ef053d486ab7","observation_id":"c1da0a42-c1bc-45c9-b559-33b6fa260dff","resolution":{"observed_at":"2026-08-15T20:41:44.238033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.242506Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.242506Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:964c7b4f1327db157b317a6938c0f8c23fa6b3113e20d0b368f1861492483190","observation_id":"2002b53b-3a6e-4a44-b2ff-a787471e1582","resolution":{"observed_at":"2026-08-15T20:41:44.242506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T20:41:44.246734Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.246734Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:3fb9bf9c499590565e361c1e5f4ca3a702da5dad38f61d5293616f9bd7fcc526","observation_id":"149553c9-4592-453a-9ed0-62664eb578ed","resolution":{"observed_at":"2026-08-15T20:41:44.246734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T20:41:44.250824Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.250824Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:735f6810516f0d864877dab0b3f9b32643b30b6b96badff82d7a1fd52e2a125d","observation_id":"e10d45d5-dbe1-401e-a4ce-1c4d95e90ac6","resolution":{"observed_at":"2026-08-15T20:41:44.250824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-16T06:18:35.139211Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-15T20:41:44.255142Z","title":"Instantid: Zero-shot identity-preserving generation in seconds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.255142Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:1346c1fe6bc9ce24c1c6625a5bc1fa33b9c35878536458874052548e51207c25","observation_id":"140281db-9745-4e6d-a1bd-fcb950964b0c","resolution":{"observed_at":"2026-08-15T20:41:44.255142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11147","last_updated":"2023-11-02T17:59:06Z","snapshot_observed_at":"2026-08-16T15:31:56.064530Z","submitted_at":"2023-05-18T17:41:34Z","title":"UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11147","snapshot_observed_at":"2026-08-15T20:41:44.259527Z","title":"Unicontrol: A unified diffusion model for controllable visual generation in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.259527Z"},"links":{"cited_paper":"/paper/2305.11147","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:4817369c572ba533d34c6555a385bfefc01e43ba15694bf5c408dfbedcae42d6","observation_id":"04eb1b5f-e978-4aad-b908-2612a7b1d894","resolution":{"observed_at":"2026-08-15T20:41:44.259527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.264411Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.264411Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:0d137f4195d2e1362f9601974099aaf3223f02c630a08af5e61dd37013a3dc8d","observation_id":"c85d1db0-2950-417c-9d49-88b6d5af04a7","resolution":{"observed_at":"2026-08-15T20:41:44.264411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.913559Z","title":"Cocktail: Mixing multi-modality control for text-conditional image generation","venue":null,"work_id":"7b7ff163-727e-44d4-ab94-64bc6a9413f5","year":2023},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.268410Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:8ce105b471d0e13ab03fa9bf84e5f6934bfdde901261f0f921ef66281918ebdc","observation_id":"9b34388c-b1d8-436d-9d61-405d071e7e95","resolution":{"observed_at":"2026-08-15T20:41:44.918450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09277","last_updated":"2025-07-08T14:44:44Z","snapshot_observed_at":"2026-08-16T19:18:49.827586Z","submitted_at":"2025-03-12T11:22:47Z","title":"UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09277","snapshot_observed_at":"2026-08-15T20:41:44.272420Z","title":"Unicombine: Unified multi-conditional combination with diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.272420Z"},"links":{"cited_paper":"/paper/2503.09277","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:1b5e069342bd084949d0a55984c4c837a6e32801ba37badadd34773027356cc4","observation_id":"88ab3198-98a9-44f9-9e05-dcf30b0f1737","resolution":{"observed_at":"2026-08-15T20:41:44.272420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06684","last_updated":"2026-05-22T03:12:47Z","snapshot_observed_at":"2026-08-03T17:23:07.521263Z","submitted_at":"2025-03-09T16:27:02Z","title":"PixelPonder: Dynamic Patch Adaptation for Enhanced Multi-Conditional Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06684","snapshot_observed_at":"2026-08-15T20:41:44.276787Z","title":"Pixelponder: Dynamic patch adaptation for enhanced multi-conditional text-to-image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.276787Z"},"links":{"cited_paper":"/paper/2503.06684","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:c7168d1932403e95261857f81809a9164f885331bdb5dfe9a307ff013d60b3d7","observation_id":"bd65a0a1-b730-48d1-bb8d-c5646f38c5dc","resolution":{"observed_at":"2026-08-15T20:41:44.276787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02705","last_updated":"2025-03-10T06:33:37Z","snapshot_observed_at":"2026-08-16T13:12:52.742022Z","submitted_at":"2024-10-03T17:28:07Z","title":"ControlAR: Controllable Image Generation with Autoregressive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02705","snapshot_observed_at":"2026-08-15T20:41:44.281298Z","title":"Controlar: Controllable image generation with autoregressive models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.281298Z"},"links":{"cited_paper":"/paper/2410.02705","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:7b621f673d1e17c6677989cedb3164d9398161bcbc402b5090ba79be0a7bfae2","observation_id":"57013891-88c4-4c26-972e-f92f67edffd1","resolution":{"observed_at":"2026-08-15T20:41:44.281298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-15T20:41:44.285925Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.285925Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:aeb034b07b3f76d443e991fb916c34d6d22f631992e1f94078839fc5a1648ec5","observation_id":"bb1ee8e1-3d91-4b00-b86b-ec60c1380080","resolution":{"observed_at":"2026-08-15T20:41:44.285925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-15T20:41:44.290233Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.290233Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:dc195b1177147a1f66cf052602c07d2009595351d11d873923cac6a67c4438d5","observation_id":"aadbe2ac-659f-48cb-9f0f-9d346eea314a","resolution":{"observed_at":"2026-08-15T20:41:44.290233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-17T15:03:59.348694Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-15T20:41:44.294438Z","title":"Liquid: Language models are scalable multi-modal generators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.294438Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:ffbe08abc43a31eb9f99b5794d3c900f3bfb42ba2cb91ab7b53c1f913cd8b542","observation_id":"3e1a804f-8a82-4936-8c0f-600e760d5d98","resolution":{"observed_at":"2026-08-15T20:41:44.294438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-15T20:41:44.299066Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.299066Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:ad9bc9611fcbaa14fa1b35b5972a60bc74a3b2c0e6303f2677696b4bd0ef124d","observation_id":"b5b546d0-676f-40f1-a6aa-4b79c49ab343","resolution":{"observed_at":"2026-08-15T20:41:44.299066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-15T20:41:44.303093Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.303093Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:282ca392bffacc4fc46f2544adcc63e538af9263f9c734d0154eb8e1537a68df","observation_id":"a8083cf6-0782-4e88-98cf-1ce27595576c","resolution":{"observed_at":"2026-08-15T20:41:44.303093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-15T20:41:44.307195Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.307195Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:e8d6811add9888c3ed1adc92fccb49d498f6cd7104e9f34be12bbf27092f2fa7","observation_id":"befd92c9-b5f8-4bbf-8483-57ef935985d4","resolution":{"observed_at":"2026-08-15T20:41:44.307195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-15T20:41:44.311365Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.311365Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:c74f9c47105c6b46d5b0970d72dac6cfacf60c93be7251d80dcc529c362a06bd","observation_id":"9b9ac289-2f1c-478a-a6c5-a4797a24ffe0","resolution":{"observed_at":"2026-08-15T20:41:44.311365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20680","last_updated":"2025-03-26T16:15:42Z","snapshot_observed_at":"2026-08-18T09:54:12.352538Z","submitted_at":"2025-03-26T16:15:42Z","title":"Vision as LoRA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20680","snapshot_observed_at":"2026-08-15T20:41:44.316499Z","title":"Vision as lora","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.316499Z"},"links":{"cited_paper":"/paper/2503.20680","citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:8191e43037e601926ca98a823f07e8602e540869fa9803b87733ef6edf5d3978","observation_id":"eff20e51-407a-41fa-b394-a8551b0cf29e","resolution":{"observed_at":"2026-08-15T20:41:44.316499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.320762Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.320762Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:bfafe06068025c1d6b9f6a3d271922c3214560e86078ef7c1bdad2a9380d1b35","observation_id":"db49728d-d160-4e99-b914-a36dc8c5ba49","resolution":{"observed_at":"2026-08-15T20:41:44.320762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.324925Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.324925Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:ae045beaac65b9bafd91c5fb315a2758aa9e74e123246cc0c6e991c2dfcae01d","observation_id":"173ed8ee-ddfb-4d5b-8253-2ccdd449013d","resolution":{"observed_at":"2026-08-15T20:41:44.324925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.329116Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.329116Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:d4b4166906f79af6b29fa95e3ec281bdfc565a33878f09dbf53e28640210fd65","observation_id":"436078d9-53e2-4a0a-9603-d3f728769147","resolution":{"observed_at":"2026-08-15T20:41:44.329116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:44.867837Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"ed83dd1a-1924-4045-8df2-cc4d1af82620","year":2021},"citing_paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:44.333463Z"},"links":{"citing_paper":"/paper/2505.12274"},"observation_digest":"sha256:8f15471e7c9fbebb64aca81ede2ca8178c25f0f9a6b04fd7fea969efebd23118","observation_id":"2388aff6-a27b-435f-b4d1-452bf9d60b08","resolution":{"observed_at":"2026-08-15T20:41:44.874477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12274","last_updated":"2025-05-18T07:27:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T08:44:10.878537Z","submitted_at":"2025-05-18T07:27:02Z","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2505.12274."}