Pith. sign in

Paper Citation Record · LEDGER

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation

As of 18 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2505.19874.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19874 v1

Coverage vector

measured 54 of 54 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:09:51.624919Z

measured 55 of 55 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T15:39:15.744954Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T22:16:15.736010Z

Reference resolution

54 of 54 outbound references displayed

  • verified exact0
  • verified fuzzy5
  • unresolved49
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation fca194cd-a8c3-4df0-bf7a-6449a1491836 · outbound

This paper cites Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:45.731908Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:45.731908Z digest=sha256:3d9cd2d6f9be7379ec3a1bf2bc4da8646f8ad4f21e00f1c475c2f7b3b97bb47e

Observation 553fa905-4ac6-48b9-b1e9-47d505f6ce20 · outbound

This paper cites Training Diffusion Models with Reinforcement Learning.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Training Diffusion Models with Reinforcement Learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:45.870974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:45.870974Z digest=sha256:44675099483b5a8be47fa60db4068b5014ec789c70cc180cf2a6e1886c31059a

Observation 3565bfa3-3c4d-4b1d-9819-e73f4624deba · outbound

This paper cites Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:45.950201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:45.950201Z digest=sha256:134ed59d2ab479f3e88899f48ba122ff6b71da88c58a0f25b5547eb2946c976c

Observation 2ac5ac4d-1524-4b64-9514-e256ac64affa · outbound

This paper cites ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.064937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.064937Z digest=sha256:03e9966dc579713c5c2af9b70533ba47e6ac6fb54e4388e18a90d56181724d04

Observation 2aa0bf26-a6e9-4d30-973b-3ca8139ac5df · outbound

This paper cites Scaling rectified flow transformers for high-resolution image synthesis.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Scaling rectified flow transformers for high-resolution image synthesis

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.163330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.163330Z digest=sha256:ef9b1898c208564b0fb0f2eb98e6cc8c9e2865fc78f3fafa213e58ccecbac7d0

Observation 7d85b30b-5d56-475e-99e7-0f8838bcd45d · outbound

This paper cites Taming transformers for high-resolution image synthesis.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Taming transformers for high-resolution image synthesis

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.335590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.335590Z digest=sha256:239936c3703956f0edeb1baa0d98b2f2154323a18da89b4ee2e0b1636400cbe0

Observation 52a0af3a-fa36-40b7-9763-9d6f62c03901 · outbound

This paper cites Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.457415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.457415Z digest=sha256:ca9699922eef961839488f5148389c10d6fd685d64da1b461c4a1c2d491c8050

Observation 60228cfa-672a-4918-8fd0-757974f8416a · outbound

This paper cites Dpok: Reinforcement learning for fine-tuning text-to-image diffusion models.Advances in Neural Information Processing Systems, 36:79858–79885, 2023.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Dpok: Reinforcement learning for fine-tuning text-to-image diffusion models.Advances in Neural Information Processing Systems, 36:79858–79885, 2023

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.587603Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.587603Z digest=sha256:5728a6679952466ada4299347b252ade96f8c1aa0ad2fda4c0edd696666d979b

Observation f88e1f5a-04fb-407b-8b98-d43ede3e84eb · outbound

This paper cites StyleShot: A Snapshot on Any Style.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation StyleShot: A Snapshot on Any Style

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.712967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.712967Z digest=sha256:d8b30652b2cbc3df787b2b303d11bf8723860100532a51b016f8d021ffbed40b

Observation eee7be35-5f74-40fc-ae14-402c4b3ccf6e · outbound

This paper cites Style aligned image generation via shared attention.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Style aligned image generation via shared attention

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:09:52.959159Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:09:46.821562Z digest=sha256:b123c277aecd97914bbbcd845b8f278830c41dd53e16babee9a98e8d9724038c

Observation 8d6ae7e1-01ae-43f3-aad5-da71b25ca712 · outbound

This paper cites Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.917764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.917764Z digest=sha256:47bb27dbb370eede1bab2b3d39dd855c3674c8f7ee650a64ed54908b33fc28e4

Observation d9a81883-174d-4c7a-857b-a909adbb5bb3 · outbound

This paper cites ArtCrafter: Text-Image Aligning Style Transfer via Embedding Reframing.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation ArtCrafter: Text-Image Aligning Style Transfer via Embedding Reframing

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.012312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.012312Z digest=sha256:4804846dfa202def2eda57be7b4155e2b43c5dcdb598e156e567e0ab1eb4eb46

Observation a0c6081a-9917-4462-95bb-3fa18a84a8df · outbound

This paper cites Perceiver: General perception with iterative attention.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Perceiver: General perception with iterative attention

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.106522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.106522Z digest=sha256:162c9afc6c98f3718a703883cd27be507ed1bfe42db31c2053de39a0286989c0

Observation 7852db0d-bada-4321-8f55-cfaa4444fbcf · outbound

This paper cites Visual Style Prompting with Swapping Self-Attention.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Visual Style Prompting with Swapping Self-Attention

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.274938Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.274938Z digest=sha256:f0ccde0ab03c6caacd81650227747a87bb903dd19709c42bbd14c84df96e6f22

Observation fafef86f-84bd-4705-9e7a-981bb7cf327e · outbound

This paper cites Segment anything.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Segment anything

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.387252Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.387252Z digest=sha256:fd5a6d8097d195b19981319b3f565535f8140d305d275b3f85e88c26100dbe18

Observation 3d1eaeae-a419-4d3f-aceb-f0793953549b · outbound

This paper cites Flux.https://github.com/black-forest-labs/flux, 2024.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Flux.https://github.com/black-forest-labs/flux, 2024

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.496926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.496926Z digest=sha256:d45427f5580f87f38d47102c2a0de3f4f3d136dcccf02d0ed2f9ea1f9434cf4e

Observation 62cec599-c947-4a54-b4b7-ad3b636aa6b3 · outbound

This paper cites Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.643689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.643689Z digest=sha256:086cd8e714a12883149eedf44621c3d0db48434df5707e5866683a693bff5f46

Observation 4ab2158d-e721-4a63-b636-481678a58907 · outbound

This paper cites StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.837080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.837080Z digest=sha256:6e81cac226ac275a6bb38e6d885c825850feab5813d4a9d7b697bdc3797b53bf

Observation 223b7d21-e690-430f-b59f-43440290ec1b · outbound

This paper cites Subject- driven text-to-image generation via preference-based reinforcement learning.Advances in Neural Informa- tion Processing Systems, 37:123563–123591, 2024.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Subject- driven text-to-image generation via preference-based reinforcement learning.Advances in Neural Informa- tion Processing Systems, 37:123563–123591, 2024

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:09:52.808695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:09:47.959998Z digest=sha256:b288b49b17eefa572f3acd9f3668c57b43b58e748ad2213006594f5a07f2c0d2

Observation 2b3f036d-3edd-4154-8dd7-c4506dfa1e04 · outbound

This paper cites Null-text inversion for editing real images using guided diffusion models.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Null-text inversion for editing real images using guided diffusion models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.082465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.082465Z digest=sha256:616bac0d7a80b332dfdd5f297b04a0cdef815876ed46779cd16622e26a36adcd

Observation b130d34c-c462-45db-b785-95a970aac38a · outbound

This paper cites laion2b-en-aesthetic-square-cleaned.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation laion2b-en-aesthetic-square-cleaned

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:09:52.613031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:09:48.196971Z digest=sha256:3f7e57fc9edf6fd6dec08a0f0ec848cd4bae2f093212a8ba73b7becb7aa5d288

Observation 911f2656-fcfa-4452-8d16-551ae59a4052 · outbound

This paper cites Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.284105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.284105Z digest=sha256:cfda10fefcc9d132fc3fd074452be003c220ea476b2a4d096b9f62ae8c6fb91a

Observation d50eb054-58ba-48c6-9ad2-6e456181a4b2 · outbound

This paper cites SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.397477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.397477Z digest=sha256:170531da7557f71e134324bb8c3b760801d23c7206c00c7cafd34439f6729d20

Observation d5f0034e-e5c8-4564-985c-d8494719ec4f · outbound

This paper cites Learning transferable visual models from natural language supervision.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Learning transferable visual models from natural language supervision

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.520560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.520560Z digest=sha256:ed7e223109bf3ca147e1e0f0bdbe157bcf627c86532f333bd5506d8795c14455

Observation f6c746c1-c854-42f7-ba74-323803890a41 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36:53728–53741, 2023.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36:53728–53741, 2023

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.648234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.648234Z digest=sha256:7c913ecf47de6686c1302a5eb39d4de0dbf20e4dd420c2a2a189136b23247b6c

Observation 14e3aa5a-d94c-463c-9809-a11f8e8f719c · outbound

This paper cites High-resolution image synthesis with latent diffusion models.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation High-resolution image synthesis with latent diffusion models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.756291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.756291Z digest=sha256:e6b510be2e2667f0aaf4399ff3e11f221c9c211d8d373a219f0253fa36132ecc

Observation c3159c19-a960-4ef4-ab87-66015d4ed7c9 · outbound

This paper cites Dream- booth: Fine tuning text-to-image diffusion models for subject-driven generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Dream- booth: Fine tuning text-to-image diffusion models for subject-driven generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.908838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.908838Z digest=sha256:2b112b88c28680d9f4f2b43202094547fd80ec226559fcca00b9e58663c50948

Observation 26cfabbe-36b6-43a5-aac6-36c58d806951 · outbound

This paper cites Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.042874Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.042874Z digest=sha256:be8fa7adf59cc6750f9afd98893839ac17f79e07d273764d490791833cc947fe

Observation 70dba0c1-a7db-4ba6-8332-8b89f016be9b · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.175385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.175385Z digest=sha256:3204f5d97cb7f6ba60b3997b4fb9026c42847b320dd910cd74b7ec399381a12b

Observation 9f323023-1822-4b25-992d-026a06635e34 · outbound

This paper cites StyleDrop: Text-to-Image Generation in Any Style.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation StyleDrop: Text-to-Image Generation in Any Style

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.329940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.329940Z digest=sha256:bd12a7e9126726e1e0445f6ed7b71317366467e04eee658db5beb9ff30f30d00

Observation 8b31ddba-8737-42d6-ba19-0449dca3b32a · outbound

This paper cites Personalized Text-to-Image Generation with Auto-Regressive Models.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Personalized Text-to-Image Generation with Auto-Regressive Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.457645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.457645Z digest=sha256:d580b10e35d9573187965729d634b0e5b6e3a72e3c1ca9f50e19d714b03b1b52

Observation d910e862-9f95-4dc7-bcee-fe054e31eabb · outbound

This paper cites Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.568383Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.568383Z digest=sha256:b73ef01138cc3a0deec2bc5d5acb853e00b9e963d91ebd70b3ea30120968ab92

Observation 07711783-a8f8-499c-9f8f-d8908afdaad4 · outbound

This paper cites HART: Efficient Visual Generation with Hybrid Autoregressive Transformer.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation HART: Efficient Visual Generation with Hybrid Autoregressive Transformer

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.659343Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.659343Z digest=sha256:bc4d1dcaf332f3bea5e8cb507898f776bdb3c24d45d69638bb92e50eda91d832

Observation c3bc4e6a-cc68-4997-a6ef-2975ad03ecab · outbound

This paper cites Chameleon: Mixed-Modal Early-Fusion Foundation Models.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Chameleon: Mixed-Modal Early-Fusion Foundation Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.739182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.739182Z digest=sha256:77e559a24326b0fd35b77b576ddedb414ec5b964f000dc86cd9ead9cfb227958

Observation 32c66ba3-57c9-4e13-90f4-cf92abc8c600 · outbound

This paper cites Neural discrete representation learning.Advances in neural information processing systems, 30, 2017.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Neural discrete representation learning.Advances in neural information processing systems, 30, 2017

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.806310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.806310Z digest=sha256:7b300e2ac6c1b26e4a9515a70b86dce4cc688564780ca6f2dea61c247eed4a83

Observation 0e61c2d1-a85a-4246-8f3f-9c48c543c9d3 · outbound

This paper cites Attention is all you need.Advances in neural information processing systems, 30, 2017.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Attention is all you need.Advances in neural information processing systems, 30, 2017

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.891224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.891224Z digest=sha256:8e978f9f54a61960a97b75599f36ac2eabce1325e0f82db1a59387d57c495470

Observation 43711ad9-0f2f-4974-a897-03930acc6342 · outbound

This paper cites Diffusion model alignment using direct preference optimization.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Diffusion model alignment using direct preference optimization

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.981311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.981311Z digest=sha256:6896a97ae06fab8e8742de1192ff2d259d3a60a64321aa00d6e99b237cb251e6

Observation d25ef643-909f-4c41-8b38-62c3b186eafd · outbound

This paper cites InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image Generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image Generation

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.090014Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.090014Z digest=sha256:f145cc86b4f2bf299165959a33955ea841fd3c1dfbf6711ab3b7e47572fd1b6a

Observation 167101e9-00ba-48f5-916f-a737441f8334 · outbound

This paper cites SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.181832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.181832Z digest=sha256:bd64a9bc775a9e06bfc24d6501f4e9d7e0443591b7f7e237c0989a15d229d688

Observation 673a9799-3486-4b31-a59a-40c1f88c89bb · outbound

This paper cites Emu3: Next-Token Prediction is All You Need.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Emu3: Next-Token Prediction is All You Need

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.256992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.256992Z digest=sha256:dd32306fc473e9c6e695408916e2b2d1abfba7e8e408d334e792e9d0f4d1c202

Observation 1837bbb7-6f50-4586-896c-b6370f689afc · outbound

This paper cites StyleAdapter: A Unified Stylized Image Generation Model.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation StyleAdapter: A Unified Stylized Image Generation Model

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.366092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.366092Z digest=sha256:17b86a358ffea6df8ed1fa775073902249c0f34fe14fa051db8d4a852512a74f

Observation 58afe69c-7688-4c7d-b860-5502e679028b · outbound

This paper cites wikiart.https://huggingface.co/datasets/huggan/wikiart, 2022.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation wikiart.https://huggingface.co/datasets/huggan/wikiart, 2022

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:09:52.388325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:09:50.466440Z digest=sha256:2c2dbc3d0436937989e2352c151adc33e591eafdccdd38826018f240f9f89377

Observation ddb66204-867c-4349-9b57-c15e7ea53cd0 · outbound

This paper cites Infinite-id: Identity-preserved personaliza- tion via id-semantics decoupling paradigm.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Infinite-id: Identity-preserved personaliza- tion via id-semantics decoupling paradigm

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:09:52.228010Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:09:50.566996Z digest=sha256:5a6c1bc7904e1d2977d12f97473a29f826421c6805ba7727663f0bddf73b48bc

Observation cb0ad2dd-95d5-4dae-adb5-69ad8dbe9f34 · outbound

This paper cites Proxy-tuning: Tailoring multimodal autoregressive models for subject-driven image generation.arXiv preprint arXiv:2503.10125, 2025.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Proxy-tuning: Tailoring multimodal autoregressive models for subject-driven image generation.arXiv preprint arXiv:2503.10125, 2025

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.668515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.668515Z digest=sha256:88d0a18d42ca56ca2df5da196f36074a16d6ac510e1899183b2a51bab55f845b

Observation e867ddc8-17ba-4b2c-a725-eb741b1236ca · outbound

This paper cites OmniGen: Unified Image Generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation OmniGen: Unified Image Generation

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.758122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.758122Z digest=sha256:23b98d4feca365ed5595ffc9e79d538df8285429739d8b0dfdf33873ddf94575

Observation 2a394c5d-423a-47e0-b993-212d765cccb3 · outbound

This paper cites Show-o: One Single Transformer to Unify Multimodal Understanding and Generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Show-o: One Single Transformer to Unify Multimodal Understanding and Generation

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.817953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.817953Z digest=sha256:3f0d27037df0392196ff52c318c31d3d8c34950e70ce110cc0df14067c122eee

Observation b3bcf9ed-255f-4ce8-ac85-953facd9d194 · outbound

This paper cites Imagereward: Learning and evaluating human preferences for text-to-image generation.Advances in Neural Information Processing Systems, 36:15903–15935, 2023.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Imagereward: Learning and evaluating human preferences for text-to-image generation.Advances in Neural Information Processing Systems, 36:15903–15935, 2023

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.936277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.936277Z digest=sha256:a6ec31ebffd9052321dcecd00abe14c289cff3ef8479f6316485c8b17d3c48f1

Observation afb59c33-aab3-486e-b7ea-ddd39bb7179f · outbound

This paper cites DanceGRPO: Unleashing GRPO on Visual Generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation DanceGRPO: Unleashing GRPO on Visual Generation

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.031982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.031982Z digest=sha256:60c444dc3b4eba91bc1a38569c9c0be427effa05edd02cd5fb6f0077863df15e

Observation 423cda56-fd6a-4788-9cc6-8d764dc2b684 · outbound

This paper cites Qwen2 Technical Report.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Qwen2 Technical Report

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.113980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.113980Z digest=sha256:9c379d3912b8c29e1624c05f7a612cd01c12f9664f6ef2dfc8faace19e31816b

Observation 0149abf8-906e-4d68-a893-d6b5293125f1 · outbound

This paper cites Qwen2.5 Technical Report.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Qwen2.5 Technical Report

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.235032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.235032Z digest=sha256:0125f40c8d4ad0af3b5ee7bf386402832777db24e2bf3958d9b39ddb1c126378

Observation 74ff1e8c-efe5-446a-992d-dc056d8f6b86 · outbound

This paper cites IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.352941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.352941Z digest=sha256:c12551b386a5b611adaf449e0303df37ed852877d1394c3cb414f80afa6ece9b

Observation 52a76abc-8b38-4013-b333-46543c7ce459 · outbound

This paper cites Vector-quantized Image Modeling with Improved VQGAN.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Vector-quantized Image Modeling with Improved VQGAN

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.442736Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.442736Z digest=sha256:480a9b92aff3adfb92a6971dc07e08d5a8f96339ad428caa2ae2674e06de0bf9

Observation 08a76191-56d2-44a6-bd9d-86c777b74e32 · outbound

This paper cites DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.515360Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.515360Z digest=sha256:7e2d41fa22af9a4b226d312bb263ccf4967c7ab656bfa3ec20ddbdbc287f7a23

Observation fe1ac081-b2d4-4c35-bc7d-77d0e8557472 · outbound

This paper cites Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.624919Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.624919Z digest=sha256:26f1621b18f1654451677d7b1b2530b46431d064aee720c3c2bb8cbca1724c57

Pith citing papers

Observation 0ef21c97-a801-42c5-9cf6-f5d435d29a09 · inbound

Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering cites this paper.

Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation

Reference 58

Resolution
verified exact
arxiv_id, observed 2026-07-01T22:16:15.737555Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-28T15:39:15.744954Z digest=sha256:8baaabd314d40337e9c4d1f17b6f61219222113fc2f342554e8e7328246ea77c