{"as_of":"2026-08-13T00:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c717157bfb9f4dd0a4346e12ccd120cef7fed148f9525bc0d26958d76dbdc16","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:19:25.920603Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:15:24.299457Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:58.166311Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"cited_work":{"arxiv_id":"2505.24875","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24875","snapshot_observed_at":"2026-07-04T16:39:58.166311Z","title":"Reasongen-r1: Cot for autoregressive image generation models through sft and rl","venue":null,"work_id":"1b96e53e-4a55-4eac-af91-d650ecc68e28","year":2025},"citing_paper":{"arxiv_id":"2604.02355","last_updated":"2026-03-12T12:49:26Z","snapshot_observed_at":"2026-07-06T22:51:44.663367Z","submitted_at":"2026-03-12T12:49:26Z","title":"From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-15T12:50:13.764159Z"},"links":{"cited_paper":"/paper/2505.24875","citing_paper":"/paper/2604.02355"},"observation_digest":"sha256:64163708e4b59fa6f479343e36b1bf17fb6cbb83cbcc9b476aada97c7f778a6d","observation_id":"e3360399-e04b-4581-845c-25f6cfc3c417","resolution":{"observed_at":"2026-05-15T12:50:37.142294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"cited_work":{"arxiv_id":"2505.24875","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24875","snapshot_observed_at":"2026-07-04T16:39:58.166311Z","title":"Reasongen-r1: Cot for autoregressive image generation models through sft and rl","venue":null,"work_id":"1b96e53e-4a55-4eac-af91-d650ecc68e28","year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-11T23:33:03.733557Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2505.24875","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:ead493dc56aa5557b2b6d4cdb691c08f342dbdccad5dac54534efe8261b5e19b","observation_id":"7a0a4529-8acb-4d06-9d30-ebdc5e3679fe","resolution":{"observed_at":"2026-06-29T13:23:28.285430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"cited_work":{"arxiv_id":"2505.24875","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24875","snapshot_observed_at":"2026-07-04T16:39:58.166311Z","title":"Reasongen-r1: Cot for autoregressive image generation models through sft and rl","venue":null,"work_id":"1b96e53e-4a55-4eac-af91-d650ecc68e28","year":2025},"citing_paper":{"arxiv_id":"2606.24849","last_updated":"2026-06-23T17:28:00Z","snapshot_observed_at":"2026-08-12T23:14:12.939313Z","submitted_at":"2026-06-23T17:28:00Z","title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-26T00:19:49.071495Z"},"links":{"cited_paper":"/paper/2505.24875","citing_paper":"/paper/2606.24849"},"observation_digest":"sha256:d844fb6d12867d4fced716f06f39b54516eb80a75c035ff2a5a160fc10e8f759","observation_id":"1deef55e-1035-4c6a-9b9f-9e30caa1f2f3","resolution":{"observed_at":"2026-07-04T16:39:58.167947Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24875/citation-record","integrity":"/paper/2505.24875/integrity","json":"/paper/2505.24875/citation-record.json","paper":"/paper/2505.24875"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:20.401710Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:20.401710Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:d05a33a4fdfa5b548ad89ee001473f9129c7e6865373b3db314d633f3c880449","observation_id":"5c1e8fe9-3fe8-4872-a098-beafa3743ef1","resolution":{"observed_at":"2026-08-07T12:19:20.401710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:20.452817Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:20.452817Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:bfb06e29ebad753e788a127b92228818ccd04b7e9361cae4317b4657e339b9f5","observation_id":"3bf3e526-497e-4eda-a338-cb84a3a60eef","resolution":{"observed_at":"2026-08-07T12:19:20.452817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T12:19:20.576380Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:20.576380Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:c45c7b2084a2cee1556ecd0c1dd9e6bfae0fcf494f01c3d8d62b7beeb522846e","observation_id":"46bf5d48-7188-493f-9703-1b44127a1671","resolution":{"observed_at":"2026-08-07T12:19:20.576380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:20.656887Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:20.656887Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:a5f4e0feafa2c15d3cd56ca19117ebb11f93a21eba85b745662c0d425d0afd82","observation_id":"8daead1c-a05b-4470-add4-3b022ef5fd22","resolution":{"observed_at":"2026-08-07T12:19:20.656887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-07T12:19:20.784766Z","title":"Palm: Scaling language modeling with pathways.arXiv preprint arXiv:2204.02311, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:20.784766Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:c746570f934328d0c708a54823ba2b9f65c3040e6a1b55f68d96c0e7a98e6ac2","observation_id":"343f0c26-b04a-4fc1-8f0d-a8163e34f07e","resolution":{"observed_at":"2026-08-07T12:19:20.784766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:29.798719Z","title":null,"venue":null,"work_id":"d4906dc0-818c-43ef-b5f6-be9b4fa2ef98","year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:20.911984Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:5a53fc65f09b7d891ca7827381ec3c528eaa3ad8dd8a5b0a9fb0c674be8984ca","observation_id":"821852c3-1ba3-4a06-b113-1c7319d2c6af","resolution":{"observed_at":"2026-08-07T12:19:29.907870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-07T12:19:21.002870Z","title":"Open- vlthinker: An early exploration to complex vision-language reasoning via iterative self- improvement.arXiv preprint arXiv:2503.17352, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:21.002870Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:500614a91e47ae63d6cb92611c50f7d74c18876173f8dc495d4cb502967dcdb9","observation_id":"f6ea4bee-7895-4298-8e66-469570ee9a47","resolution":{"observed_at":"2026-08-07T12:19:21.002870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-07T12:19:21.117515Z","title":"Dreamllm: Synergistic multimodal comprehension and creation.arXiv preprint arXiv:2309.11499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:21.117515Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:6e66bff356dd4becd9633aa3dc75c7c4bd2f125883cdfceeb89a264d617f12fd","observation_id":"1b39cfff-7342-40c2-9cb6-30d8444d13c2","resolution":{"observed_at":"2026-08-07T12:19:21.117515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:21.212656Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:21.212656Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:bb3339fb52e6347f3af30898858a7416d9b3b7613afdfbe36a7502f32e44731b","observation_id":"7e58fcdc-f7e4-4c6f-b9ef-5e879d8aa29e","resolution":{"observed_at":"2026-08-07T12:19:21.212656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:21.309654Z","title":"Dpok: Reinforcement learning for fine-tuning text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:21.309654Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:f6c0a2c5a64888c22cd4bef6cdd06f7a5648bc5a955fb688c1a84cc99219d17f","observation_id":"a51d3362-6996-48e9-86df-fd6597aa6307","resolution":{"observed_at":"2026-08-07T12:19:21.309654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:29.595600Z","title":"Puma: Empowering unified mllm with multi-granular visual generation, 2024","venue":null,"work_id":"07fadbc7-34c2-42df-aab1-e1e08a5138dc","year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:21.396672Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:93ed1c9366f2c5432c7500c11a7c972e71d6e90093366c11862c15e4447bbeb9","observation_id":"f18f5d7f-9a22-4321-be1b-36425a22a41a","resolution":{"observed_at":"2026-08-07T12:19:29.678412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:21.498253Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:21.498253Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:a9a5faa4c551396bb4d223ebaaa3e8745ca63ebc5d44da8b0f780034c93f66d9","observation_id":"6157ec25-e00a-48b9-82a2-c14172804ab1","resolution":{"observed_at":"2026-08-07T12:19:21.498253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:29.413435Z","title":"Gemini 2.0 flash | generative ai on vertex ai | google cloud","venue":null,"work_id":"61768db8-ad56-4883-9aab-8116a77b80ae","year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:21.617924Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:3263c6320f70dd57ecd234ede9ac621eb5102aaabffc37557d8eadc7963f396c","observation_id":"cf4decb0-ec46-4f56-9452-b537fc652045","resolution":{"observed_at":"2026-08-07T12:19:29.464037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-10T23:05:47.958732Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T12:19:21.683953Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step.arXiv preprint arXiv:2501.13926, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:21.683953Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:9b43adbee907cf8cfa06e772c574b3c539c144c51e34d71b65e62d979a5f03e1","observation_id":"081cfe8c-5871-4cda-a8be-8a5bfe6693bf","resolution":{"observed_at":"2026-08-07T12:19:21.683953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:21.765509Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:21.765509Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:235c1f7161fffdc43be094c6728bec7abbada8202c3f034289cb1354e7bd0d3c","observation_id":"80d4abed-ac5d-4170-8501-5d54b53c3ea7","resolution":{"observed_at":"2026-08-07T12:19:21.765509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:21.860900Z","title":"Soft actor-critic algorithms and applications, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:21.860900Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:3da21b0279f69311c3a34f459a201895e7917459dc7d7dfb4513761885b44f9a","observation_id":"8233b3cf-fb82-46ca-ab87-f80b740aa482","resolution":{"observed_at":"2026-08-07T12:19:21.860900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:21.920865Z","title":"Classifier-free diffusion guidance, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:21.920865Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:961d6fb343514e4816d0118ce75ab3e676a6a561f39b486724febc7211dfb33a","observation_id":"e2a7e25e-8381-4d42-8ba6-e7e858526d96","resolution":{"observed_at":"2026-08-07T12:19:21.920865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:22.006827Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:22.006827Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:dcb18d92064c84d5cb0f38340f73c90bd5b8c85278b71348d52cb4cc8a633b02","observation_id":"b7724809-66da-42df-a5ed-a3cb0cb88fd5","resolution":{"observed_at":"2026-08-07T12:19:22.006827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:22.084497Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:22.084497Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:e772e155af56890b76017316628b63f3a0a4891c26184b9d2729e6e6d4cf6fc8","observation_id":"5f08eba9-4395-440f-8037-259b9c4bffcc","resolution":{"observed_at":"2026-08-07T12:19:22.084497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:29.178026Z","title":"T2i-compbench: A compre- hensive benchmark for open-world compositional text-to-image generation.Advances in Neural Information Processing Systems, 36:78723–78747, 2023","venue":null,"work_id":"0dc16ff4-fadc-475f-a89d-7e1795c45bd3","year":2023},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:22.191019Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:d95878d4ea2612cb7cec23d4619113d54358e8240c490d693511249179defa16","observation_id":"5d1d126a-0d60-491c-b1a6-735a1959944d","resolution":{"observed_at":"2026-08-07T12:19:29.305892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:28.994639Z","title":"Comat: Aligning text-to-image diffusion model with image-to-text concept matching.Advances in Neural Information Processing Systems, 37:76177–76209, 2024","venue":null,"work_id":"ebf49295-5b00-4599-ab26-d27a7e73780a","year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:22.301080Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:73bce5dafdc471a8f4740ee0ed32ceb1ed3c1f10875acdc6a49383dc1bc14e1b","observation_id":"5bdd6b94-65d8-4e80-af5c-72392a091af5","resolution":{"observed_at":"2026-08-07T12:19:29.080539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:22.387680Z","title":"Flux.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:22.387680Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:5d2f6e76658a13a973d01cf1065f7577143c581b582260a87bf68b06a6f5a06a","observation_id":"5096048f-123e-41e5-8393-48e737c513f9","resolution":{"observed_at":"2026-08-07T12:19:22.387680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:28.801319Z","title":"Parrot: Pareto-optimal multi-reward reinforcement learning framework for text-to-image generation, 2024","venue":null,"work_id":"891bc1ef-8416-47fb-9f12-10ac3b701963","year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:22.487335Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:fb6839684606acf9ac91478dc759022c10dc8c7b96a88b891bb10d16d1aaff96","observation_id":"49ffe53d-9cab-4361-adee-16adf5907197","resolution":{"observed_at":"2026-08-07T12:19:28.868038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:28.651739Z","title":"Adaptive group policy optimization: Towards stable training and token-efficient reasoning, 2025","venue":null,"work_id":"5f1c336b-d021-4bf9-abff-17084957f00c","year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:22.590280Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:db1f9a51694c97a9c566af4eb25acd53ccf7f341b22e3a0f1f045d52a4377eea","observation_id":"3d6146c9-8d2b-42da-ae31-3ebc7a8a8a98","resolution":{"observed_at":"2026-08-07T12:19:28.727901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:28.460286Z","title":"Optimizing safe and aligned language generation: A multi-objective grpo approach, 2025","venue":null,"work_id":"6b509fc8-9910-4bb2-aacf-c7843f445a01","year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:22.687138Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:ccf54f6a1bf04190789a258b837590807b5062379498d49d612908847f3c9751","observation_id":"f9f44bc3-1cb3-4d5d-b3f4-b1640de6b4fc","resolution":{"observed_at":"2026-08-07T12:19:28.566543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T12:19:22.769245Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models.arXiv preprint arXiv:2403.18814, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:22.769245Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:5df037ea4fddb51e06a78a8daa1aa962ccb2a8bee8307834a3515358b28ed4ac","observation_id":"828aafc2-82f4-4cd0-9f28-8554f5afe805","resolution":{"observed_at":"2026-08-07T12:19:22.769245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-10T22:52:06.844699Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-08-07T12:19:22.862697Z","title":"Dual diffusion for unified image generation and understanding.arXiv preprint arXiv:2501.00289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:22.862697Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:bf2b24e9a6d947a29e013dc57745f26ec1298b8518c4dc8387da443838bd9c8c","observation_id":"e2932b53-4de1-4e27-9e66-765eb64805cf","resolution":{"observed_at":"2026-08-07T12:19:22.862697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T12:19:22.935827Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:22.935827Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:3a40ea089152eca94394a2077b8d568587264263ba1a5fde87d01861dbcfbd09","observation_id":"c8e1d637-a14e-433d-8dd3-148d08a93a13","resolution":{"observed_at":"2026-08-07T12:19:22.935827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:28.110105Z","title":"Chang, Yiyi Zhang, Kianté Brantley, and Wen Sun","venue":null,"work_id":"5d27b7ec-e018-423a-aa2c-71bfaf3ff23d","year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:23.014941Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:7aba3fd1fc4a4c4e3acbd9dfb5dd21c8acf6c94c478a0096b3c94d9ae3fd4e9b","observation_id":"7b8d0570-b9a7-454a-8e1e-32c943482cf9","resolution":{"observed_at":"2026-08-07T12:19:28.271015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:27.797978Z","title":"Introducing openai o1","venue":null,"work_id":"76557d02-84b3-4d91-8e78-de5095908eda","year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:23.089521Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:3fd73e54435e68a29f51978b2a26cfbbc13d2c6b70dd1505d2ce133b2e91b421","observation_id":"520b4094-5ab7-4ad0-a153-138c704cd78f","resolution":{"observed_at":"2026-08-07T12:19:27.940246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:27.666300Z","title":"Introducing gpt-4.1 in the api","venue":null,"work_id":"b00e9824-bb6c-4ef5-a175-514924969fed","year":null},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:23.201715Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:1f83e7f4105f43e0c8195918e8b2f9d2858cfa84c519e9e2860874cd325ccc2b","observation_id":"3b3ea3de-119a-4b93-a90f-92fd68b96a50","resolution":{"observed_at":"2026-08-07T12:19:27.721474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:19:23.398291Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:23.398291Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:4f02a6bc179fff75d5be14c5911022a7c967cc1043392dcadb57958be97893c3","observation_id":"89e19683-d077-4410-9843-a94c530ea9ef","resolution":{"observed_at":"2026-08-07T12:19:23.398291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T12:19:23.506087Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:23.506087Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:48350d89986da6b00328cd3d34c2aa2c82acd17c7f2910d2ea75b823d8848b55","observation_id":"372c4ff8-c17e-4c06-9adb-ee2ed6a42a0b","resolution":{"observed_at":"2026-08-07T12:19:23.506087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:23.651729Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:23.651729Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:9fb498a97d2915ff1799a7a31c653017d805c6d938ca792967c9987ea087c851","observation_id":"31a13edb-3c1a-41cd-a9da-eb3e6a798a27","resolution":{"observed_at":"2026-08-07T12:19:23.651729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:23.738164Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:23.738164Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:3c272ce073de342a79e8c9f6e17537231d2c3f6888dc452caf29a08cf3518b43","observation_id":"5f7fe275-a4d5-4bc1-9727-6af5bc630334","resolution":{"observed_at":"2026-08-07T12:19:23.738164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:27.505473Z","title":null,"venue":null,"work_id":"fe94dcf1-f258-41e2-899b-ebcc8c514ec1","year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:23.877617Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:bfba60753d273a4a12da48a778c8e36b4f3e63d52c5cf0b942277bcbdc289243","observation_id":"173d2c37-8d04-46d8-b035-1683117786dc","resolution":{"observed_at":"2026-08-07T12:19:27.565750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T12:19:24.034959Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:24.034959Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:61bad8301936f345282d341ddcb239b50b2308c89acd2b97a79cf4a0897ffc4e","observation_id":"9a11efb7-959b-45e4-a447-1ba8e9e07351","resolution":{"observed_at":"2026-08-07T12:19:24.034959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T12:19:24.121378Z","title":"Metamorph: Multimodal under- standing and generation via instruction tuning.arXiv preprint arXiv:2412.14164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:24.121378Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:c6b9b26b613de4d2c77d034ab9632d03b9e9b7c432ef28d5c503252616de9342","observation_id":"b5c01aea-6a02-4ecf-8945-602ee211050b","resolution":{"observed_at":"2026-08-07T12:19:24.121378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:19:24.196768Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:24.196768Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:b94b6312663da7b8835899b032cc768987ec091ee9612ef5b74ea895e45ddd57","observation_id":"64d3ceb9-bc37-4b14-9bb5-08fd01cc5432","resolution":{"observed_at":"2026-08-07T12:19:24.196768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:24.295396Z","title":"Diffusion model alignment using direct preference optimization, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:24.295396Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:96b3b17aceb5ee5538d10422ad02bbcfde37d5ee9f939cd05bfb7ff83e773165","observation_id":"f592f7ab-c063-4027-a700-c224b777c411","resolution":{"observed_at":"2026-08-07T12:19:24.295396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06673","last_updated":"2024-12-09T17:11:50Z","snapshot_observed_at":"2026-08-11T19:23:16.518889Z","submitted_at":"2024-12-09T17:11:50Z","title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06673","snapshot_observed_at":"2026-08-07T12:19:24.393195Z","title":"Illume: Illuminating your llms to see, draw, and self-enhance.arXiv preprint arXiv:2412.06673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:24.393195Z"},"links":{"cited_paper":"/paper/2412.06673","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:948f69932affd90f9934c5743fc6470dc82e66192b777e697c6e69ae8fa6f30a","observation_id":"0c6a2e07-2921-4c2e-b479-9cfde000df1a","resolution":{"observed_at":"2026-08-07T12:19:24.393195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:24.497002Z","title":"Emu3: Next-token prediction is all you need, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:24.497002Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:d5f012473e708c9a7fa38f368a2770ff212079e597a5867189804f6296a27cc8","observation_id":"20c8b5bd-20a2-4e09-b781-b42fe24073e7","resolution":{"observed_at":"2026-08-07T12:19:24.497002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:27.336914Z","title":"Powerful and flexible: Personalized text-to-image generation via reinforcement learning, 2024","venue":null,"work_id":"b601d706-cd4e-40fb-86b3-3c432eb6c0cb","year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:24.579204Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:3111482e990416317906cf525f2faeadbd2176ac67cb9837be4783c9b6d16c5f","observation_id":"3235846e-5c03-42f9-83b2-23593b499767","resolution":{"observed_at":"2026-08-07T12:19:27.412501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:24.674950Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:24.674950Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:d91f8d913d452529298ae1213cc429eaad51d11bb4e6c675a202e4de8ee6f2dd","observation_id":"b7684b6f-f80e-493d-bb61-c03aaadfeb86","resolution":{"observed_at":"2026-08-07T12:19:24.674950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:24.760779Z","title":"Show-o: One single transformer to unify multimodal understanding and generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:24.760779Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:88215ed29f9649e8390e0243d3723b2bdee5b08c2a111acf675d273f969361b5","observation_id":"90fbf0fa-8783-4cf2-b62b-ed3746a6f9ec","resolution":{"observed_at":"2026-08-07T12:19:24.760779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T12:19:24.863808Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:24.863808Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:befcc8352c2ca0b0d1984a36539844c756f30c59ecdda633d11ec7298f8e40de","observation_id":"28de2b04-32a5-4237-bfee-5ba310886afc","resolution":{"observed_at":"2026-08-07T12:19:24.863808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T12:19:24.969667Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:24.969667Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:e92260bb400f01afb2f40ca6facb99fd4cde1bfc11ba710427ab23d1465a7f37","observation_id":"bc88d3b1-c45d-4b25-9062-aadcfb317d02","resolution":{"observed_at":"2026-08-07T12:19:24.969667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T12:19:25.125571Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:25.125571Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:8298fc9171591c8ea0714dc6d0d34a1d98fc7df6142e5e645bf861adf6e0be87","observation_id":"b9d0d6fc-7e1c-441a-8cf2-ed4ba973b7c1","resolution":{"observed_at":"2026-08-07T12:19:25.125571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T12:19:25.290973Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:25.290973Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:9aab518bd17f2360bde852e77100a440783f78ace2b95af76062c4d05e9931df","observation_id":"91edc5f3-0b39-4020-858b-2545b1e2fb0a","resolution":{"observed_at":"2026-08-07T12:19:25.290973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:27.132563Z","title":"During this stage, we feed the GPT with image","venue":null,"work_id":"eca07928-5f3e-4250-9a9f-1ad4ff9610c2","year":null},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:25.460441Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:b23164b388a90e4df9eaeebb9d12a8115f9ae0b349d1210266f4953a6eecc837","observation_id":"1d1a5a19-bb02-4fe0-b268-e8d13c5bf470","resolution":{"observed_at":"2026-08-07T12:19:27.223024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:26.925055Z","title":"concise_caption","venue":null,"work_id":"03bbd686-20e0-4856-a636-9f7fc5e15fb8","year":null},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:25.547643Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:cd95b01354e60d0f4dca79a534309ba3592e60448f51f34d5121829808f06d48","observation_id":"1377adb6-564f-41e8-8aba-25747491dc2f","resolution":{"observed_at":"2026-08-07T12:19:27.030784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:26.759034Z","title":"concise_caption","venue":null,"work_id":"c4b852c7-f2ca-4cb1-8142-527009670a26","year":null},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:25.623505Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:5dc32d3b95a5b947c655358bb0a937381589de76eb87e7dd93322638cae0c786","observation_id":"aebcc363-223e-46dc-b89b-733b977dde90","resolution":{"observed_at":"2026-08-07T12:19:26.845169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:26.563326Z","title":null,"venue":null,"work_id":"71b5d602-6dc8-484b-bbbb-561585e197b5","year":null},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:25.720612Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:c193f7a046caecafeea32202f4e9b945880a311cf68065b9992797da71ed808b","observation_id":"082f4c67-bf4f-4ee3-bbdb-2f86dc07a7f1","resolution":{"observed_at":"2026-08-07T12:19:26.653408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:26.379614Z","title":null,"venue":null,"work_id":"d42dec30-971a-41fa-b4f5-d975f91c51e8","year":null},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:25.822970Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:cd195d7138138053aa55f50f1cb889de986cbeeabc9e6fb2acb75cf0c842169d","observation_id":"02b56c0d-257b-44be-b46a-0b599dc3eadc","resolution":{"observed_at":"2026-08-07T12:19:26.447247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:26.241218Z","title":"thinking","venue":null,"work_id":"9fc05866-5053-44b3-86ce-8edc4020342f","year":null},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:25.920603Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:7bf6f963c0eee42de771270c46dc6031eac1d4cc449e6ce171fd0b1083e09bdd","observation_id":"d5283f2f-b716-4494-b111-64544cefc427","resolution":{"observed_at":"2026-08-07T12:19:26.303416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:23.309417Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:23.309417Z"},"links":{"citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:8dfcdff87b372122eefed9d49b5f9523799b45dd3c9b1350653eb775a2bc520c","observation_id":"396809e4-37d1-4efd-b27f-036826693a9c","resolution":{"observed_at":"2026-08-07T12:19:23.309417Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":40,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 3 inbound Pith citation observations for arXiv:2505.24875."}