{"as_of":"2026-08-10T09:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f323aefcf0ef6190d36acf09e2ada2508aee3c78f992485e36c133ce9a33641e","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:55:56.714854Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:28:52.913763Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:18:57.820556Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-08-07T10:28:52.913763Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05331","last_updated":"2025-06-05T17:59:02Z","snapshot_observed_at":"2026-08-09T02:08:19.234840Z","submitted_at":"2025-06-05T17:59:02Z","title":"MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.913763Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2506.05331"},"observation_digest":"sha256:cef0f15e9f6d844af5586ec8ca37e04bb6c9544b99a34f518b7ba527b5776e4a","observation_id":"215d5d21-18fc-4a75-a40d-6afad8aef6a6","resolution":{"observed_at":"2026-08-07T10:28:52.913763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:5f126f8bdfa332e4541fcc2ede5ec4892eb2d77b3ee3ff2555e4c1d9ddf8b41a","observation_id":"e5ba5c38-9473-4601-832d-f72cf168f5e3","resolution":{"observed_at":"2026-05-19T07:52:10.937303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:6fa2a999e69660bcd6d90828e2db987c205bd73b7caad74b1ef9d864d9ea072b","observation_id":"f6720920-3ec0-48c8-ae9e-3d68f885258f","resolution":{"observed_at":"2026-05-13T13:27:50.062590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-08-05T20:44:15.870519Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.870519Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:4fed4ba857d26483761c4c4f594d8e588846157c063abe4fcd38c73829411d79","observation_id":"0751e862-9eb7-42f8-90f8-edd4ff0e57a6","resolution":{"observed_at":"2026-08-05T20:44:15.870519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2508.20751","last_updated":"2026-04-20T06:12:09Z","snapshot_observed_at":"2026-08-03T03:28:58.341337Z","submitted_at":"2025-08-28T13:11:24Z","title":"Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T20:31:28.371368Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2508.20751"},"observation_digest":"sha256:8f265c9da59e15d43e183711f01107673acbc7db7824158cb5a01190fdbb8c10","observation_id":"56128ab7-bace-4d99-8095-329180615e9c","resolution":{"observed_at":"2026-05-18T20:31:50.190725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2512.07348","last_updated":"2026-04-28T10:02:14Z","snapshot_observed_at":"2026-08-06T12:32:11.849043Z","submitted_at":"2025-12-08T09:40:11Z","title":"MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T00:20:58.483350Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2512.07348"},"observation_digest":"sha256:5977c769685548589bf085af534db29c305109eff26b1c05b83fd6ff910bbbb3","observation_id":"fa82dde3-e6ba-4cd9-9f27-3430c0e0db5f","resolution":{"observed_at":"2026-05-17T00:21:23.397685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-08-02T20:14:04.125091Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-08T13:47:11.850462Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.125091Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:4138b9a17fe6e54503639e5b6cd9b3d20ec5c63ed01d0ace3d7675268700122d","observation_id":"f372d45e-5e7b-40e5-94aa-87ed35887192","resolution":{"observed_at":"2026-08-02T20:14:04.125091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2604.02355","last_updated":"2026-03-12T12:49:26Z","snapshot_observed_at":"2026-07-06T22:51:44.663367Z","submitted_at":"2026-03-12T12:49:26Z","title":"From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-15T12:50:13.764159Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2604.02355"},"observation_digest":"sha256:454a7e59090fe74102ae97c03155494c53a29ea3e2f2bf0c211423cfa6fe7b21","observation_id":"d8fe2b4f-c45c-47d2-9105-f294673a21f1","resolution":{"observed_at":"2026-05-15T12:50:37.149568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2604.02467","last_updated":"2026-04-27T18:17:15Z","snapshot_observed_at":"2026-08-02T13:43:39.563153Z","submitted_at":"2026-04-02T18:58:56Z","title":"VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T21:14:42.021240Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2604.02467"},"observation_digest":"sha256:59555a0518cb25346a4499d51ef3c14f026af32539a79ce0c9d48498df581095","observation_id":"9fd36647-1579-44e2-9743-98f1d1e369a0","resolution":{"observed_at":"2026-05-13T21:18:17.195366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2604.09629","last_updated":"2026-05-27T20:51:39Z","snapshot_observed_at":"2026-07-13T22:22:34.250681Z","submitted_at":"2026-03-19T13:12:53Z","title":"HumorGen: Cognitive Synergy for Humor Generation in Large Language Models via Persona-Based Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-15T08:42:28.685159Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2604.09629"},"observation_digest":"sha256:30cb025b133defa24e518e41c825f35b18aee22dec651128a5a98aa7871bb351","observation_id":"ab32f4e7-7889-451a-912b-01d5df6cd009","resolution":{"observed_at":"2026-05-15T08:45:19.190774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-13T22:22:41.696113Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.09629","last_updated":"2026-05-27T20:51:39Z","snapshot_observed_at":"2026-07-13T22:22:34.250681Z","submitted_at":"2026-03-19T13:12:53Z","title":"HumorGen: Cognitive Synergy for Humor Generation in Large Language Models via Persona-Based Distillation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-13T22:22:41.696113Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2604.09629"},"observation_digest":"sha256:5f65eb1095b662504c7c1e873312a7a6ed69c77a86306e456ccc280ff3620d45","observation_id":"d3492cb3-6d89-4e83-9cb4-6f17fc5ff95d","resolution":{"observed_at":"2026-07-13T22:22:41.696113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2606.17888","last_updated":"2026-06-16T13:09:32Z","snapshot_observed_at":"2026-08-08T01:57:17.698279Z","submitted_at":"2026-06-16T13:09:32Z","title":"MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-06-27T01:23:40.564561Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2606.17888"},"observation_digest":"sha256:4aadcfc7758bb0a0dd07bc81bf5e82b851aa23bb7dc40c3b17484dd040a345f1","observation_id":"5476f687-e9dc-49c4-81ae-c0f378828bc3","resolution":{"observed_at":"2026-07-03T20:18:57.824204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2607.02291","last_updated":"2026-07-02T15:08:56Z","snapshot_observed_at":"2026-08-07T15:44:37.020127Z","submitted_at":"2026-07-02T15:08:56Z","title":"Optimizing Visual Generative Models via Distribution-wise Rewards","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-03T16:39:12.711424Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2607.02291"},"observation_digest":"sha256:3ed5cf4c6adb15f24c2c9ec0d1d4a112844aa200092b97efdbfaa959c1e4136c","observation_id":"7b1e81b3-7ddd-4e79-a312-382928ac04eb","resolution":{"observed_at":"2026-07-03T16:48:39.692094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17017/citation-record","integrity":"/paper/2505.17017/integrity","json":"/paper/2505.17017/citation-record.json","paper":"/paper/2505.17017"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:00.823649Z","title":"https://www.anthropic.com/claude/sonnet/, 2025","venue":null,"work_id":"a07cc04d-620b-4001-a246-ddada94c5b63","year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.317351Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:98034b848b4fe0de6b88344d9dd6e0bf6b1bdf74c843e3c1ae18e53509495f02","observation_id":"c3e0d43a-e781-4bb8-9f69-4309bee371a1","resolution":{"observed_at":"2026-08-07T14:56:00.913770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:00.642431Z","title":"https://deepmind.google/technologies/gemini/pro/, 2025","venue":null,"work_id":"ae8cdc2d-3612-4503-b9d9-0fcb466b4210","year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.378463Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:cf6a8940cf4984a2150688a74941c5f5a70dad140b88931c090437f01fa802b2","observation_id":"359f5ec5-250e-4b04-a289-1452bb414858","resolution":{"observed_at":"2026-08-07T14:56:00.726291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T14:55:50.431952Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.431952Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:8a76f89746dbfca81af47ec1e10338158f6231cce467754fc9996b9c622bf368","observation_id":"7f2ec122-7832-494f-8238-9c8fa8bef65c","resolution":{"observed_at":"2026-08-07T14:55:50.431952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-07-06T07:56:54.143277Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-07T14:55:50.485153Z","title":"MathQA: Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.485153Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:e1a7210e82a64b24935d40a1598317ca5e3e42c5e64477a4f84bedff30eec3b3","observation_id":"0f70fb72-5c3c-45e7-8989-7a6151e3e5b2","resolution":{"observed_at":"2026-08-07T14:55:50.485153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T14:55:50.558588Z","title":"Nye, Maarten Bosma, Henryk Michalewski, David Dohan, Ellen Jiang, Carrie J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.558588Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:ca74735848bd30b4243cdd9cc708329d0684a6f989ac3d9e82d35858fdfbed18","observation_id":"865e8eba-a415-411f-8e38-0a8706c7f078","resolution":{"observed_at":"2026-08-07T14:55:50.558588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T14:55:50.610635Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.610635Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:715a454baaf58b0bc9a886549d7dd5071d3b77e192be1418d0825f36ee03a69f","observation_id":"9b3f9923-ebb4-4dff-955c-ad8be9d64559","resolution":{"observed_at":"2026-08-07T14:55:50.610635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:00.493477Z","title":"MaskGIT: Masked generative image transformer","venue":null,"work_id":"56a352d7-8f0e-4e16-b51f-cf8fb5a733dc","year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.698683Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:b6b988415b87a90dd37ee7fd2890a27f90c605bb508f61d7d5704a4aee1ffffb","observation_id":"6b5d2924-ea14-4772-b4dc-cd1c2d13bccb","resolution":{"observed_at":"2026-08-07T14:56:00.581232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T14:55:50.751073Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.751073Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:3c3ed5fdfbe15fc72d0f3a78c93a10ad7511187028bb411c32279e12541366d4","observation_id":"73efef0d-ae15-4a8c-ae56-c0b095bb9ebe","resolution":{"observed_at":"2026-08-07T14:55:50.751073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T14:55:50.825180Z","title":"Janus-Pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.825180Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:9d9cc13a779017d4fbb2ff0b6ad8bb824c74868cd7e3c0e48ce7c9cfa3195199","observation_id":"bf05aa7c-a1ea-4549-8892-0e238d00bbd1","resolution":{"observed_at":"2026-08-07T14:55:50.825180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-10T05:25:44.328250Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-07T14:55:50.898025Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.898025Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:c6d62b57463212bead361b9bf965456395e04064e417c2e1f97a9f1c7a989a9a","observation_id":"9fbdc1ef-c2a2-489d-88c9-3148afa46cd8","resolution":{"observed_at":"2026-08-07T14:55:50.898025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:00.357509Z","title":"DeepSeek-R1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":"bab5f324-ca45-4045-954a-09e36e57fd8a","year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.980864Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:58280261320bb495ae7df498c7fb32c855cf4d5ca6b7fb9c3ee9bd1b6bc1c99c","observation_id":"ed3149c3-aceb-4027-bb4f-1ecaa2225239","resolution":{"observed_at":"2026-08-07T14:56:00.409929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:51.096255Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.096255Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:7939625e77170ae30014c1456f98be99964a15ec9564f0264653c0ee3a5e448c","observation_id":"b03dfef3-9e3c-4dc0-85f9-135553a7ca59","resolution":{"observed_at":"2026-08-07T14:55:51.096255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:51.104750Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.104750Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:e036d27dfe7a36c2397ea0efab33aea599b255f070d428b7ce3aef90bf12f151","observation_id":"507abb59-e777-4a29-a576-b466f32e1ca6","resolution":{"observed_at":"2026-08-07T14:55:51.104750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:00.148931Z","title":"Video-R1: Reinforcing video reasoning in mllms, 2025","venue":null,"work_id":"e4ea4932-8326-4760-a3c4-a7504d487e80","year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.147433Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:20b3c944617476fce2623d2e629d90652fa25891c73e390b43ab8d0ce1a1488b","observation_id":"9cbe2bcc-01ab-4e06-bdce-3af667445360","resolution":{"observed_at":"2026-08-07T14:56:00.209672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:51.197669Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.197669Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:2f8392241ea97bd1e61c01f17dbc8d3650baedd7765e7509478d2f7a5e9452fc","observation_id":"c97fdc58-343b-4ef6-adff-f48df04e373a","resolution":{"observed_at":"2026-08-07T14:55:51.197669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:55:51.296056Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.296056Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:60315ba515cd60b6f863dcfb684e3ed0cf13a9e5b66cf244331f8715697123cc","observation_id":"d225a9ee-30c4-4bfb-b251-25ff1b66c382","resolution":{"observed_at":"2026-08-07T14:55:51.296056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10627","last_updated":"2025-03-13T17:59:32Z","snapshot_observed_at":"2026-08-07T17:06:08.693257Z","submitted_at":"2025-03-13T17:59:32Z","title":"SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10627","snapshot_observed_at":"2026-08-07T14:55:51.415780Z","title":"Sciverse: Unveiling the knowledge comprehension and visual reasoning of lmms on multi-modal scientific problems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.415780Z"},"links":{"cited_paper":"/paper/2503.10627","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:1d59581a7b777a178ac1a31b9d98bb1d5050e7180f956178ef9959c3561a0ea3","observation_id":"217e9aec-6b6f-42ec-b807-9c66c9954767","resolution":{"observed_at":"2026-08-07T14:55:51.415780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T14:55:51.520817Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.520817Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:f7bc0765124f9ba450b728ddc52a561a66bd7927cef0a41110212c677e1d9ae6","observation_id":"052310a6-09eb-4896-a7dd-72062cfa63af","resolution":{"observed_at":"2026-08-07T14:55:51.520817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:51.647139Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.647139Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:c2127ed5557c9a8bc80b78064fb939aa1956d42c09beb074ad1aded5f50e5fca","observation_id":"2d65c360-5a19-443f-9765-18bcdeb960b2","resolution":{"observed_at":"2026-08-07T14:55:51.647139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:59.970886Z","title":"Gritsenko, Jasmijn Bastings, Ben Poole, Rianne van den Berg, and Tim Salimans","venue":null,"work_id":"54f8d88f-bde8-4ab0-99ef-2792d34dd7a6","year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.759498Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:f73f745aba3c52c30bb280e54c03f13dcfe0a99426ecc012e96d1175e946196e","observation_id":"245ed011-309c-4e79-b538-9efa1570f074","resolution":{"observed_at":"2026-08-07T14:56:00.020467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:59.810109Z","title":"T2I-CompBench: A com- prehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":"164a7976-45d0-4193-88b9-86a93622acad","year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.859745Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:c26e328aaacd22751db22b6f2b1d2628a1fbadd2bb1eb72dd8bacb61d9f6b1ce","observation_id":"972274fa-eef1-4abd-a1b6-0693320ef687","resolution":{"observed_at":"2026-08-07T14:55:59.888512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-10T03:07:35.408836Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T14:55:51.953592Z","title":"LiveCodeBench: Holistic and contami- nation free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.953592Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:35a4a95214f03144c9ba82c3805c33bf5b6dd30e0cf091efc8aa3052ca0d2d5b","observation_id":"d607f266-e310-41ae-8c12-c247a1e5c781","resolution":{"observed_at":"2026-08-07T14:55:51.953592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-07T20:35:00.460457Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T14:55:52.031634Z","title":"T2I-R1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.031634Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:98c9a73846b17c2340da9744be2c3dba0001cf061f4d6e566bb536746a1c14b3","observation_id":"6cae1717-2a14-4e02-8196-c49abafb20a8","resolution":{"observed_at":"2026-08-07T14:55:52.031634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:52.179275Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.179275Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:0abc0c84cf3e0f340e6ac53bcefe2370e0349aca4a778d26ea464eec2d825fff","observation_id":"70ee7bc9-52fd-45dd-9250-797e0d1ace69","resolution":{"observed_at":"2026-08-07T14:55:52.179275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-07T14:55:52.344176Z","title":"VideoPoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.344176Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:19466558720de2c653e1c7fb782614027eea7178e5921d1cbba83249561303aa","observation_id":"2be8be33-2dab-4e68-976c-8379b846a7ea","resolution":{"observed_at":"2026-08-07T14:55:52.344176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:52.466438Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.466438Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:c0862b1670ccef9db846cb5feb3e6bc1b6d907248a565dc8ffaf02196aea5df2","observation_id":"69914c10-c486-40b0-a882-4fff1238d08c","resolution":{"observed_at":"2026-08-07T14:55:52.466438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:55:52.582353Z","title":"LLaV A-OneVision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.582353Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:3bd088ff1ee91c73fd938f5bc196565535046e184b80975171e6b2eeb4c09824","observation_id":"76765892-f7f3-4f0a-b521-9039ed32dcac","resolution":{"observed_at":"2026-08-07T14:55:52.582353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T14:55:52.695914Z","title":"VideoChat-R1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.695914Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:c512b4028163ad860404430f091a4d2b8e8f6b6ab3e130293f5fcf716224eb61","observation_id":"5c0dda25-23c1-44e5-9915-fb6ca1751178","resolution":{"observed_at":"2026-08-07T14:55:52.695914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:59.636352Z","title":"VideoChat-R1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning, 2025","venue":null,"work_id":"deb5346d-90b7-4bf4-8ef9-ee1f46aebd6d","year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.830543Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:f34bab241b29f86ac53f9c9db1b7b58f530fc59200820ce4bf21898e1538a615","observation_id":"d6931dd5-8f76-4216-ba1f-aaaa4d0fd839","resolution":{"observed_at":"2026-08-07T14:55:59.681942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:53.002220Z","title":"Cppo: Accelerating the training of group relative policy optimization-based reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.002220Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:1175223fde26efb418132a6f0cb22e4ac78b243548422649c6f3b67489863bda","observation_id":"768dd5fd-8570-4e7a-ad2c-dd089deafb31","resolution":{"observed_at":"2026-08-07T14:55:53.002220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T14:55:53.166352Z","title":"Visual-RFT: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.166352Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:cbbb98ec9e095e9dd477713c6c1550b78cec2f73854266c42e38f99df665ba05","observation_id":"afd2a74a-c2c3-4465-ba2e-b549029c4eea","resolution":{"observed_at":"2026-08-07T14:55:53.166352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:53.258103Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.258103Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:27b0e0d1e39012c12f8b3b1dd72af0c122ba8b248704cfd3afb3d20d5446961f","observation_id":"cd557c76-2f94-4dcb-a8aa-b6415f016d87","resolution":{"observed_at":"2026-08-07T14:55:53.258103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:59.502948Z","title":null,"venue":null,"work_id":"59c6bb0b-066c-483c-af28-53bc07ef6800","year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.441712Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:69762a634a0e524bff4e80c1fe2d360604b4375700119f067bb39b91e871d101","observation_id":"6eddfe43-730f-4c0c-888d-ef2066bd308c","resolution":{"observed_at":"2026-08-07T14:55:59.554579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:53.582237Z","title":"Hello gpt-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.582237Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:bd1b0276151533a660b003a6725daaaeca0929bcd80e182404790baae1c80347","observation_id":"f8ffe76c-c587-4c75-be09-570240960d69","resolution":{"observed_at":"2026-08-07T14:55:53.582237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:59.350771Z","title":"OpenAI o1 system card, 2024","venue":null,"work_id":"c2b8f7bf-6e64-4dba-a380-a5180364556a","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.699183Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:4de84f788ba5f7ffa72773d18c124ca8cf02507f4a6e16dd4217e56b3591a65e","observation_id":"c1e073c8-ab00-4c75-822b-d03d10e2ced7","resolution":{"observed_at":"2026-08-07T14:55:59.407866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:53.844686Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.844686Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:e381c04e1bbfc726faf50f7ddd7f55064284c6a6f69718b4d1749b959b98b439","observation_id":"7805cc68-d011-4869-a0ab-e0839c948934","resolution":{"observed_at":"2026-08-07T14:55:53.844686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:59.104283Z","title":"Iterative reasoning preference optimization","venue":null,"work_id":"0effd036-2473-4264-8a62-8c4be0082c3b","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.982080Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:fda5a23b4e68d7aac0c081f9dc5a87a51e32d50eecf3dbab0e02b30df9f82e1a","observation_id":"f40e5c07-c350-4479-95d0-67056c5c6e2d","resolution":{"observed_at":"2026-08-07T14:55:59.219934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:55:54.154340Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.154340Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:f2583580b324e52470a01d3b44d248d4db903fada64500ee7a2cac768258cb21","observation_id":"493ee883-eac6-4594-b315-d8512b81770a","resolution":{"observed_at":"2026-08-07T14:55:54.154340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:54.311678Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.311678Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:c623b288afc91d5b9c239b42c43b6ab0f62ca84771e32c903b528619e80f157a","observation_id":"996690e2-b131-4ce5-874d-2a7bc002187f","resolution":{"observed_at":"2026-08-07T14:55:54.311678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:54.426573Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.426573Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:000d0703de2767551f1de7b93f37826cd0ff6e21587e10498c6c8aa1302fdaae","observation_id":"8ea8d8dc-3b12-4d22-97fa-e1300cf41597","resolution":{"observed_at":"2026-08-07T14:55:54.426573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T14:55:54.498153Z","title":"High- dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.498153Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:eba87d23ce6bfce610a6da315ce16a4327f600fd8d1fa415cbde6d567e0646a1","observation_id":"6246b52d-5954-485e-bd3d-2ebc214a4369","resolution":{"observed_at":"2026-08-07T14:55:54.498153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:55:54.567116Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.567116Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:4ba3bdedcebe761ddb6cdbe1ee19a83955b836222e0178fa56e68644f5f362c7","observation_id":"dddb4f89-c7e4-43f6-92ee-f660d2653159","resolution":{"observed_at":"2026-08-07T14:55:54.567116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:55:54.665299Z","title":"DeepSeekMath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.665299Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:00aead3926f6ede38f9533bef33e1da6f05cf6394900a273d7fd269ef1874336","observation_id":"307c3867-8f6f-4974-92fc-8b3b1bc88cd8","resolution":{"observed_at":"2026-08-07T14:55:54.665299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T14:55:54.754970Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.754970Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:eb61c6d2ce55c46e1a51e9891b467ebc19f5c3fad3fa11310064f3a3fa8821d8","observation_id":"68aa617b-2484-4b7d-8d6d-5518e7f48e6e","resolution":{"observed_at":"2026-08-07T14:55:54.754970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T14:55:54.845570Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.845570Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:518837a11082bfda090a251a4c16f1e290d78154c7d7de11c75c2625e6afb4f4","observation_id":"67ffbb2b-5402-417b-be92-d947d17bcc75","resolution":{"observed_at":"2026-08-07T14:55:54.845570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:58.899912Z","title":"LaMDA: Language models for dialog applications, 2022","venue":null,"work_id":"b222a65a-f24f-4c8c-883c-ebdc33755689","year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.911937Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:9471e467c610b49163dd8994a8e5ad3cf002f28373a32709a68ea011a361ddf2","observation_id":"12979f00-01d9-48cc-b3d3-742632bdd7ac","resolution":{"observed_at":"2026-08-07T14:55:58.997167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:55:54.983985Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.983985Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:30e66115918764f8a30e5784f4d32b3783a1a1febb93fead0431ad8d637c97e6","observation_id":"74e00793-1e6b-4c4e-bf61-f5b472092833","resolution":{"observed_at":"2026-08-07T14:55:54.983985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11455","last_updated":"2025-04-15T17:59:46Z","snapshot_observed_at":"2026-08-08T11:00:06.035456Z","submitted_at":"2025-04-15T17:59:46Z","title":"SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11455","snapshot_observed_at":"2026-08-07T14:55:55.061900Z","title":"SimpleAR: Pushing the frontier of autoregressive visual generation through pretraining, sft, and rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.061900Z"},"links":{"cited_paper":"/paper/2504.11455","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:18438a8e37faf84f7335003a7eae20e000b2e84ebad94b0a03e52712ed15f195","observation_id":"0609fef1-cc26-4865-a8ea-2ac1bf490271","resolution":{"observed_at":"2026-08-07T14:55:55.061900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:58.685385Z","title":"Reasoning in conversation: Solving subjective tasks through dialogue simulation for large language models","venue":null,"work_id":"c03f2397-6f32-4d4c-9dee-569c81873ecc","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.131047Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:88479752c2548ea273ea0b50b121b3b965749c7fb6af31cc80ef26646038509b","observation_id":"1e187a1a-9e83-4952-b891-dad26567e6e2","resolution":{"observed_at":"2026-08-07T14:55:58.794682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:58.501004Z","title":"Le, Ed H","venue":null,"work_id":"d0136c12-3ec9-4a33-94bc-05dd995cb3ab","year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.222227Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:2cb62af29fe751b996dcbc18c032c2ff7fbe11face9530e287b79b5c14048073","observation_id":"5b9cc19e-30b8-4bc5-b80a-19cec2698a79","resolution":{"observed_at":"2026-08-07T14:55:58.573936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05236","snapshot_observed_at":"2026-08-07T14:55:55.299644Z","title":"Unified reward model for multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.299644Z"},"links":{"cited_paper":"/paper/2503.05236","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:f9c4a1b66affea0606047ce7aa1ae411099c899118ce552ab37c6aa35baea95c","observation_id":"a7820c84-0c1f-4296-9edb-9640123c910d","resolution":{"observed_at":"2026-08-07T14:55:55.299644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:55.388496Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.388496Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:7fc3ccfdf3d9ce7941d8e582bdd2ffabf888966c3017aa9835a11631ebd63f16","observation_id":"4c0a8dfa-552e-48f1-b390-7b3b6fc9aa2f","resolution":{"observed_at":"2026-08-07T14:55:55.388496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-07T14:55:55.475472Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.475472Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:22f89d83c5caa376215f5f37af320757bd48985d4c96a89f7cb72b9ad2480f24","observation_id":"0c95efc2-6a09-4c19-a25d-aecb404deb1b","resolution":{"observed_at":"2026-08-07T14:55:55.475472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-07T14:55:55.543870Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.543870Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:4cbadb2b318e94f5f7a4b225c6c02cfbd61d1d7a0ced83fd69002082d3f66c05","observation_id":"9bbd3866-6666-4c54-bc94-565bacdcece0","resolution":{"observed_at":"2026-08-07T14:55:55.543870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T14:55:55.602449Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.602449Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:2f3f49f02b896e5f3ef07d2544bbce3155fa31bb5163d60a828272945292b4a5","observation_id":"c0e88441-b730-427f-bee8-b976b37589ea","resolution":{"observed_at":"2026-08-07T14:55:55.602449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:55.664044Z","title":"ImageReward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.664044Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:9b038d1384fbbbf585a27bbd7039ed2e17b015d05dcba182bbaee97d9097bc81","observation_id":"5f2273de-bae4-489f-9dbd-b4131c80edd4","resolution":{"observed_at":"2026-08-07T14:55:55.664044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-07-06T18:01:05.698046Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-07T14:55:55.743601Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study.arXiv preprint arXiv:2404.10719, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.743601Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:3dfd6812ea880a817d22c1bce865adcbb3beae8bdeba788cc85b8c6b00ae4588","observation_id":"2411a786-693a-4729-b382-0ad45550c05d","resolution":{"observed_at":"2026-08-07T14:55:55.743601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-08-10T06:20:33.458844Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-07T14:55:55.854961Z","title":"Dancegrpo: Unleashing grpo on visual generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.854961Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:96c03fa6a6c539f565590e8508e8a03ab7beb1d0cbecb9145afac9ed4f57f594","observation_id":"111ed8cb-763d-4fa0-8eda-bb83ab36e378","resolution":{"observed_at":"2026-08-07T14:55:55.854961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T14:55:55.929798Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.929798Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:a9866f13768905fc399e1d210e3b2ccba13b8084b0188077564f9d36b167d034","observation_id":"4ef71de6-d9f6-4576-8362-a8326dc81bc1","resolution":{"observed_at":"2026-08-07T14:55:55.929798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-07T14:55:56.042260Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.042260Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:5eb3cdf31d175d1140c08eabe33ad17dcc09c49368c711d6b2712d98505e452b","observation_id":"d5c1b975-fb60-4432-b4ea-9fedb2b99cf2","resolution":{"observed_at":"2026-08-07T14:55:56.042260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:55:56.192183Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.192183Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:7299c01bea2de4c18149ad1c2d2caadeaa73b54645015f422cad70faa81f55f6","observation_id":"249c4d65-1e62-49b1-8920-e501a572bab4","resolution":{"observed_at":"2026-08-07T14:55:56.192183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:58.310608Z","title":"ReST-MCTS*: Llm self-training via process reward guided tree search","venue":null,"work_id":"dca08680-eea9-4341-a674-9543e94b97da","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.304989Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:84c87870434e63d70f2930e98047450dbfef252598c0e2ed58cc6f3b76edd922","observation_id":"88d1fbe9-1623-40cf-bcb3-e30f7da695b7","resolution":{"observed_at":"2026-08-07T14:55:58.393634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:56.411952Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.411952Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:678a67dc2ca612f951b13a2688c6e53f00640f482e11707a54a92e4e40a26e49","observation_id":"32fe3a93-ddcd-4ff6-9d99-efd0f5a22756","resolution":{"observed_at":"2026-08-07T14:55:56.411952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:58.089987Z","title":"Llama-adapter: Efficient fine-tuning of large language models with zero-initialized attention","venue":null,"work_id":"8e096bfe-eafb-4d29-a780-6c2f15359174","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.497410Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:a814f98c8c457da6f6937bc2c32fb63226442bb8524e33819feee1b644301957","observation_id":"e1ee7f91-4b22-4b0f-9b66-5ce90750e7d0","resolution":{"observed_at":"2026-08-07T14:55:58.222658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:57.851519Z","title":"MathVerse: Does your multi-modal llm truly see the diagrams in visual math problems? ECCV 2024, 2024","venue":null,"work_id":"c9296d24-e5b9-489f-ba8a-c1223a208a67","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.612251Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:1becb519451ba3bc16453d29c1b6205e4a7fbf8b76042dcc87aae70f44174d6a","observation_id":"fd2712e2-69dc-46ff-b7c0-86a9b2a7b790","resolution":{"observed_at":"2026-08-07T14:55:57.995183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08739","last_updated":"2024-11-01T22:14:24Z","snapshot_observed_at":"2026-07-06T18:45:01.801741Z","submitted_at":"2024-07-11T17:59:47Z","title":"MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08739","snapshot_observed_at":"2026-08-07T14:55:56.665148Z","title":"Mavis: Mathematical visual instruction tuning with an automatic data engine","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.665148Z"},"links":{"cited_paper":"/paper/2407.08739","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:69310cc889ae960ba3d51ad85fa87955fe5ec5733e7a7dbc25889de6c0503e71","observation_id":"b529bdf1-551a-4362-aa4e-a75d6d4924ab","resolution":{"observed_at":"2026-08-07T14:55:56.665148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:57.612301Z","title":"SafetyBench: Evaluating the safety of large language models","venue":null,"work_id":"7d5e0f89-d934-4ce1-85e7-8fada273e085","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.714854Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:6f47738bd6b0155cb077859c7cdc009bae42c454a237d3dd797a8735a4985252","observation_id":"feb97369-90bc-4b4f-8c97-12b7ce006be6","resolution":{"observed_at":"2026-08-07T14:55:57.728336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 13 inbound Pith citation observations for arXiv:2505.17017."}