{"as_of":"2026-08-15T07:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b9d7ecd25c3f0f0b06240aab8cfb8e8ff6346030928617fd6d2d599e8bdf6dab","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:26.232105Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:18:33.490433Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:03:13.983158Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19196","snapshot_observed_at":"2026-08-07T12:18:33.490433Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-13T04:32:44.496715Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:33.490433Z"},"links":{"cited_paper":"/paper/2505.19196","citing_paper":"/paper/2505.24787"},"observation_digest":"sha256:b22a14f2dd69643c478ac95770836407d71d8e9af03c97e9de1c77542170496f","observation_id":"45e9e2b8-63b4-4484-a920-a61a0bdab5c2","resolution":{"observed_at":"2026-08-07T12:18:33.490433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19196","snapshot_observed_at":"2026-07-14T21:09:36.040879Z","title":"arXiv preprint arXiv:2505.19196 (2025) 3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14526","last_updated":"2026-06-28T22:57:12Z","snapshot_observed_at":"2026-08-14T01:17:29.166622Z","submitted_at":"2026-03-15T18:07:29Z","title":"LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T21:09:36.040879Z"},"links":{"cited_paper":"/paper/2505.19196","citing_paper":"/paper/2603.14526"},"observation_digest":"sha256:0f9ef3386f198521964ae7c4d8fbc340a12589f67139f4ff0d77660a0b4cd0a2","observation_id":"fb275552-9d13-432f-8f4c-003c320e670b","resolution":{"observed_at":"2026-07-14T21:09:36.040879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"cited_work":{"arxiv_id":"2505.19196","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19196","snapshot_observed_at":"2026-06-29T08:03:13.983158Z","title":"Step-level reward for free in rl-based t2i diffusion model fine-tuning","venue":null,"work_id":"cf021125-1fd3-49b4-9144-9fefbe53e155","year":2025},"citing_paper":{"arxiv_id":"2604.15311","last_updated":"2026-05-03T11:22:04Z","snapshot_observed_at":"2026-08-14T05:02:02.000375Z","submitted_at":"2026-04-16T17:59:56Z","title":"LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T11:23:28.424453Z"},"links":{"cited_paper":"/paper/2505.19196","citing_paper":"/paper/2604.15311"},"observation_digest":"sha256:baa0efe3bb82608e13c4023c59c0b4f8a8220ca3e593b18e894b5fceb4ff10aa","observation_id":"71e0a791-1444-4142-a587-66be70140e9f","resolution":{"observed_at":"2026-05-10T11:25:18.786800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"cited_work":{"arxiv_id":"2505.19196","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19196","snapshot_observed_at":"2026-06-29T08:03:13.983158Z","title":"Step-level reward for free in rl-based t2i diffusion model fine-tuning","venue":null,"work_id":"cf021125-1fd3-49b4-9144-9fefbe53e155","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2505.19196","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:042da1673a4eb620ab1afbc9ee8dc4e24df9b41573f9c32b39c92937d7caa66c","observation_id":"e2f44700-b3bf-4fee-b294-a22df8a5e414","resolution":{"observed_at":"2026-06-29T08:03:13.984555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19196/citation-record","integrity":"/paper/2505.19196/integrity","json":"/paper/2505.19196/citation-record.json","paper":"/paper/2505.19196"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.819886Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics,","venue":null,"work_id":"b9242752-5dda-4042-8e1c-22b10f98dc97","year":2015},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.059212Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:3ec12b1476b6a4b26500d4af36279058a25592f7ac2c8b9a4b8de608d4db2807","observation_id":"4a59cfb8-d6c1-4a4a-98d1-7b9a0c718506","resolution":{"observed_at":"2026-08-07T14:25:26.824017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.062747Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.062747Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:9c792b6718d43cfb4cafae130f45221a987cfa3e693ebf219007e01131f9a26f","observation_id":"b9b42b1d-c934-4fe3-a11f-9245bc2f86dc","resolution":{"observed_at":"2026-08-07T14:25:26.062747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T14:25:26.066590Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.066590Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:c740ff78b1873d6d0133af83c5397b8288cc57f1a1e94146f15cf188340b66ea","observation_id":"f9f7afaf-0e9b-44a9-8d97-aa9f714e2f5e","resolution":{"observed_at":"2026-08-07T14:25:26.066590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00948","last_updated":"2025-03-02T16:06:16Z","snapshot_observed_at":"2026-08-14T09:43:39.481397Z","submitted_at":"2025-03-02T16:06:16Z","title":"Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00948","snapshot_observed_at":"2026-08-07T14:25:26.069859Z","title":"Extrapolating and decoupling image- to-video generation models: Motion modeling is easier than you think,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.069859Z"},"links":{"cited_paper":"/paper/2503.00948","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:b8bdfbbfc0d62ac98402de54f07594272a300b24be55f43b00e8b76c3f973147","observation_id":"616f4244-65ae-41b0-af70-5fc41b127016","resolution":{"observed_at":"2026-08-07T14:25:26.069859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2661","last_updated":"2014-06-10T18:58:17Z","snapshot_observed_at":"2026-07-06T03:46:00.791740Z","submitted_at":"2014-06-10T18:58:17Z","title":"Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2661","snapshot_observed_at":"2026-08-07T14:25:26.072893Z","title":"Generative adversarial networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.072893Z"},"links":{"cited_paper":"/paper/1406.2661","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:6a44fe68104af7b09c8c7b79bb178e146b8660d2d72be7a157b3d848ccec4129","observation_id":"c9ba1b6e-ed7a-4f4a-8446-0f66494ba7c5","resolution":{"observed_at":"2026-08-07T14:25:26.072893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.804721Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"60e6b83a-ed95-4a45-9b40-99ff55bb678b","year":2021},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.076062Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:da25a5633a89b8765d7d556359dbe4fe0d7976f8df7cfbbc4d3a2051109da25e","observation_id":"36fc2aa5-ff92-4347-bb87-46614c818290","resolution":{"observed_at":"2026-08-07T14:25:26.808598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.794563Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"bc958435-2544-4baf-a00e-75607fbc0e91","year":2022},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.079004Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:8bd700804b288b4c19dbbe4b2356b0fc944e6aee06d5ad1d575c2932691c7d65","observation_id":"a8cf128a-03e1-4295-ba87-01beadc4c0b3","resolution":{"observed_at":"2026-08-07T14:25:26.797986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.784417Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"21e5c18f-9874-48ce-8a3f-20643db472b9","year":2020},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.081959Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:74d50816a0b3541ba30939a328e196162d14e71f67323172e74034ebfdb6e501","observation_id":"c2c730e0-bca1-4d26-9780-15e0f95475fe","resolution":{"observed_at":"2026-08-07T14:25:26.788543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-07T14:25:26.084718Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.084718Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:e074aa74167bd4168c27b8b53947f081ce0105a05320eb04c1810b50549662a0","observation_id":"31e3e112-8969-48c6-af7e-3303037df51c","resolution":{"observed_at":"2026-08-07T14:25:26.084718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.087407Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.087407Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:09db1bfb3a54ecb6627aaf107309f1327c2ae402bad535498803082e56e3dcdd","observation_id":"5035b145-6b7c-4329-8388-b38f41b8f4b9","resolution":{"observed_at":"2026-08-07T14:25:26.087407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.770441Z","title":"High-resolution image synthe- sis with latent diffusion models,","venue":null,"work_id":"7fbf0ca2-9273-4e51-9628-5fa012a7e654","year":2022},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.091066Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:f6a410c765f8ea783c5116934419556b3abb79a7b3276d64ed98c3cc86572b28","observation_id":"f5969777-9350-40a4-a3bd-dc39466c7730","resolution":{"observed_at":"2026-08-07T14:25:26.773507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.761574Z","title":"Improving image generation with better captions,","venue":null,"work_id":"546cb329-3f37-4127-a54d-29f174634aee","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.093961Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:782b7028f762296ce2a8580ee87ee934a00e5e7b40d8814d9376f993918d8dbb","observation_id":"54a42102-2d77-47b5-891a-c44c17bdd6c9","resolution":{"observed_at":"2026-08-07T14:25:26.764568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.751898Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":"8ff211ae-0d57-4dcd-8d2b-49e4566d09bb","year":2022},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.096690Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:3b372845e71e48cc9f7436ff09de7daa9d198e23c1175a9df326a65f862d6176","observation_id":"f7a42b79-f648-40cd-9bd7-d5abb12dc7c7","resolution":{"observed_at":"2026-08-07T14:25:26.756226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.742834Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis,","venue":null,"work_id":"7457c7d7-2c63-4dd2-8d58-124f5d1444d5","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.099271Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:c693b7e61dc3fd8c6dade5ab8d64ccaafd20c0f1f4ccafe3720d4f9b5e5d3557","observation_id":"73f0cfd5-16ce-492f-b66b-8a3922494028","resolution":{"observed_at":"2026-08-07T14:25:26.746068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11897","last_updated":"2023-08-17T21:45:52Z","snapshot_observed_at":"2026-08-13T12:19:54.379421Z","submitted_at":"2023-03-21T14:41:02Z","title":"TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11897","snapshot_observed_at":"2026-08-07T14:25:26.101775Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.101775Z"},"links":{"cited_paper":"/paper/2303.11897","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:e969de95f10d9bebc0de95bbf60deb83c0577e617e3dce290e8ccef013ab79e2","observation_id":"ac972a64-6cde-41a2-b6f0-db927337c602","resolution":{"observed_at":"2026-08-07T14:25:26.101775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-07T14:25:26.104634Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.104634Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:af6a8458894a55240340d6561b89cbd2aa6e76eec697637f4e75590f5c7338ae","observation_id":"83dfc91e-b25e-4b5a-997d-134f4b12d7c2","resolution":{"observed_at":"2026-08-07T14:25:26.104634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.733988Z","title":"Imagereward: learning and evaluating human preferences for text-to-image generation,","venue":null,"work_id":"cd864458-6919-457b-a750-3447d49f6a2d","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.107547Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:3cfca22c9a9043580caf336ab9472d038c3c897e5f875753e69193a00584ccc8","observation_id":"d9ec2f17-2af9-4049-87ef-f4529c2dd380","resolution":{"observed_at":"2026-08-07T14:25:26.737462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.725011Z","title":"Pick-a-pic: an open dataset of user preferences for text-to-image generation,","venue":null,"work_id":"4f07d1cc-3217-4fc4-b332-95845d541b9e","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.110441Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:3218505ad48d7a2c472c4aa270fc076f77cd5acf65e2c8d4be66e7da1e095489","observation_id":"b4ae061a-1de1-4a54-b92f-fc9145c7f647","resolution":{"observed_at":"2026-08-07T14:25:26.728358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-08-07T14:25:26.112892Z","title":"Openthinkimg: Learning to think with images via visual tool reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.112892Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:a47b9567e91eb4603699a1de0836a0a43cf5400db6a31401004d583ad06fa463","observation_id":"9c0f8328-a04a-43ae-9372-84076f1c2057","resolution":{"observed_at":"2026-08-07T14:25:26.112892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.716147Z","title":"Dpok: reinforcement learning for fine-tuning text-to-image diffusion models,","venue":null,"work_id":"ad3dafb9-3664-4be0-adbc-317b79cefec6","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.115498Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:eadb52dee04233a1a968b8da45db803a7a9a109124b613b14cf4cf57eb2a20f6","observation_id":"ffc72921-f5e6-4523-9723-d23778d31cd0","resolution":{"observed_at":"2026-08-07T14:25:26.719666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-07T14:25:26.118205Z","title":"Training diffusion models with reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.118205Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:80a146dd0010b6dbbcdeb89dfdf07bc3cd8cc46430999934a98d5b645c19ab08","observation_id":"a49943ae-083e-4f04-924f-c5f98e89a191","resolution":{"observed_at":"2026-08-07T14:25:26.118205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:25:26.120984Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.120984Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:95bc3f77e9a94ef3d74c302d83f358e80c9f1713566fdc6b0404829ba09debf1","observation_id":"3d82d039-20cc-42ab-9944-ced4ffa73f96","resolution":{"observed_at":"2026-08-07T14:25:26.120984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.707293Z","title":"Direct prefer- ence optimization: Your language model is secretly a reward model,","venue":null,"work_id":"21fb827c-9a3a-4998-b669-e33dc11d45d1","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.123805Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:8c5403c364af6059af5a9b96a814844814a3cfbf692eb47df8007ddc87526b89","observation_id":"f5d1d4d8-172b-4707-b6b7-55870db39f66","resolution":{"observed_at":"2026-08-07T14:25:26.710368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.697553Z","title":"Stimulating diffusion model for image denoising via adaptive embedding and ensembling,","venue":null,"work_id":"29619d84-12a8-4070-a6da-64b00bcff25a","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.126311Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:96fa1ca0668033a57b8e3795fa3fa2597a46de780c9c4a6637ee2a8199b81190","observation_id":"0af8666d-0e7e-4f19-a634-d622111e675f","resolution":{"observed_at":"2026-08-07T14:25:26.701020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.687375Z","title":"Blue noise for diffusion models,","venue":null,"work_id":"f6c68a5a-4663-431e-9ce1-5106550ce9d0","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.129059Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:f3582ed555ea7a8e8f920cfa7dfb0c8ee0c817aa0b16285346626fe38b929a4f","observation_id":"baa652e8-00ce-48a7-bf95-b584a9bdb855","resolution":{"observed_at":"2026-08-07T14:25:26.691274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17870","last_updated":"2024-03-26T16:57:55Z","snapshot_observed_at":"2026-08-13T00:44:31.162952Z","submitted_at":"2024-03-26T16:57:55Z","title":"Boosting Diffusion Models with Moving Average Sampling in Frequency Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17870","snapshot_observed_at":"2026-08-07T14:25:26.132556Z","title":"Boosting diffusion models with moving average sampling in frequency domain,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.132556Z"},"links":{"cited_paper":"/paper/2403.17870","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:828d2a178b2975c521cd40ead0e1e271eb4569d39c6edc322a45ba5ba906a00e","observation_id":"7a764e69-28ab-4476-bac1-3702711a3a7c","resolution":{"observed_at":"2026-08-07T14:25:26.132556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02154","last_updated":"2025-05-29T04:20:04Z","snapshot_observed_at":"2026-08-07T16:13:25.977062Z","submitted_at":"2025-04-02T22:03:11Z","title":"FreSca: Scaling in Frequency Space Enhances Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02154","snapshot_observed_at":"2026-08-07T14:25:26.136256Z","title":"Fresca: Unveiling the scaling space in diffusion models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.136256Z"},"links":{"cited_paper":"/paper/2504.02154","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:e8b5b91500162a932807561889dedb97bf347f5da3995844de5316f57befd72b","observation_id":"80e01d5d-5291-4403-a1f0-853487a63e6a","resolution":{"observed_at":"2026-08-07T14:25:26.136256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.678426Z","title":"A dense reward view on aligning text-to-image diffusion with preference,","venue":null,"work_id":"42e7bcb3-5186-46ea-8738-b14449c560e2","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.139255Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:582f1d157cf42dd0693a183e950df61bda9e6b98682a7f8ebe87cc4deefce3f7","observation_id":"293a2962-4691-4cb0-bce0-88f8b86fb19b","resolution":{"observed_at":"2026-08-07T14:25:26.682210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.669387Z","title":"Confronting reward overoptimization for diffusion models: A perspective of inductive and primacy biases,","venue":null,"work_id":"a0c1d197-6a89-4055-a37f-16bef0857b92","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.141926Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:061cf4379b3c14b83605aee5c2357202876cb182ae5571ae14a2a5f9985e0d1b","observation_id":"1f77c922-b895-41d0-a9a4-06d761f17ebe","resolution":{"observed_at":"2026-08-07T14:25:26.672920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04314","last_updated":"2025-03-25T17:06:27Z","snapshot_observed_at":"2026-08-12T23:48:30.414248Z","submitted_at":"2024-06-06T17:57:09Z","title":"Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04314","snapshot_observed_at":"2026-08-07T14:25:26.144841Z","title":"Aesthetic post-training diffusion models from generic preferences with step-by-step preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.144841Z"},"links":{"cited_paper":"/paper/2406.04314","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:f6641ed5249dfb307dba6673c6bd69aba3925ded5c55d544b967c3fae6a48179","observation_id":"7ddc2152-916d-4b1e-b35e-103cb7023a17","resolution":{"observed_at":"2026-08-07T14:25:26.144841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.659246Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":"2a8f0b5e-05b5-4b54-815e-035a50a67c9d","year":2021},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.147939Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:68539d6d4509850dd037e03d59b3c19dbecbaca6a9850b88838a0b25118c0fb0","observation_id":"11dccaa8-3582-4b83-b462-f53b6771e70d","resolution":{"observed_at":"2026-08-07T14:25:26.663616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T14:25:26.150649Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.150649Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:43eb0c09289196c41be8dd7c361667b2c05b57554c3710f0a34459a9eeaba434","observation_id":"186e990f-a787-4d59-ab3d-7b884ffe7fd5","resolution":{"observed_at":"2026-08-07T14:25:26.150649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-07T14:25:26.154161Z","title":"Aligning text-to-image models using human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.154161Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:24ff1ca080fda7ad2cc06fe969707e5bb26591e792a51d8d7a8b202b2d474175","observation_id":"edd2dd8b-19b6-4ce7-bea8-43db8f0eb1bd","resolution":{"observed_at":"2026-08-07T14:25:26.154161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-07T14:25:26.158191Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.158191Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:9de583578318362ba09712c01d7e0ff5875e7bdc7e5be7e827521131c66fcf25","observation_id":"7795060c-6414-4eb9-821b-c97d09fe8840","resolution":{"observed_at":"2026-08-07T14:25:26.158191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.650087Z","title":"Optimizing ddpm sampling with shortcut fine-tuning,","venue":null,"work_id":"7f51ecdf-09f0-4cba-abf6-219ffcf1a606","year":2023},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.161300Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:5cac75337a143688a87413975c3ccd2c2f950de78dc838d8f39d671e3d830dce","observation_id":"03783dd0-c41f-4932-9fd6-780499cd33e4","resolution":{"observed_at":"2026-08-07T14:25:26.653284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.641163Z","title":"Deep reward supervisions for tuning text-to-image diffusion models,","venue":null,"work_id":"1895c17f-374c-43b6-b144-dcb750103417","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.164256Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:699971a624cb60d6559432006be62a525a46c3d150279a1f2ac789a91bc69bc0","observation_id":"44e5fb01-4654-4a95-ae6e-54baca475030","resolution":{"observed_at":"2026-08-07T14:25:26.644330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.555263Z","title":"Using human feedback to fine-tune diffusion models without any reward model,","venue":null,"work_id":"224834b3-c31c-4170-be18-f8361ef3e219","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.167113Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:ba53537cd854320a82e63ecb219155a69dc21934f846e0d3335ac91082ee2633","observation_id":"44045a80-0c4d-4cde-b168-b89721392dd0","resolution":{"observed_at":"2026-08-07T14:25:26.634403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.546376Z","title":"Diffusion model alignment using direct preference optimization,","venue":null,"work_id":"9301dde6-a7ac-4133-a9eb-9c074107480e","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.170322Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:d78a29d74c25a66ff13572f618643f09a622fd5d802b97574f5288be9d526422","observation_id":"4e8fbaae-74bc-41a7-8ce7-76a0602f52ed","resolution":{"observed_at":"2026-08-07T14:25:26.549875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.536427Z","title":"Steps toward artificial intelligence,","venue":null,"work_id":"3e160398-59ac-416e-a8d9-5bc12525a68d","year":1961},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.173109Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:9c08a9bc7dd8ea952223e1a6299a5e758d8af15c8016194c0b82fb71f21daa0c","observation_id":"357d6f4e-48c6-430d-9274-161ff9e8f422","resolution":{"observed_at":"2026-08-07T14:25:26.540929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.526975Z","title":"Temporal credit assignment in reinforcement learning,","venue":null,"work_id":"7c3e48e6-cf6f-47bc-9e1b-8c7143a5d3c7","year":1984},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.176690Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:bdbcbf85a371008134e2176f889940d35dba38c22fb394faa449dd6e05934a66","observation_id":"d0ad225d-b9e1-4768-80e0-10a61a269b37","resolution":{"observed_at":"2026-08-07T14:25:26.530218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.516285Z","title":"Learning guidance rewards with trajectory-space smooth- ing,","venue":null,"work_id":"2ea411a8-53af-4f0f-9fc5-7a44e0a50f53","year":2020},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.179657Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:da62286659294317b6507f8906af80478ce0282b39d9de899d172589216676b0","observation_id":"65d6c08a-74bd-40f4-9270-b8aac917d6a7","resolution":{"observed_at":"2026-08-07T14:25:26.520203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.507487Z","title":"Harutyunyan, W","venue":null,"work_id":"093519b0-d935-4d26-9669-5491554680ec","year":2019},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.182674Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:515dc93b5d46bbc37449ecf6c3ac77542d49b8a2e11620ba33dd9d9320314a80","observation_id":"33f72736-f8f7-4112-a81b-668036b499ca","resolution":{"observed_at":"2026-08-07T14:25:26.510627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.498828Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping,","venue":null,"work_id":"edef69bf-187e-4ad0-9424-f54f659a98dd","year":1999},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.185401Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:9c34196f2eb593455198175ed267cff56baa7b0e2525d510730afab49c757b0f","observation_id":"3724d282-7afc-42bc-aa97-5da828ff567a","resolution":{"observed_at":"2026-08-07T14:25:26.502040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-13T10:09:02.912910Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-07T14:25:26.188530Z","title":"Text2reward: Reward shaping with language models for reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.188530Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:88ad27fe3c386fbc1aee0d63412b78f67c0ec16fe79162fea4023632e4423ee1","observation_id":"d0a81003-26d7-43ce-ba62-ae59e4f1d1e5","resolution":{"observed_at":"2026-08-07T14:25:26.188530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.489938Z","title":"DPO meets PPO: Reinforced token optimization for RLHF,","venue":null,"work_id":"2e07e247-2aef-484a-8b7c-cbca9539a7aa","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.192604Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:51f78cebc0a545c066f5d9723805110ab3f2640ee972bc62da0b530bd55b7812","observation_id":"c99752e1-3a18-426a-8a2b-ebd7f2dcc812","resolution":{"observed_at":"2026-08-07T14:25:26.493068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.480745Z","title":"R3HF: Reward redistribution for enhancing reinforcement learning from human feedback,","venue":null,"work_id":"82701771-70c2-4e73-998b-85cdbe6f9c35","year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.195874Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:be248e5394a504fea0ce36a6fe2a0f0ceb481f081e038ddcc7a79dea2dd4a2e7","observation_id":"7a6199c3-bf2b-4c68-ba3a-3e3b22308795","resolution":{"observed_at":"2026-08-07T14:25:26.484041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.470205Z","title":"Dense reward for free in reinforcement learning from human feedback,","venue":null,"work_id":"2e975183-4474-4250-b42f-92860c017c04","year":null},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.198621Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:9af2afde07841e294c89b94d92770087d0b524ca365590465a4d14914bcb781a","observation_id":"9469099a-82cb-40f7-a438-e3935c0b55f9","resolution":{"observed_at":"2026-08-07T14:25:26.474408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.450324Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning,","venue":null,"work_id":"a4388909-843b-41cf-be67-f73c79ef6230","year":2004},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.204535Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:7c71fab078174409a9b13f222c5c2ffc226a7af4ac207b8ac00d7c1760549f83","observation_id":"1be93a43-71a6-4aa1-8b09-4246ea680c60","resolution":{"observed_at":"2026-08-07T14:25:26.453992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T14:25:26.207681Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.207681Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:683483c5e45a1e26954fb44d80f7c90ecfefc53e2688cb2447f0857504164ce3","observation_id":"69347cfb-4e3b-468c-9ed9-27beddb7a661","resolution":{"observed_at":"2026-08-07T14:25:26.207681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.440501Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":"bb39c061-9794-4cd4-a4ad-1215479851a0","year":2021},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.210873Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:8ba73cc79291a0950d3ddca5e0c02daac1352ad76880e1fda4a50f171a0b9d03","observation_id":"f6951719-dd51-470b-898e-5a1b0c4726a2","resolution":{"observed_at":"2026-08-07T14:25:26.444511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14580","last_updated":"2024-12-19T07:00:03Z","snapshot_observed_at":"2026-08-14T20:38:14.670158Z","submitted_at":"2024-12-19T07:00:03Z","title":"DiffSim: Taming Diffusion Models for Evaluating Visual Similarity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14580","snapshot_observed_at":"2026-08-07T14:25:26.214334Z","title":"Diffsim: Taming diffusion models for evaluating visual similarity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.214334Z"},"links":{"cited_paper":"/paper/2412.14580","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:5d4a92a4fa08c3b88557be070503f97441aa05d0c9552566d65ed04df95e06a8","observation_id":"dabf1354-2074-4903-b190-7c30f48f6d6d","resolution":{"observed_at":"2026-08-07T14:25:26.214334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.217670Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.217670Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:708e5b62f9570da2c7039cc168448faef724fd92feeb0b56a09547cde19fc076","observation_id":"92df4940-22bb-4894-8c43-65ab8291f10c","resolution":{"observed_at":"2026-08-07T14:25:26.217670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.426082Z","title":"Policy gradient methods for rein- forcement learning with function approximation,","venue":null,"work_id":"9038f4ec-7ab6-4bf7-a166-0c7140ade5c9","year":1999},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.220474Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:c7fb5b9b7577efea29ba983572fb5e06326e9c0af5e9853698b9088950691e68","observation_id":"1762ec38-ef64-4b33-9f98-a3eb686a4f25","resolution":{"observed_at":"2026-08-07T14:25:26.429414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-14T05:43:53.421538Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-07T14:25:26.224156Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.224156Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:d157e60c623959a920b065ff32f165a4eeb1b9976be12a516a925ae6365f71a5","observation_id":"f8186217-4635-4ead-9ac7-55d49981bf93","resolution":{"observed_at":"2026-08-07T14:25:26.224156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.415016Z","title":"Training deep nets with sublinear memory cost,","venue":null,"work_id":"bb847c62-7233-4ef5-b69a-7303d0e1488b","year":null},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.229122Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:4b2d158851cb2c65b70100051aded0f3b7eae34c6c73abfcb89084873c90b3bf","observation_id":"e00ca729-7998-4e5e-9493-2baae7aac08c","resolution":{"observed_at":"2026-08-07T14:25:26.419888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T14:33:36.303679Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-07T14:25:26.232105Z","title":"in\" while others do not for prompt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.232105Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:1e40ce5ad58fd11c74828d0ad1d7d32a314bbfe09ddece56cb5749ee5de7fdc4","observation_id":"f5acd2f4-921b-43af-b595-29fdb03e2953","resolution":{"observed_at":"2026-08-07T14:25:26.232105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:26.460085Z","title":"Available: https://openreview.net/forum?id=eyxVRMrZ4m","venue":null,"work_id":"0fe83757-cde8-4591-a250-508c6ae4bc42","year":null},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.201653Z"},"links":{"citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:203aaf2d320cb059c56e8f9fb949d62a1e575247298a8af6b3362ede73e875b4","observation_id":"eb825529-10da-4a0b-bf1e-6db2928fdaf5","resolution":{"observed_at":"2026-08-07T14:25:26.463485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 4 inbound Pith citation observations for arXiv:2505.19196."}