{"as_of":"2026-08-18T08:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:486a25a9504e3829beb86bd3ff27c6bb3fe58df69197806dbd4d67374cc369c3","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:30:34.676779Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06125/citation-record","integrity":"/paper/2608.06125/integrity","json":"/paper/2608.06125/citation-record.json","paper":"/paper/2608.06125"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:39.523176Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":"12040fb0-dfc2-4901-9a47-031e4074c6c2","year":2020},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:30.052946Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:34e5bf28afe0e6b0a2fd43059cbb24c85ddddf04f607962a83ac28762728720e","observation_id":"fcc56792-8cfa-43b7-8710-d72054bb261b","resolution":{"observed_at":"2026-08-07T14:30:39.639842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-07T14:30:30.131605Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , pages =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:30.131605Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:e821ed9c98a472babdae593d8635480c4bc5608c3237171341f82ea809e0500d","observation_id":"34a208ff-42db-4735-a997-9224ed60c65b","resolution":{"observed_at":"2026-08-07T14:30:30.131605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T14:30:30.226025Z","title":"The Eleventh International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:30.226025Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:f5e4844e4b11d8e5ac54a255aed9137d40e91be66da116ea0c9b39e9818f0bc4","observation_id":"bdce378e-1106-410e-bce5-1769c3633294","resolution":{"observed_at":"2026-08-07T14:30:30.226025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:39.332629Z","title":"Psychological Review , volume =","venue":null,"work_id":"bdb7df3c-92a1-4e3c-bfe1-cbfd64b02180","year":1927},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:30.329344Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:91927306155fbe2dcf676b8c18d9376f6b65f00c418cc24ab337e48df22cec45","observation_id":"d41e3a64-c0f8-4ab0-86fa-e6d840d3bda2","resolution":{"observed_at":"2026-08-07T14:30:39.417762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:39.097298Z","title":"Proceedings of the 22nd International Conference on Machine Learning , pages =","venue":null,"work_id":"79b8b864-48f4-4906-8a2c-78c4c7c7426f","year":2005},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:30.396935Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:5f11e579f69aca09f572f55cf2ee3175833adc4e9b36c72a3cc8f179e34bdb6a","observation_id":"605c86c4-a1ce-481d-8e43-b24c47a30026","resolution":{"observed_at":"2026-08-07T14:30:39.189641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05977","last_updated":"2023-12-28T14:13:35Z","snapshot_observed_at":"2026-08-16T15:40:56.445501Z","submitted_at":"2023-04-12T16:58:13Z","title":"ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05977","snapshot_observed_at":"2026-08-07T14:30:30.456120Z","title":"2023 , doi =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:30.456120Z"},"links":{"cited_paper":"/paper/2304.05977","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:68df4f3d58e0c25729ec898d988eef8b9775d1a4e6611fa38bb227fe61eb02dc","observation_id":"65f546c9-842e-4788-bb9b-85b27b0205dc","resolution":{"observed_at":"2026-08-07T14:30:30.456120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01569","last_updated":"2023-11-23T17:07:58Z","snapshot_observed_at":"2026-08-16T15:36:12.925339Z","submitted_at":"2023-05-02T16:18:11Z","title":"Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01569","snapshot_observed_at":"2026-08-07T14:30:30.533095Z","title":"2023 , doi =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:30.533095Z"},"links":{"cited_paper":"/paper/2305.01569","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:8efef12c3b01bdb8609d16489204007b27181939ffa83405934b0043ae5d364c","observation_id":"74b09334-34d3-4b02-a55c-0b6e2d1945d1","resolution":{"observed_at":"2026-08-07T14:30:30.533095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-07T14:30:30.637742Z","title":"2023 , eprint =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:30.637742Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:85440027b48bcb6c7e90a2e2804332d6a7b87f11b8a587dd8137afb5239298af","observation_id":"7ab8cc1f-5550-4ab6-88cc-446b586e8a55","resolution":{"observed_at":"2026-08-07T14:30:30.637742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14705","last_updated":"2024-05-23T15:39:43Z","snapshot_observed_at":"2026-08-16T13:50:08.228701Z","submitted_at":"2024-05-23T15:39:43Z","title":"Learning Multi-dimensional Human Preference for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14705","snapshot_observed_at":"2026-08-07T14:30:30.721052Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:30.721052Z"},"links":{"cited_paper":"/paper/2405.14705","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:2a9c0c37f62e8fec16588b2402659ae9e12e4c42cd5ceafe4508c076b39293e8","observation_id":"75627252-bbce-456b-971a-37e71d79e2ad","resolution":{"observed_at":"2026-08-07T14:30:30.721052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-08-17T22:15:08.630152Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05236","snapshot_observed_at":"2026-08-07T14:30:30.776673Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:30.776673Z"},"links":{"cited_paper":"/paper/2503.05236","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:0e6c539c26ac1b17bf0b896c2f6316832087c4ae3f6fd542799bef02b6730bce","observation_id":"4d2c6121-0afd-460a-8d30-d1167ea97c65","resolution":{"observed_at":"2026-08-07T14:30:30.776673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:38.873690Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":"c89631ca-3a5d-4451-a725-45e51cfba66d","year":2025},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:30.861670Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:6c00c8abaff9f3c4d9945ca8c977fb015aea715edafe64bbeea6db0c8ad731ff","observation_id":"dac5f406-1bb1-4f57-9e54-ee20d772b344","resolution":{"observed_at":"2026-08-07T14:30:38.974589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:38.761116Z","title":"2025 , month = oct, eprint =","venue":null,"work_id":"83c7f53a-46c9-451f-8051-a298a69fa47e","year":2025},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:30.979283Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:5c6f152a9da542c59f0c6f7eb3809b66e150df9b10aaa44c1a34366b6cb21c91","observation_id":"1742c8d1-d3df-4583-9cfd-3f3a5b6ff456","resolution":{"observed_at":"2026-08-07T14:30:38.788619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:38.593356Z","title":null,"venue":null,"work_id":"177a5d72-a15b-46b5-9d00-320414b25f50","year":2025},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:31.109480Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:b229585baf29ecc81049b3b77df07f661207d4349554de6bbc7d28aeb71e2884","observation_id":"d36fdbc5-a0e2-46a0-9064-217064855e4b","resolution":{"observed_at":"2026-08-07T14:30:38.662763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03739","last_updated":"2024-11-07T03:54:22Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:18Z","title":"Aligning Text-to-Image Diffusion Models with Reward Backpropagation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03739","snapshot_observed_at":"2026-08-07T14:30:31.267180Z","title":"2023 , eprint =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:31.267180Z"},"links":{"cited_paper":"/paper/2310.03739","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:ac5611ae9dd4576a1a7441797d2dd243fa062a2b125dbbe708e4a24d610aa9dc","observation_id":"525228fb-75d6-436c-8588-38ab1b9ead87","resolution":{"observed_at":"2026-08-07T14:30:31.267180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17400","last_updated":"2024-06-21T16:45:11Z","snapshot_observed_at":"2026-08-06T10:08:54.816113Z","submitted_at":"2023-09-29T17:01:02Z","title":"Directly Fine-Tuning Diffusion Models on Differentiable Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17400","snapshot_observed_at":"2026-08-07T14:30:31.365332Z","title":"The Twelfth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:31.365332Z"},"links":{"cited_paper":"/paper/2309.17400","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:149dec5a82ef3149e0188f64b93dcf0e365d54bbc5cd8f1f9ecb5f29169597ad","observation_id":"b1864535-b1c2-4e25-9940-c31e04e0e869","resolution":{"observed_at":"2026-08-07T14:30:31.365332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-07T14:30:31.467681Z","title":"The Twelfth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:31.467681Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:b9bdcb9cb752ef529d18989c87fdb76fd8c0a9e9908c150ddf38eec664f77298","observation_id":"46249ff1-5af3-4bb4-9808-753c5a8ee607","resolution":{"observed_at":"2026-08-07T14:30:31.467681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12908","last_updated":"2023-11-21T15:24:05Z","snapshot_observed_at":"2026-08-17T04:35:03.542549Z","submitted_at":"2023-11-21T15:24:05Z","title":"Diffusion Model Alignment Using Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12908","snapshot_observed_at":"2026-08-07T14:30:31.554644Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , pages =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:31.554644Z"},"links":{"cited_paper":"/paper/2311.12908","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:7ff3272bc3357a3510e7047acd2e8c86b669e45d0815e8fcf316aff4294d1993","observation_id":"60c9e828-4996-433f-b5c0-f9e7e1e2bcc6","resolution":{"observed_at":"2026-08-07T14:30:31.554644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-16T18:20:01.123890Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-07T14:30:31.625215Z","title":"doi:10.48550/arXiv.2511.22699 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:31.625215Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:232a4beec087be8f074758f4277cda16313750a7f56b6a4a487340fde4949d36","observation_id":"62b913ba-aaf8-4016-bd43-820db10b7e29","resolution":{"observed_at":"2026-08-07T14:30:31.625215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:38.336157Z","title":null,"venue":null,"work_id":"538c37ba-8b42-450f-9dcb-44bb5ba4060a","year":2026},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:31.710740Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:a22fd2c076e79fe90cad04faa60e60f837ce44252e10c0d99fce6e75c885c0b8","observation_id":"e2e58a6f-45e1-4da3-b9c4-e60e6811de2f","resolution":{"observed_at":"2026-08-07T14:30:38.493341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:38.101923Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":"ce9dc19f-d056-40c0-9573-c5804544aadf","year":2025},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:31.803901Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:92417b42e128e97bc7bb549402d55aa53755497ed6ce7b1f145f5caad8272889","observation_id":"6410a23a-f23d-4a72-9636-091a066eebb0","resolution":{"observed_at":"2026-08-07T14:30:38.198546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:37.983174Z","title":"2026 , eprint =","venue":null,"work_id":"6c9295c3-1d11-4d17-9890-f24e5261c4d9","year":2026},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:31.908798Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:fb1194b87127310f40195ae1a2e6d99b41bf1d0a0b8f8520205b58e3c73168cb","observation_id":"6bec4435-493a-4f72-acc9-ed739587798a","resolution":{"observed_at":"2026-08-07T14:30:38.040152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22981","last_updated":"2026-04-24T19:49:56Z","snapshot_observed_at":"2026-08-10T12:12:03.965169Z","submitted_at":"2026-04-24T19:49:56Z","title":"Reward Models Are Secretly Value Functions: Temporally Coherent Reward Modeling","version":1},"cited_work":{"arxiv_id":"2604.22981","doi":"10.48550/arxiv.2604.22981","metadata_source":"pith","pith_arxiv_id":"2604.22981","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Reward Models Are Secretly Value Functions: Temporally Coherent Reward Modeling","venue":"cs.LG","work_id":"67768595-73f7-4748-844a-c6b46018018e","year":2026},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:31.955883Z"},"links":{"cited_paper":"/paper/2604.22981","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:b1e4aea8651aaa6f0e7afec8a432773ccb5f99e4a1b1e232cab220dd2c95dcc6","observation_id":"164682d0-2cef-4822-b803-1943d511c074","resolution":{"observed_at":"2026-08-07T14:30:35.757355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-15T14:08:11.549258+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T14:08:11.549258+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2509.15110","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"doi:10.48550/arXiv.2509.15110 , url =","venue":"ArXiv.org","work_id":"82b386a7-15dc-42e5-8e44-9d66528bbe62","year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:32.048481Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:11e9045d4a67b587bf6ad582cb7ed7288b5ad2c59de6cad6abe5489076c63be9","observation_id":"a8b9e136-6052-4aac-be8b-b7d227e24c9d","resolution":{"observed_at":"2026-08-07T14:30:35.495333Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-15T14:08:11.613103+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T14:08:11.613103+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18958","last_updated":"2024-12-04T05:04:42Z","snapshot_observed_at":"2026-08-16T13:06:11.033671Z","submitted_at":"2024-10-24T17:55:52Z","title":"Stable Consistency Tuning: Understanding and Improving Consistency Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18958","snapshot_observed_at":"2026-08-07T14:30:32.111942Z","title":"ICLR 2025 Workshop on Deep Generative Model in Machine Learning: Theory, Principle and Efficacy , year =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:32.111942Z"},"links":{"cited_paper":"/paper/2410.18958","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:e462dc29ad77e7e3eacaa67ae9bac0d3030174a997f44b0477613307e9b1016d","observation_id":"6ffd188c-a7c9-4a84-9f06-c8573c91bab9","resolution":{"observed_at":"2026-08-07T14:30:32.111942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:37.867183Z","title":"Proceedings of the 43rd International Conference on Machine Learning , series =","venue":null,"work_id":"a96928c2-c685-4f98-aff2-3921a4f9fff3","year":2026},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:32.185688Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:2d1e9b2f25a735f1aa08134fa1bd51d3b8fee750c4c0c3547ff2b3ea262e87a8","observation_id":"3d365ce6-7510-49f1-a357-fee585c599b3","resolution":{"observed_at":"2026-08-07T14:30:37.930730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22480","last_updated":"2025-05-16T06:58:13Z","snapshot_observed_at":"2026-08-17T16:58:55.296737Z","submitted_at":"2025-03-28T14:39:52Z","title":"Probabilistic Uncertain Reward Model","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22480","snapshot_observed_at":"2026-08-07T14:30:32.243421Z","title":"The Fourteenth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:32.243421Z"},"links":{"cited_paper":"/paper/2503.22480","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:2faad4962168b675b0521dad92a535ca15a604d007e4e1d0e8490700061eabe1","observation_id":"f7ab9048-6927-4354-97c3-af51283e1d62","resolution":{"observed_at":"2026-08-07T14:30:32.243421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01863","last_updated":"2024-04-02T11:40:38Z","snapshot_observed_at":"2026-08-16T14:04:20.571690Z","submitted_at":"2024-04-02T11:40:38Z","title":"Confidence-aware Reward Optimization for Fine-tuning Text-to-Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01863","snapshot_observed_at":"2026-08-07T14:30:32.316738Z","title":"The Twelfth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:32.316738Z"},"links":{"cited_paper":"/paper/2404.01863","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:83a383c4fdb5d608e9d60f267dfa02e0265bcb30c0e9136b9b6917655d7f0f6e","observation_id":"0687ee4e-06d9-49bd-992a-aaf42d1bc6a1","resolution":{"observed_at":"2026-08-07T14:30:32.316738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-08-15T21:26:30.952106Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-07T14:30:32.398918Z","title":"doi:10.48550/arXiv.2505.07818 , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:32.398918Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:19e7dfeb0b2280c4cf85a485c6a81da6051cc3aadaa3fd61325ab87b7fb461ca","observation_id":"ac29a5b2-5e24-40bc-ae1d-9c5d6f6e57d4","resolution":{"observed_at":"2026-08-07T14:30:32.398918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2511.21541","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"2025 , eprint =","venue":"ArXiv.org","work_id":"44f362fc-44ae-471b-a827-a92348236e39","year":2025},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:32.488971Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:9af28cf01e5cd7575cf4930400588a075e0811975929edf4feee39f0a25210de","observation_id":"668a4155-59a7-4016-9132-93354886f5f3","resolution":{"observed_at":"2026-08-07T14:30:35.247598Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-15T14:08:11.730304+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T14:08:11.730304+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20751","last_updated":"2026-04-20T06:12:09Z","snapshot_observed_at":"2026-08-15T08:35:23.989525Z","submitted_at":"2025-08-28T13:11:24Z","title":"Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20751","snapshot_observed_at":"2026-08-07T14:30:32.559115Z","title":"doi:10.48550/arXiv.2508.20751 , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:32.559115Z"},"links":{"cited_paper":"/paper/2508.20751","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:fb37d5d31f40e44d7d615284c62bb5ebb1320289903152840ddbace0a2f63cdc","observation_id":"39a5409c-14fe-41e6-8918-0e60cecb4cf1","resolution":{"observed_at":"2026-08-07T14:30:32.559115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:37.736130Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , pages =","venue":null,"work_id":"612cec2b-ee31-48c7-93eb-34a2e845c44c","year":2026},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:32.647386Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:f2428cbb304b61254a26d24826cca349a06abe69793f92c8bc59edceeb7036f7","observation_id":"d3d8effb-6dd2-4636-b25c-1492b28b7121","resolution":{"observed_at":"2026-08-07T14:30:37.793405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:37.575887Z","title":"2024 , month = jun, eprint =","venue":null,"work_id":"bf891627-a114-48be-98e9-a43feddf5321","year":2024},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:32.723384Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:709034230a626dfb09ab996089652637256c65f5590570e34abebe373c4b3a64","observation_id":"879988d0-c2b3-4e51-a2e7-b7f5f7bee481","resolution":{"observed_at":"2026-08-07T14:30:37.631205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04485","last_updated":"2024-11-11T06:32:24Z","snapshot_observed_at":"2026-08-16T13:45:21.789638Z","submitted_at":"2024-06-06T20:15:42Z","title":"GenAI Arena: An Open Evaluation Platform for Generative Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04485","snapshot_observed_at":"2026-08-07T14:30:32.815096Z","title":"2024 , doi =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:32.815096Z"},"links":{"cited_paper":"/paper/2406.04485","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:729da17023d0997d2cf7bf58ae80e132d65034961b0a562d344e0b38cdb63d19","observation_id":"093f1db7-26fc-477a-aa27-995367aefbe0","resolution":{"observed_at":"2026-08-07T14:30:32.815096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:37.415128Z","title":"Proceedings of the 41st International Conference on Machine Learning , editor =","venue":null,"work_id":"40e2804a-42db-473f-8c5c-01e517d494c7","year":2024},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:32.910082Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:9b437b9c2019be4cb53218d00e62fd104def411455eb68d0389616acf887b7f2","observation_id":"3d31178d-865e-48ab-8a57-c1e5802578d9","resolution":{"observed_at":"2026-08-07T14:30:37.491424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T14:30:33.029242Z","title":"doi:10.48550/arXiv.2503.20314 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:33.029242Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:8a61f638a3f5389a403590da69884bbbc7c2ccce649c4e825678149938b83fb5","observation_id":"e9de2a5a-0541-4765-a660-9ea436d782d1","resolution":{"observed_at":"2026-08-07T14:30:33.029242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:33.104439Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:33.104439Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:b8dc9269b468ca0a9dac7332793d550a2ed1653af38e882a003359be410b19c1","observation_id":"de7feba1-e5f7-4bc1-bb14-d18b76d519d8","resolution":{"observed_at":"2026-08-07T14:30:33.104439Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:37.171083Z","title":"Proceedings of the 38th International Conference on Machine Learning , editor =","venue":null,"work_id":"f8eced18-22dc-40fa-9694-d98ba0358016","year":2021},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:33.189617Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:359151a2590a059564a24442dfd56f1bef91875e95131d7e81b5163a8a7f78e4","observation_id":"4b0d3a3d-131d-4f21-9407-be19600054ce","resolution":{"observed_at":"2026-08-07T14:30:37.292248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:30:33.254424Z","title":"2025 , issn =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:33.254424Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:e24eef7000ca2f2a802a45270668688ab6f21feb09de1fa3b082e0aa01fdc1e7","observation_id":"e1938bfe-41c2-4d62-a309-026b58834a93","resolution":{"observed_at":"2026-08-07T14:30:33.254424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:30:33.330944Z","title":"doi:10.48550/arXiv.2409.12191 , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:33.330944Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:89c2632e8ef066b4b22c614204e2b55ecd4ac7439e8b8330850ecd36f0645a6b","observation_id":"bd90d109-e981-4f3d-b3c5-0e5e8a8e24da","resolution":{"observed_at":"2026-08-07T14:30:33.330944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:30:33.424109Z","title":"The Twelfth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:33.424109Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:04df2a428119f18f07ebd2dc090953e7349454002185dd76308a5fc63afc22d6","observation_id":"16b93105-1d21-4f4d-a487-57ec79cf5379","resolution":{"observed_at":"2026-08-07T14:30:33.424109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:33.512340Z","title":"and Shen, Yelong and Wallis, Phillip and Allen-Zhu, Zeyuan and Li, Yuanzhi and Wang, Shean and Wang, Lu and Chen, Weizhu , booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:33.512340Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:c5c3e8657489e418919b89710a1a7de6ecffae6e8ae6ed6bc99ca68bb3ee459b","observation_id":"8e1d3deb-dc79-47db-b63d-7fb3620eb0c2","resolution":{"observed_at":"2026-08-07T14:30:33.512340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T14:30:33.597383Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:33.597383Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:b69cf3cdb77efc0f03ddd0c00f83f5b2090588e952aa24f08b0d21615bc29917","observation_id":"068eb91d-9b25-4f9e-9b12-57e25b14f66d","resolution":{"observed_at":"2026-08-07T14:30:33.597383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:33.685852Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:33.685852Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:096f221aae3eb94205edb4b8917f6852df40a4127a849bc5648aeb318d59205d","observation_id":"75d0641a-7f8e-4805-a35a-12536cf8ec25","resolution":{"observed_at":"2026-08-07T14:30:33.685852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T14:30:33.764819Z","title":"2022 , eprint =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:33.764819Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:17d9bcd016479013a508fbc2b291a1832a13fc28c7791dc98016794d41954083","observation_id":"19329a70-0b4e-44a8-9fb4-add83fb4bc2f","resolution":{"observed_at":"2026-08-07T14:30:33.764819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:30:33.872994Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:33.872994Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:d3723782a80a44f119f0a9f9980f2bf86934148b138902f64d100ddd3a68c108","observation_id":"67a2b587-6591-4ba9-87f3-1543910d9ced","resolution":{"observed_at":"2026-08-07T14:30:33.872994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:36.916764Z","title":"Proceedings of the European Conference on Computer Vision (ECCV) , pages =","venue":null,"work_id":"b73692ad-2526-4715-9230-1ef57dd8d96e","year":2018},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:33.963745Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:895d261bb42f8da3881fa19a86aa624aa44d8fc849ff1f3ad0709dfd9ee05cb8","observation_id":"97c28192-3507-490b-8c5c-5d92bdfed3cd","resolution":{"observed_at":"2026-08-07T14:30:37.017611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05712","last_updated":"2021-03-25T06:57:36Z","snapshot_observed_at":"2026-07-06T08:57:07.862196Z","submitted_at":"2020-02-13T18:52:57Z","title":"Cross-Iteration Batch Normalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05712","snapshot_observed_at":"2026-08-07T14:30:34.020078Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:34.020078Z"},"links":{"cited_paper":"/paper/2002.05712","citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:5a7c39a9d75e03f06f2068174b5f10f811899dfd1fd332286ac42d321c09b6a0","observation_id":"1d3ff254-6f41-487b-b6f9-79c4c30317bb","resolution":{"observed_at":"2026-08-07T14:30:34.020078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:36.690733Z","title":"2026 , doi =","venue":null,"work_id":"ed30925e-0ecb-43c1-9ebe-ee45c7ba3912","year":2026},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:34.100141Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:3dfae28079fd5f799ec4a42c13be26110a8295b3c1ef7e0c60dd540d283c9cd4","observation_id":"482463b6-3ee9-47ec-8276-9de7770b4b05","resolution":{"observed_at":"2026-08-07T14:30:36.810756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2509.22799","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"doi:10.48550/arXiv.2509.22799 , url =","venue":"ArXiv.org","work_id":"b5d9111b-3e3d-4f3f-a8e5-397ac3f3355d","year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:34.176014Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:d6d1bd7c7a970ded74254afb7ef48d08185fd54007c90006ac0ee904a1dc8113","observation_id":"1a703aef-d306-4991-acaa-4beaa279c038","resolution":{"observed_at":"2026-08-07T14:30:34.947868Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-15T14:08:11.979054+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T14:08:11.979054+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:36.402432Z","title":"Advances in Neural Information Processing Systems , editor =","venue":null,"work_id":"efbc8681-8e28-4bd6-b420-5dfcc99750ea","year":2025},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:34.271925Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:778323d8cd5eebe063575c4a1f3af620fae4500bf6a83f6761003955c469c50f","observation_id":"d6a755f5-5984-4e76-a9da-6fc1902bb211","resolution":{"observed_at":"2026-08-07T14:30:36.537984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:34.379568Z","title":"2024 , address =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:34.379568Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:3e10a891650ecb99b5eb5a14f09f9398809288aa171ec8c8abd6f2c4233184a6","observation_id":"99dfbf8f-e87b-47d1-b8b3-6c79d4f4a4ec","resolution":{"observed_at":"2026-08-07T14:30:34.379568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:36.232532Z","title":"2025 , url =","venue":null,"work_id":"be4b931b-957e-45a7-9af6-67aad84362ab","year":2025},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:34.475798Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:5c55e64e0ffb098bc3c9aa1fc09a67401180717d027f95cb7b6d2b5fa76bd8ff","observation_id":"1e314f45-3b28-498f-b935-6b4d56a929b9","resolution":{"observed_at":"2026-08-07T14:30:36.309374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:36.140942Z","title":"2026 , doi =","venue":null,"work_id":"34313a4f-e95f-4c0f-ae9a-a4c9de948b7e","year":2026},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:34.561203Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:a48ccf35453f177821912ac89a30dd88f2a4932510b10288a6a580d701f653ee","observation_id":"da961fc7-1d63-4f03-b05f-856774a1b401","resolution":{"observed_at":"2026-08-07T14:30:36.171789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:36.069908Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"ee06a8e9-db5b-4e4a-87db-9844990bc9c7","year":null},"citing_paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:30:34.676779Z"},"links":{"citing_paper":"/paper/2608.06125"},"observation_digest":"sha256:f060be46ded29c6c20f5c72223979c256bbda093221b8da961e3599269954ee1","observation_id":"da3fd135-f024-46a7-b00b-831a737f4016","resolution":{"observed_at":"2026-08-07T14:30:36.104353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06125","last_updated":"2026-08-06T14:55:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T03:50:38.211687Z","submitted_at":"2026-08-06T14:55:42Z","title":"Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":31,"verified_exact":4,"verified_fuzzy":18},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2608.06125."}