{"as_of":"2026-08-17T21:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c37c42041b4d373661d5defaa0f4ef8b7d6d86525c58ecd49fd1abfc570c042a","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:18:56.930347Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:21:12.263047Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T11:25:18.912960Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15791","snapshot_observed_at":"2026-08-15T23:21:12.263047Z","title":"Vard: Efficient and dense fine-tuning for diffusion models with value-based rl, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.263047Z"},"links":{"cited_paper":"/paper/2505.15791","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:e0557ed5885898e2270e09efe1a233209fe8062bf5410407c58d5b151bc6d482","observation_id":"d255a3be-70f8-42d9-8d24-f07cd6d4d8b4","resolution":{"observed_at":"2026-08-15T23:21:12.263047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"cited_work":{"arxiv_id":"2505.15791","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15791","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vard: Efficient and dense fine-tuning for diffusion models with value-based rl","venue":null,"work_id":"2450f629-559d-4b1c-ba76-1b898403c088","year":2025},"citing_paper":{"arxiv_id":"2604.15311","last_updated":"2026-05-03T11:22:04Z","snapshot_observed_at":"2026-08-14T05:02:02.000375Z","submitted_at":"2026-04-16T17:59:56Z","title":"LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T11:23:28.424453Z"},"links":{"cited_paper":"/paper/2505.15791","citing_paper":"/paper/2604.15311"},"observation_digest":"sha256:6dcac2d5d4a0f67b8205856c384a0417f2103819f837a98fdc4c0d866eb7c4bd","observation_id":"ba09d5f4-eef9-4d98-8718-36e276d1a124","resolution":{"observed_at":"2026-05-10T11:25:18.915785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15791/citation-record","integrity":"/paper/2505.15791/integrity","json":"/paper/2505.15791/citation-record.json","paper":"/paper/2505.15791"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:59.034753Z","title":"Atom level enzyme active site scaffolding using rfdiffusion2","venue":null,"work_id":"edc48c3f-f941-43d4-8c76-e9d3a5cbadd0","year":2025},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.040527Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:f5a94116926112896844e22a6cdc470918d5358c943ed83847ef35ac621f6dce","observation_id":"fa398351-ccc8-4599-a4fd-834ab65439bc","resolution":{"observed_at":"2026-08-07T15:18:59.113875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15489","last_updated":"2024-05-24T12:11:41Z","snapshot_observed_at":"2026-08-16T13:49:46.972408Z","submitted_at":"2024-05-24T12:11:41Z","title":"Out of Many, One: Designing and Scaffolding Proteins at the Scale of the Structural Universe with Genie 2","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15489","snapshot_observed_at":"2026-08-07T15:18:53.460195Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:53.460195Z"},"links":{"cited_paper":"/paper/2405.15489","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:2da1b837f8bdf7508d78ce25f0457edbeba612457fb3fb803d62fa46229c274b","observation_id":"d2c7f045-5afd-4730-9113-14e3e8151be9","resolution":{"observed_at":"2026-08-07T15:18:53.460195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:58.216130Z","title":"As referenced in the main text, Table 1 includes metrics from the DRaFT [Clark et al., 2023] and PRDP [Deng et al., 2024] papers","venue":null,"work_id":"5551f9bb-560b-41c7-b3f8-f8e9fe758973","year":2023},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.835558Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:ffcf5e23e7fb050d4e6d7ada9ce1b7528fec4787c1e3f54a3afd0b838ac147d2","observation_id":"5cf8b26f-86a2-47e3-979f-ef5b74fc1802","resolution":{"observed_at":"2026-08-07T15:18:58.325029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08933","last_updated":"2023-02-14T06:45:49Z","snapshot_observed_at":"2026-08-16T19:48:42.861675Z","submitted_at":"2022-10-17T10:49:08Z","title":"DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08933","snapshot_observed_at":"2026-08-07T15:18:52.512770Z","title":"Diffuseq: Sequence to sequence text generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.512770Z"},"links":{"cited_paper":"/paper/2210.08933","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:e9786695cd3da3bda9d7747a15f268f3d660eb9c65cb4c3cda470116d44511f1","observation_id":"74c7321d-08c8-4c1b-aee3-a557fbd4b929","resolution":{"observed_at":"2026-08-07T15:18:52.512770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09281","last_updated":"2019-11-11T14:18:31Z","snapshot_observed_at":"2026-08-14T00:33:35.701152Z","submitted_at":"2019-10-21T12:06:28Z","title":"Dealing with Sparse Rewards in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09281","snapshot_observed_at":"2026-08-07T15:18:52.713790Z","title":"Dealing with sparse rewards in reinforcement learning.arXiv preprint arXiv:1910.09281,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.713790Z"},"links":{"cited_paper":"/paper/1910.09281","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:70fde6025ec57475eac83c463decc2df3148d824d3e14f50fb5483f4164bb63c","observation_id":"3dcc38c7-143c-4d6c-9845-a260871e95c9","resolution":{"observed_at":"2026-08-07T15:18:52.713790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20313","last_updated":"2024-12-11T15:42:13Z","snapshot_observed_at":"2026-08-16T13:47:38.726664Z","submitted_at":"2024-05-30T17:53:50Z","title":"Sequence-Augmented SE(3)-Flow Matching For Conditional Protein Backbone Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20313","snapshot_observed_at":"2026-08-07T15:18:52.921055Z","title":"Sequence-augmented se (3)-flow matching for conditional protein backbone generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.921055Z"},"links":{"cited_paper":"/paper/2405.20313","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:aa44eb9c927b4877b45c785d0c4a32300e74c16500155ff64a3bcbf16a6e56fd","observation_id":"7fb24f74-efbe-459a-ac1b-38278052559d","resolution":{"observed_at":"2026-08-07T15:18:52.921055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15247","last_updated":"2025-03-11T07:55:18Z","snapshot_observed_at":"2026-08-15T18:28:50.241502Z","submitted_at":"2024-11-22T08:00:20Z","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15247","snapshot_observed_at":"2026-08-07T15:18:52.995998Z","title":"org/abs/2411.15247","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.995998Z"},"links":{"cited_paper":"/paper/2411.15247","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:d9352359aa7fe9342621e3280e88535d4fd3fb084f6102460cd3bd6ce56d38a2","observation_id":"007c5f7c-0714-4c6f-bc71-fb2220e2149c","resolution":{"observed_at":"2026-08-07T15:18:52.995998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-07T15:18:53.080608Z","title":"Aligning text-to-image models using human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:53.080608Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:e4b59e050b96a66ceae98ffae9633d7eac62326a855b7df3e1ef98ba2ed3cec5","observation_id":"4c3004c2-7ed9-498e-b5a0-46ebcdb07874","resolution":{"observed_at":"2026-08-07T15:18:53.080608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T15:18:53.255145Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:53.255145Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:88f70bac2c7a0cad9b9bd1b5b5d5e59c9b7b43cd604b8226abcd00233aeca680","observation_id":"d3fe9064-24ba-441b-ba91-6e7565fbe53c","resolution":{"observed_at":"2026-08-07T15:18:53.255145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08252","last_updated":"2024-10-25T02:50:44Z","snapshot_observed_at":"2026-08-16T13:26:12.987371Z","submitted_at":"2024-08-15T16:47:59Z","title":"Derivative-Free Guidance in Continuous and Discrete Diffusion Models with Soft Value-Based Decoding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08252","snapshot_observed_at":"2026-08-07T15:18:53.356102Z","title":"Derivative-free guidance in continuous and discrete diffusion models with soft value-based decoding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:53.356102Z"},"links":{"cited_paper":"/paper/2408.08252","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:f94f9481723ceba5f183bd2e094149c450aa3354b1e024d80ad8361f58b6092f","observation_id":"778a4dbe-3938-45a6-b3fb-84e31e2ff8b8","resolution":{"observed_at":"2026-08-07T15:18:53.356102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T15:18:53.574219Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:53.574219Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:4237877becb27c2baacfc62d546f69ba7868248ee5704a48a0bb59f51a8f128d","observation_id":"60b756a9-3543-4b66-b7a4-8eb2db9f1a9d","resolution":{"observed_at":"2026-08-07T15:18:53.574219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T15:18:53.950021Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:53.950021Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:0fb9f9fca930bc9077f08c975b70c2d1e8af7e6d6e18341f8683a4fb8e056d13","observation_id":"4c18afcc-799a-43ef-be36-8678337ee544","resolution":{"observed_at":"2026-08-07T15:18:53.950021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T15:18:54.458034Z","title":"Ilya Loshchilov and Frank Hutter","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:54.458034Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:c55ad6cfe7993bb27d3158b3b09eabe9d6a05696eba572e83208c05d3c089aee","observation_id":"51d5e71b-3704-4152-86e4-ff4274939898","resolution":{"observed_at":"2026-08-07T15:18:54.458034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-16T03:56:33.383172Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-07T15:18:54.669121Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:54.669121Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:c0737a544a250e01ac874c3efc38e170a66c7372a5fa78aa920d41d2d2b1b0c2","observation_id":"6a317298-8807-4244-bf64-974ce588f354","resolution":{"observed_at":"2026-08-07T15:18:54.669121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01857","last_updated":"2024-06-05T09:00:36Z","snapshot_observed_at":"2026-08-16T17:38:25.517399Z","submitted_at":"2024-03-04T09:13:14Z","title":"Reward Model Learning vs. Direct Policy Optimization: A Comparative Analysis of Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":"2403.01857","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01857","snapshot_observed_at":"2026-08-07T15:18:57.412066Z","title":"Reward Model Learning vs. Direct Policy Optimization: A Comparative Analysis of Learning from Human Preferences","venue":"cs.LG","work_id":"2a3b067c-af97-496a-955c-f5d3f267f262","year":2024},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:54.854896Z"},"links":{"cited_paper":"/paper/2403.01857","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:56774472a9d6acef3d1e529c21189c08024b5caeaf43d40ee08f270f8f1d67d3","observation_id":"927be3ae-e2e6-4ebf-9010-bb91d10dafed","resolution":{"observed_at":"2026-08-07T15:18:57.467666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T15:18:54.989604Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:54.989604Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:b2c2f6d6d432d7b23b357320c61090518a017b8cced2ce42e64ea599f5f5c64b","observation_id":"b9ee0a31-7f21-4c32-99d2-569451a1693a","resolution":{"observed_at":"2026-08-07T15:18:54.989604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14772","last_updated":"2023-05-24T18:17:17Z","snapshot_observed_at":"2026-08-16T15:37:00.716328Z","submitted_at":"2023-04-28T11:33:08Z","title":"Multisample Flow Matching: Straightening Flows with Minibatch Couplings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14772","snapshot_observed_at":"2026-08-07T15:18:55.121823Z","title":"Multisample flow matching: Straightening flows with minibatch couplings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.121823Z"},"links":{"cited_paper":"/paper/2304.14772","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:0fcddf3b53fe9dad1e5f666849647714b5cd8f27806f9c002d527b9a7f70ed0a","observation_id":"9bd3559c-88e7-4184-bfb8-9c50e89dee06","resolution":{"observed_at":"2026-08-07T15:18:55.121823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:18:55.223435Z","title":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.223435Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:da86edf3eaf77656c682d683348e4361e511a5ac8a153116ccf715486fc51807","observation_id":"99439a9f-a924-4e2a-87d4-1a291c60782e","resolution":{"observed_at":"2026-08-07T15:18:55.223435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-14T10:08:59.886019Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T15:18:55.607841Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.607841Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:5a1ac4b3b09429aeb56ab49b86c387de7670024553ddac83913b23c515d402f6","observation_id":"b04cb345-3e1d-490c-a74b-3109af4dde62","resolution":{"observed_at":"2026-08-07T15:18:55.607841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18567","last_updated":"2024-10-16T16:26:16Z","snapshot_observed_at":"2026-08-16T14:14:25.101465Z","submitted_at":"2024-02-28T18:57:56Z","title":"Diffusion Language Models Are Versatile Protein Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18567","snapshot_observed_at":"2026-08-07T15:18:55.707487Z","title":"Diffusion language models are versatile protein learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.707487Z"},"links":{"cited_paper":"/paper/2402.18567","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:2c1680199f7c121459c58b5a8e7eed70917e25cda6149ff9b6adc6f25a3b3f88","observation_id":"4bce29fa-00c9-40b7-b738-d00b81ff2a79","resolution":{"observed_at":"2026-08-07T15:18:55.707487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06481","last_updated":"2025-01-11T08:16:30Z","snapshot_observed_at":"2026-08-16T12:59:12.348159Z","submitted_at":"2025-01-11T08:16:30Z","title":"Focus-N-Fix: Region-Aware Fine-Tuning for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06481","snapshot_observed_at":"2026-08-07T15:18:55.773131Z","title":"Focus-n-fix: Region-aware fine-tuning for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.773131Z"},"links":{"cited_paper":"/paper/2501.06481","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:0b23ac4a2c4236cad48adb1781bcf20a8defa33a6f838afa8e2073fee86a7a5c","observation_id":"1fcef7d8-965e-4abc-b44a-e5aa6c130d7f","resolution":{"observed_at":"2026-08-07T15:18:55.773131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-15T00:38:30.343980Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21059","snapshot_observed_at":"2026-08-07T15:18:55.855992Z","title":"Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.855992Z"},"links":{"cited_paper":"/paper/2412.21059","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:82190a98c9e30267bf52c0780cf18f5004f5080630d44a3f1080456f218ed04a","observation_id":"0aa61977-60da-48fe-9f63-653bd8dbc57c","resolution":{"observed_at":"2026-08-07T15:18:55.855992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02277","last_updated":"2023-05-22T20:51:32Z","snapshot_observed_at":"2026-08-16T15:57:40.633882Z","submitted_at":"2023-02-05T01:47:02Z","title":"SE(3) diffusion model with application to protein backbone generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02277","snapshot_observed_at":"2026-08-07T15:18:56.049830Z","title":"Se (3) diffusion model with application to protein backbone generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.049830Z"},"links":{"cited_paper":"/paper/2302.02277","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:ab692b18fcbeb78225c74ad778118c4e330c7ef419377299d52cc832b7f47232","observation_id":"e1e16925-1af0-4627-bc8c-5cfc916a002e","resolution":{"observed_at":"2026-08-07T15:18:56.049830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07132","last_updated":"2023-04-14T13:51:26Z","snapshot_observed_at":"2026-08-16T15:40:25.240560Z","submitted_at":"2023-04-14T13:51:26Z","title":"Towards Controllable Diffusion Models via Reward-Guided Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07132","snapshot_observed_at":"2026-08-07T15:18:56.162933Z","title":"Towards controllable diffusion models via reward-guided exploration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.162933Z"},"links":{"cited_paper":"/paper/2304.07132","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:1850a2de4dd892f4caa6a3fbe0f0f1595d6a80ee6394906adf9e0d6ecbeeee0c","observation_id":"4316b84d-e748-4dfb-876f-d098d52ab0f4","resolution":{"observed_at":"2026-08-07T15:18:56.162933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:56.295167Z","title":"Large-scale reinforcement learning for diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.295167Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:ab000b8cd88fc51208c10031f0e82572d554122d54f12b9c82593b18df99b1a1","observation_id":"0740abd3-2e50-41dd-81ff-a55d42b6508d","resolution":{"observed_at":"2026-08-07T15:18:56.295167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11312","last_updated":"2023-02-22T11:49:12Z","snapshot_observed_at":"2026-08-16T15:53:34.286638Z","submitted_at":"2023-02-22T11:49:12Z","title":"Behavior Proximal Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11312","snapshot_observed_at":"2026-08-07T15:18:56.424024Z","title":"Behavior proximal policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.424024Z"},"links":{"cited_paper":"/paper/2302.11312","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:d5051b08dc060387963dbc839371b33e81b3a0c19faf72c859ebacf2f1cc574c","observation_id":"5068b278-5f7a-45ef-94e6-75e76d93dd16","resolution":{"observed_at":"2026-08-07T15:18:56.424024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:58.824931Z","title":null,"venue":null,"work_id":"7c09a603-31d2-4f16-ab92-a54c34fe81b5","year":2021},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.551973Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:3846b1c6be16a760190f0020289160630f9f4782e2aee231932b321f952d772e","observation_id":"ecf48c83-7fc8-4538-8f51-18b38d8930e7","resolution":{"observed_at":"2026-08-07T15:18:58.916493Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:58.642598Z","title":"Given these components, the flow matching objective for SO(3) can be formulated as: LSO(3)(θ) = Et∼U (0,1),q(R0,R1),Rt∼ρt(Rt|R0,R1) ∥vθ(t, Rt) − ut(Rt|R0, R1)∥2 SO(3)","venue":null,"work_id":"54a11f12-1547-4ea3-80e3-e5feef162722","year":2023},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.676501Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:4fb36d134a362bdd064712cff25a2cdf1c088203cc7736ee56f600b1ef9e9bf8","observation_id":"0a16a69d-6f85-4532-9735-27775c67e570","resolution":{"observed_at":"2026-08-07T15:18:58.731174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:58.431994Z","title":null,"venue":null,"work_id":"24d5b598-2a66-44ab-b95e-da8c777345c4","year":2023},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.765412Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:c21c8ec6db4b3701188984158d978acf4d1275e13231cb6173de7cb430d531b9","observation_id":"c4c3a304-8b95-48f8-aed2-2517f9ea6ec9","resolution":{"observed_at":"2026-08-07T15:18:58.520325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:18:57.970470Z","title":"Color intensity correlates with η magnitude (darker corresponds to higher values)","venue":null,"work_id":"6e860070-8d64-4d7a-98ce-9ff25407b690","year":1956},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:56.930347Z"},"links":{"citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:2832a67f29abb6feb0afa8cb84f4fa00e9105327e1c05f7c7a17cf444d077003","observation_id":"2c4718b8-dab6-4b0d-8d7b-384c6c591733","resolution":{"observed_at":"2026-08-07T15:18:58.060287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15194","last_updated":"2024-02-28T09:21:46Z","snapshot_observed_at":"2026-08-17T20:42:44.730597Z","submitted_at":"2024-02-23T08:54:42Z","title":"Fine-Tuning of Continuous-Time Diffusion Models as Entropy-Regularized Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15194","snapshot_observed_at":"2026-08-07T15:18:55.480756Z","title":"Fine-tuning of continuous-time diffusion models as entropy-regularized control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.480756Z"},"links":{"cited_paper":"/paper/2402.15194","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:6ace3ad6228e1d3ff1dc05d2eb127670540b5176ed311a70c8979e30c6999e98","observation_id":"638dc0d6-b238-4d53-9b57-91a7984e2bad","resolution":{"observed_at":"2026-08-07T15:18:55.480756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T15:18:55.353442Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:55.353442Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:28dcb21572eb9819db8b9a88dada268036e8e1bac7e36071de9e7bc23214857c","observation_id":"abeef27b-e5a6-4091-b5d6-461eee88ee95","resolution":{"observed_at":"2026-08-07T15:18:55.353442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-07T15:18:54.567472Z","title":"Improve mathematical reasoning in language models by automated process supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:54.567472Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:2f9b91aebb94bc55eca22f574c0e33fe2e73a565fbea0243f89ead58e89ddb79","observation_id":"76dcb53b-f88c-45c0-953d-50265d3b067d","resolution":{"observed_at":"2026-08-07T15:18:54.567472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06000","last_updated":"2024-12-08T17:19:48Z","snapshot_observed_at":"2026-08-16T18:51:44.812129Z","submitted_at":"2024-12-08T17:19:48Z","title":"Does RLHF Scale? Exploring the Impacts From Data, Model, and Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06000","snapshot_observed_at":"2026-08-07T15:18:52.823260Z","title":"Does rlhf scale? exploring the impacts from data, model, and method","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.823260Z"},"links":{"cited_paper":"/paper/2412.06000","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:2d1a2337bb8cf8731809a1aac1c3806671c821072239d9160031c1d5033bb15f","observation_id":"dc7ce98c-5562-40c5-9f55-55aaeec638a8","resolution":{"observed_at":"2026-08-07T15:18:52.823260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:18:52.576998Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.576998Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:882078fa9a81e9ddda58529c0fa6438ba7209f82340f37191374ddd58bd3a76c","observation_id":"a25b8486-174e-4f1d-8625-e5328860af49","resolution":{"observed_at":"2026-08-07T15:18:52.576998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02391","last_updated":"2024-04-11T16:29:12Z","snapshot_observed_at":"2026-08-16T14:55:21.568482Z","submitted_at":"2023-10-03T19:24:24Z","title":"SE(3)-Stochastic Flow Matching for Protein Backbone Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02391","snapshot_observed_at":"2026-08-07T15:18:52.310087Z","title":"Se (3)-stochastic flow matching for protein backbone generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.310087Z"},"links":{"cited_paper":"/paper/2310.02391","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:676f6abcfea9a88868b1c3957eb95886e769e412efca22a55dd85994c058d841","observation_id":"e4f6683b-e3f5-4300-b6ec-303fcbf2bcc3","resolution":{"observed_at":"2026-08-07T15:18:52.310087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08861","last_updated":"2025-01-07T18:12:27Z","snapshot_observed_at":"2026-08-16T13:18:47.535778Z","submitted_at":"2024-09-13T14:22:14Z","title":"Adjoint Matching: Fine-tuning Flow and Diffusion Generative Models with Memoryless Stochastic Optimal Control","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08861","snapshot_observed_at":"2026-08-07T15:18:52.419212Z","title":"Adjoint matching: Fine-tuning flow and diffusion generative models with memoryless stochastic optimal control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.419212Z"},"links":{"cited_paper":"/paper/2409.08861","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:282ed98c708efc023ba35468468a9e79d3c16f764887cd40d232f460514aac59","observation_id":"78702dee-54bf-4302-adf0-977392a625cb","resolution":{"observed_at":"2026-08-07T15:18:52.419212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-07T15:18:52.161793Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:52.161793Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:21d9ceaecf10bb4bb0f262ec24cf140edb33c42bb66b2284421551562e78596f","observation_id":"a473a493-0b83-4763-8618-ad6be55cebf8","resolution":{"observed_at":"2026-08-07T15:18:52.161793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2505.15791."}