{"as_of":"2026-08-09T18:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edd688834796dd7e3e87acefd6e9ac0063c8db95259f6adc6c21ebaa6fb829b9","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:54:32.517155Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05600/citation-record","integrity":"/paper/2608.05600/integrity","json":"/paper/2608.05600/citation-record.json","paper":"/paper/2608.05600"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:33.552569Z","title":"gummy bear zone","venue":null,"work_id":"00ec9c49-268b-459e-ae91-38b5c749c844","year":2001},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.517155Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:413c27bf82a3b676f1a01e019387e48f8510788ebb3b3b3ec156ee88389d6fad","observation_id":"74a6c8e8-bd8b-4f2a-982b-e23e62c00a24","resolution":{"observed_at":"2026-08-08T05:54:33.556213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.442334Z","title":"Densegrpo: From sparse to dense reward for flow matching model alignment.arXiv preprint arXiv:2601.20218,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.442334Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:4af947c818973faeae423213da65afba5b630f376ffee329b252a655f9c4d21b","observation_id":"78cdb6ac-7061-47d1-9ffd-515270f00c1b","resolution":{"observed_at":"2026-08-08T05:54:32.442334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-08T05:54:32.463629Z","title":"Aligning text-to-image models using human feedback.arXiv preprint arXiv:2302.12192,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.463629Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:afcff402580b6a85c96d26229a9ac233b7208ad3397893e8850c1243c2a76892","observation_id":"2fbb39f5-cce6-4cdc-a516-4e2205c87a32","resolution":{"observed_at":"2026-08-08T05:54:32.463629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-08T05:54:32.466927Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.466927Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:f7f67b0aa74a0355f5d1200430e46378a0270877a2cf9c06058c5cee618f0d06","observation_id":"450e6ffc-4d27-4f86-a1e8-d3b8f04101f0","resolution":{"observed_at":"2026-08-08T05:54:32.466927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.29526","last_updated":"2026-06-28T17:40:02Z","snapshot_observed_at":"2026-08-07T14:47:08.995838Z","submitted_at":"2026-06-28T17:40:02Z","title":"The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2606.29526","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.29526","snapshot_observed_at":"2026-08-08T05:54:33.173651Z","title":"The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning","venue":"cs.LG","work_id":"baca503c-8ec7-461d-a8bf-f1da7fa36006","year":2026},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.470552Z"},"links":{"cited_paper":"/paper/2606.29526","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:de792268022287c9b0f0540ef779b72d87b5b270ca5d8a1a9215a89139184499","observation_id":"39601ea0-7e1a-4235-846f-40869afebf2c","resolution":{"observed_at":"2026-08-08T05:54:33.179122Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-08T05:54:32.473890Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.473890Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:2acf8e926fcdb0e8b38ec89ff82c3bafd3d1c84ba14ee76ab9a3d6cc8b239295","observation_id":"d6aae682-450c-4d2e-ba33-86b016b218f8","resolution":{"observed_at":"2026-08-08T05:54:32.473890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-08T05:54:32.477285Z","title":"Flow-grpo: Training flow matching models via online rl.Ad- vances in neural information processing systems, 38:40783–40818, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.477285Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:52129d5eac9c0979c470114a12d2beee47660e988c68e959d2d59d5e376161e4","observation_id":"4a6fcdf9-3da1-4cfb-be82-b81ba54369fa","resolution":{"observed_at":"2026-08-08T05:54:32.477285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.480506Z","title":"De- feating the training-inference mismatch via fp16.arXiv preprint arXiv:2510.26788,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.480506Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:ee40c34d00d9cbbdb786f67b27efad9456398dbb9bc730565a7e0bdc59993732","observation_id":"a895c95e-2f21-4848-8a64-1fc62b7c9d19","resolution":{"observed_at":"2026-08-08T05:54:32.480506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18150","last_updated":"2026-04-10T15:41:56Z","snapshot_observed_at":"2026-08-02T16:35:13.446446Z","submitted_at":"2026-01-26T05:12:05Z","title":"FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18150","snapshot_observed_at":"2026-08-08T05:54:32.483595Z","title":"Fp8-rl: A practical and stable low-precision stack for llm reinforcement learning.arXiv preprint arXiv:2601.18150,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.483595Z"},"links":{"cited_paper":"/paper/2601.18150","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:9ba39b07aa55724a56bb78c110c120b236cc58913dfdb9fd01aaf17061c2dd82","observation_id":"01be9f98-9d40-457e-a09f-925b05f97ef0","resolution":{"observed_at":"2026-08-08T05:54:32.483595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-08T05:54:32.486891Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020a","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.486891Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:17311fc1d805b49e59d976c762a71f1e64ea679bd8afc9b99830a0a4c54e10ef","observation_id":"df2b5a68-f02e-4db3-8dcd-f24c8368982e","resolution":{"observed_at":"2026-08-08T05:54:32.486891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-08T05:54:32.490246Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.490246Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:ac11e2bdfcaa83373a3a7f0f196e970d907e84d245b5d2907703ded2998363b0","observation_id":"ffec1e08-447d-4820-9eec-013ba5787803","resolution":{"observed_at":"2026-08-08T05:54:32.490246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.493575Z","title":"Coefficients-preserving sampling for reinforcement learning with flow matching.arXiv preprint arXiv:2509.05952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.493575Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:1e1caa946eb6ab396c12e6835379d8c3ae197cc25b8588c5c29c22d60c4cdd55","observation_id":"b1c50b50-82fb-400b-8672-fe18ad1f0ac3","resolution":{"observed_at":"2026-08-08T05:54:32.493575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-08T05:54:32.497114Z","title":"No more train-inference mismatch: Bitwise consistent on-policy reinforcement learning with vllm and torchtitan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.497114Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:19b33d0a666a430c1b58eda1cdea6ec61f3e93ccd322288146516f1b4a5c3ecd","observation_id":"b1244178-d0ff-4c5a-ba0b-e271f9ac3452","resolution":{"observed_at":"2026-08-08T05:54:32.497114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.500748Z","title":"Human preference score: Better aligning text-to-image models with human preference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.500748Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:9aa06e333c02f2f96e1054bf7d3d1c81201f3aa141dcdc9761cde67ff4ce9960","observation_id":"4770d7fa-9cce-4846-bb3b-8e84ac3e9d15","resolution":{"observed_at":"2026-08-08T05:54:32.500748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-08T05:54:32.503814Z","title":"Dancegrpo: Unleashing grpo on visual generation.arXiv preprint arXiv:2505.07818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.503814Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:095361d0fec76470b1d87bad542df949f84cc85b9d94861c466ad7a25024657b","observation_id":"e0be788b-bf4b-4f9e-9ba9-d24a224a7464","resolution":{"observed_at":"2026-08-08T05:54:32.503814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:33.562668Z","title":"Your efficient rl framework secretly brings you off-policy rl training, august 2025.URL https://fengyao","venue":null,"work_id":"72f49304-93c9-4270-baa2-5b3bbca67fa8","year":2025},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.507119Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:889de337579949365df916813cfb9fa966e2c18ddf9062555ab5288bcfbcfdf9","observation_id":"fbb1a55c-c91a-40e9-b85b-18c7e94a1d49","resolution":{"observed_at":"2026-08-08T05:54:33.566447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16117","last_updated":"2026-02-16T17:14:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-19T16:09:33Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16117","snapshot_observed_at":"2026-08-08T05:54:32.510791Z","title":"Diffusionnft: Online diffusion reinforcement with forward process.arXiv preprint arXiv:2509.16117,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.510791Z"},"links":{"cited_paper":"/paper/2509.16117","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:e9a69a84c19d06c9a817cf04e286cdcf62f314e51e5f5e3e39f170375d8d6794","observation_id":"2ccab37e-fedb-4b16-9eb7-fd2b44e3b0df","resolution":{"observed_at":"2026-08-08T05:54:32.510791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.514207Z","title":"Manifold-aware exploration for reinforcement learning in video generation.arXiv preprint arXiv:2603.21872,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.514207Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:dff69dd848e60cc858af46eb213c485787f25c5240b375ce22c7a36b20385db9","observation_id":"01ea36d9-80b1-401b-84a9-299eca4b0bae","resolution":{"observed_at":"2026-08-08T05:54:32.514207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.430935Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.430935Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:35dc2a267373cf03872c34e70c05bb96ec672be290cf9e5a9aef92c4d4e1adeb","observation_id":"6d317bed-9a7a-45c7-b002-0db3326cc03c","resolution":{"observed_at":"2026-08-08T05:54:32.430935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-08T05:54:32.459894Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.459894Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:556fb3495c6a09eafb6610636f80cc17ba8bba55ae898332487f8737da26540c","observation_id":"566e7546-1251-4838-9300-bbc11ddd74d9","resolution":{"observed_at":"2026-08-08T05:54:32.459894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.445788Z","title":"Treegrpo: Tree-advantage grpo for online rl post-training of diffusion models.arXiv preprint arXiv:2512.08153,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.445788Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:3e61a320aa07e0461976f3d0b21d6697946f21c001181cf410fd80bd685e344d","observation_id":"16dac972-a554-4a30-9948-9036c2d111f4","resolution":{"observed_at":"2026-08-08T05:54:32.445788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.438659Z","title":"Directly fine-tuning diffusion models on differentiable rewards","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.438659Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:14901738227298b7780b6286caf81164f1c7de7ef08f59ec73cc9f675fa9049c","observation_id":"5c179457-288b-4b1c-a484-f93c36261d2e","resolution":{"observed_at":"2026-08-08T05:54:32.438659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14743","last_updated":"2024-10-15T19:37:51Z","snapshot_observed_at":"2026-08-04T04:06:24.551238Z","submitted_at":"2024-04-23T04:51:02Z","title":"Gradient Guidance for Diffusion Models: An Optimization Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14743","snapshot_observed_at":"2026-08-08T05:54:32.453132Z","title":"Gradient guidance for diffusion models: An optimization perspective.arXiv preprint arXiv:2404.14743,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.453132Z"},"links":{"cited_paper":"/paper/2404.14743","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:f38c1c5beee1d7931cb101bab3e56e4f0987a606d39b827a5b014bc679afa65f","observation_id":"8f03720c-298e-4372-b1a4-20b858522778","resolution":{"observed_at":"2026-08-08T05:54:32.453132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14687","last_updated":"2024-05-20T04:23:45Z","snapshot_observed_at":"2026-08-03T03:59:22.374270Z","submitted_at":"2022-09-29T11:12:27Z","title":"Diffusion Posterior Sampling for General Noisy Inverse Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14687","snapshot_observed_at":"2026-08-08T05:54:32.434813Z","title":"Diffusion posterior sampling for general noisy inverse problems.arXiv preprint arXiv:2209.14687,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.434813Z"},"links":{"cited_paper":"/paper/2209.14687","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:956fe51bc902a47c1c5e80eafc74acc557e23290cb54c9f711874cae87a1dca1","observation_id":"e3072153-392b-4d9c-9309-5c258da56e75","resolution":{"observed_at":"2026-08-08T05:54:32.434813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-08T05:54:32.449343Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment.arXiv preprint arXiv:2304.06767,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.449343Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:d60c0a18f740066d2386b4b2ced23a64d93873d5059e0ffbb0f1b2aef8ba78c4","observation_id":"25164c7e-f160-4a02-9bfe-9ea5ab4f88b4","resolution":{"observed_at":"2026-08-08T05:54:32.449343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:32.456777Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:32.456777Z"},"links":{"citing_paper":"/paper/2608.05600"},"observation_digest":"sha256:cd6fb7e3f47b1fbaf8238659506bc5c5de680da8067d3e92298f81859f90c8c9","observation_id":"357a86b0-f2f5-4465-b63e-091143c5efd5","resolution":{"observed_at":"2026-08-08T05:54:32.456777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05600","last_updated":"2026-08-06T04:47:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T18:11:19.196347Z","submitted_at":"2026-08-06T04:47:57Z","title":"LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2608.05600."}